Goede pseudonimisatie draait niet alleen om techniek, maar ook om context. Woorden kunnen namelijk meerdere betekenissen hebben. Denk aan woorden als Ben of Wil. Is dat een persoonsnaam of een werkwoord? Voor mensen is dat vaak eenvoudig te herkennen, voor een model niet altijd.
Daarom is het vanaf nu mogelijk om in de Privacytool te kiezen uit twee verschillende modellen voor pseudonimisatie. Naast het bestaande regelgebaseerde model is nu ook een machine learning model beschikbaar.
Het regelgebaseerde model werkt op basis van vaste regels en lijsten, zoals voornamen en locaties. Dat maakt het snel en efficiënt: tienduizenden regels tekst kunnen in enkele minuten worden verwerkt. Het machine learning model kijkt juist naar patronen en context in de tekst. Daardoor kan het in sommige situaties nauwkeuriger pseudonimiseren, al kost dit meer verwerkingstijd. Welke keuze het beste past, hangt af van je dataset en je doel. Daarom bepaal je als gebruiker zelf welk model je inzet.
Pseudonimisatie blijft daarbij mensenwerk en maatwerk. Er zijn geen vastgestelde richtlijnen die bepalen hoe goed pseudonimisatie precies moet zijn. Bovendien zijn teksten vaak niet perfect geschreven, waardoor pseudonimiseren met elk model een uitdaging wordt. Daarom blijft Carmenda onderzoeken hoe de verschillende modellen presteren op datasets over mensen met een verstandelijke beperking. Op basis van die resultaten kiezen we welke modellen we aanbieden in de Privacytool.
Met deze uitbreiding krijg je meer regie over de manier waarop je data pseudonimiseert, terwijl de Privacytool blijft doen waar hij voor bedoeld is: zoveel mogelijk privacygevoelige gegevens herkennen en beschermen. Denk aan namen, locaties, datums, e-mailadressen, telefoonnummers, organisaties en andere informatie die direct of indirect naar personen kan leiden.
Ben je benieuwd wat de Privacytool voor jouw organisatie kan betekenen? Vraag dan hieronder een demo aan. Heb je vragen over de Privacytool? Neem dan gerust contact met ons op.