Behandel embeddings als een verwerking van persoonsgegevens, niet als anonieme opslag: recent onderzoek toont dat embeddings herleidbaar zijn naar de brontekst. Beperk wat u embedt, scan geëxporteerde vectoren op verborgen persoonsgegevens, beperk toegang en bewaartermijnen en leg verwijdering of her-embedding aantoonbaar vast.
De aanleiding is concreet. IronCore Labs kondigde eind juni 2026 VectorLens aan, een tool waarmee beveiligingsteams geëxporteerde embeddings lokaal kunnen scannen op verborgen persoonsgegevens in vectordatabases, inclusief onbeheerde of achtergebleven vectoren. De boodschap achter zo'n product is voor privacyprofessionals relevanter dan de tool zelf: het idee dat gegevens na embedding "weg" zijn, houdt geen stand. Wie met vertrouwelijke dossiers werkt, moet de embeddinglaag als onderdeel van de gegevensverwerking behandelen.
Kunnen embeddings echt persoonsgegevens bevatten die te herleiden zijn?
Ja, en dat is niet louter theoretisch. Een embedding is een numerieke weergave van tekst, maar die weergave is geen willekeurige hash. Onderzoekers laten zien dat embeddings via zogeheten embedding inversion teruggerekend kunnen worden naar de oorspronkelijke tekst. In de arXiv-paper Does Vec2Text Pose a New Corpus Poisoning Threat? tonen de auteurs dat het reconstrueren van brontekst uit vectoren bovendien corpus-poisoning-aanvallen tegen dense retrievers kan versterken.
Voor de praktijk betekent dit twee dingen. Ten eerste: als de brontekst persoonsgegevens bevat, kan de embedding een benaderende kopie daarvan bevatten. Ten tweede: een vectordatabase is niet alleen een privacyrisico bij lekken, maar ook een aanvalsoppervlak dat gemanipuleerd kan worden. Naar onze inschatting is de meest voorkomende denkfout dat teams embeddings als anonieme afgeleiden beschouwen, terwijl ze feitelijk een gecomprimeerde versie van de inhoud zijn.
Wat betekent de EDPB-opinie over AI-modellen voor mijn vectordatabase?
De European Data Protection Board stelt in Opinion 28/2024 dat de ontwikkeling en inzet van AI-modellen persoonsgegevens kan omvatten, dat verwerkingsverantwoordelijken rechtmatige verwerking en verantwoording moeten kunnen aantonen, en dat anonimiteit per geval bewezen moet worden in plaats van aangenomen. De EDPB noemt daarbij expliciet webscraping, uitvoerfilters en documentatie als relevante waarborgen.
Doorgetrokken naar embeddings betekent dit: u kunt niet stellen dat vectoren automatisch anoniem zijn. Als brontekst met persoonsgegevens in de vectordatabase belandt, valt die verwerking binnen de reikwijdte die de EDPB beschrijft. Dat vraagt om aantoonbaarheid: kunt u laten zien wat er is geëmbed, waar het staat en of het herleidbaar is? Onze redactionele lezing is dat de opinie de vectordatabase feitelijk in de AVG-levenscyclus trekt, ook al noemt het document embeddings niet met zoveel woorden. Wie de verantwoordelijkheden per fase wil beleggen, vindt in de uitwerking van de AVG-verantwoordelijkheden per fase van uw AI-workflow een bruikbaar raamwerk, en het bredere themahub over AI-privacy en AVG bundelt aangrenzende vraagstukken.
Welke controles zet ik in om verborgen persoonsgegevens in embeddings te vinden en te verwijderen?
De praktische kern van dit artikel: behandel de embeddinglaag als een eigen verwerking met eigen controles. Wij adviseren, als redactionele interpretatie op basis van de genoemde bronnen, een controleset die de volledige levenscyclus dekt.
- Embedding-minimalisatie: bepaal vooraf welke velden en documentdelen überhaupt geëmbed worden en houd persoonsgegevens waar mogelijk uit de brontekst. Dit sluit aan bij het principe van dataminimalisatie dat ook in het privacybeleid van aanbieders terugkomt.
- Export-en-scan-controles: exporteer embeddings periodiek en scan ze op herleidbare persoonsgegevens, inclusief vectoren die niet meer aan een bekend dossier gekoppeld zijn. Dit is precies het gat dat IronCore Labs met VectorLens adresseert.
- Toegangscontrole: beperk wie de vectorstore kan uitlezen of exporteren, want inversie werkt alleen als iemand bij de vectoren kan.
- Bewaartermijnen: koppel embeddings aan retentiegrenzen in plaats van ze onbeperkt te laten staan. Anthropic beschrijft in zijn privacybeleid voor consumentendiensten principes als korte bewaartermijnen, gescheiden loggegevens en expliciete datastromen; dezelfde logica laat zich vertalen naar prompts, chunks en embeddings.
- Gedocumenteerde verwijdering of her-embedding: leg vast hoe u een vector verwijdert of opnieuw genereert wanneer brongegevens gecorrigeerd of gewist moeten worden, zodat een verwijderverzoek ook de vectorlaag raakt.
Een aanvullende beslissing is waar u embeddings genereert en bewaart. Wie afweegt of dat lokaal of in de cloud moet, vindt een concrete auditaanpak in onze uitleg over het lokale versus cloud-AI per werkstroom auditen. Een tweede beslissing zit aan de bron: als gevoelige waarden nooit in leesbare vorm de embeddinglaag bereiken, verkleint u het inversierisico structureel. In dit licht is een architectuur die sensitieve documentwaarden vóór AI-verwerking vervangt door synthetische, sessiegebonden equivalenten op EU-infrastructuur relevant. De anonimisering vóór verwerking met de Semantic Privacy Shield van Vera is zo opgezet dat alleen geanonimiseerde inhoud wordt doorgestuurd; mislukt de privacycontrole, dan wordt het document niet doorgestuurd. Dat verkleint wat er te embedden en te reconstrueren valt, maar het eindoordeel over welke gegevens gevoelig zijn, blijft bij u.
Hoe past dit in de bredere beveiliging van mijn AI-pijplijn?
Embeddings staan niet los van de rest van de pijplijn. Hugging Face beschreef in juli 2026 in een technische reconstructie van een frontier-lab-inbraak hoe zwakke plekken in datasets en pijplijnen aanvallers toegang gaven tot interne systemen. Die casus gaat niet specifiek over embeddings, maar onderstreept het bredere punt: zodra AI-verwerkingslagen interne artefacten blootleggen, kunnen aanvallers erdoorheen bewegen. Een vectorstore vol herleidbare persoonsgegevens is precies zo'n artefact.
Onze conclusie, als redactionele analyse: de vectordatabase laat privacy niet verdwijnen, ze comprimeert die alleen. De juiste vraag is niet of embeddings persoonsgegevens bevatten, maar of u kunt aantonen wat erin zit, wie erbij kan en hoe u het verwijdert. Wie ook prompts als persoonsgegevens wil behandelen, vindt daarvoor een aansluitende aanpak in onze analyse over prompts behandelen als persoonsgegevens in AI-workflows. De controles hierboven zijn geen sluitende garantie, maar wel de basis om de embeddinglaag beheersbaar en aantoonbaar te maken.
Bronnen en referenties
- Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI models
- Does Vec2Text Pose a New Corpus Poisoning Threat?
- IronCore Labs Launches VectorLens to Help Security Teams Find Hidden PII in AI Vector Embeddings
- Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident
- Anthropic Privacy Policy (Consumer Services)
Bronnen: Het artikel steunt op Opinion 28/2024 van de EDPB, de arXiv-paper over Vec2Text en corpus poisoning, de VectorLens-aankondiging van IronCore Labs, de inbraakreconstructie van Hugging Face en het privacybeleid van Anthropic.