De Europese ontwerpnorm prEN 18229-1 structureert AI-eventlogging, maar bepaalt geen universele bewaartermijnen en schrijft geen concrete hallucinatiedetectie voor. Organisaties moeten zelf claimcontrole op claimniveau inrichten, bewijs en beslissingen loggen, en per logcategorie een risicogebaseerde retentie kiezen op basis van EU AI Act, AVG en incidentrisico.
Op 17 juli 2026 publiceerde het Slovenian Institute for Standardization de ontwerpnorm oSIST prEN 18229-1:2026, AI trustworthiness framework – Part 1: Logging. Het gaat om een ontwerpnorm die terminologie, eisen en richtlijnen voor de eventlogging van AI-systemen beschrijft. Volgens de Europese standaardenrepository STANDICT verkeerde de norm in september 2026 nog in een goedkeurings- of consultatiefase en is zij geen definitieve, bindende standaard. De praktische consequentie: de norm helpt bepalen wat je logt, maar de controle op de juistheid van AI-antwoorden en de bewaartermijnen moet je zelf invullen aan de hand van andere kaders, zoals de EU AI Act (Verordening (EU) 2024/1689) en de Algemene verordening gegevensbescherming (AVG).
Wat moet een AI-eventlog volgens prEN 18229-1 in de praktijk vastleggen?
De ontwerpnorm behandelt logging als een afzonderlijk onderdeel binnen het AI trustworthiness framework. Een bruikbaar eventlog bewijst meer dan dat er een antwoord verscheen. Naar onze inschatting zijn dit de velden die een governancelog voor een gevoelige workflow moet verbinden:
- welk model en welke modelversie actief waren bij het genereren van het antwoord;
- welke invoer, prompt en bronnen zijn gebruikt;
- welke afzonderlijke claims uit het antwoord zijn gecontroleerd;
- welke waarschuwingen, anomalieën of onzekerheden ontstonden;
- wie de verificatie uitvoerde en welke governancebeslissing daarop volgde;
- de tijdstempel, de wijzigingsreden en de goedgekeurde versie.
Het loskoppelen van deze velden maakt een reconstructie mogelijk. Zonder claim- en besliscontext blijft een log een verzameling losse antwoorden zonder aantoonbare keten. In onze themahub over AI-governance en controleerbaarheid komt dat onderscheid tussen registratie en verantwoording vaker terug.
Welke bewaartermijnen gelden er voor AI-logs onder EU AI Act en AVG?
De ontwerpnorm zelf legt geen universele bewaartermijn vast, en het zou onjuist zijn om die uit prEN 18229-1 af te leiden. De norm structureert de eventlogging; de bewaartermijn per logcategorie volgt uit andere kaders. Naar onze inschatting bepalen de volgende factoren hoe lang je een specifieke logcategorie bewaart:
- toepasselijke wetgeving en sectorregels, waaronder de logbewaareisen voor hoogrisicosystemen uit de EU AI Act (Verordening (EU) 2024/1689);
- het doel waarvoor het log is aangelegd en de doelbinding daarvan;
- het incidentrisico en de kans dat een gebeurtenis later moet worden herzien;
- privacy-eisen uit de AVG, waaronder dataminimalisatie voor logs met persoonsgegevens.
De praktische keuze is dus geen enkel getal, maar een classificatie per categorie. Prestatie-metingen, modelbeslissingen, waarschuwingen en verificatie-uitkomsten kunnen verschillende termijnen krijgen. Wie menselijke controle bij een hoogrisicobesluit wil kunnen aantonen, houdt de besliscontext langer beschikbaar; daarover schreven we eerder over het aantonen van menselijke controle bij AI-besluiten via logging.
Hoe werkt hallucinatiedetectie op claimniveau in AI-systemen?
De academische literatuur laat zien dat detectie betrouwbaarder wordt wanneer je een antwoord opsplitst in atomische, verifieerbare claims en die apart toetst. In het onderzoek FactScore, gepubliceerd via de Association for Computational Linguistics, verloopt die controle in vier stappen: claimdecompositie, bewijs vinden, bewijs beoordelen en de precieze hallucinatielocatie bepalen. Dat maakt het mogelijk niet alleen te weten dat een antwoord fout is, maar ook waar.
De studie MARCH: Multi-Agent Reinforced Check for Hallucination, eveneens via de Association for Computational Linguistics, benadrukt dat de checker de claims onafhankelijk moet toetsen zonder het oorspronkelijke antwoord als uitgangspunt te nemen. De studie benoemt confirmation bias bij systemen waarin een model zijn eigen output beoordeelt. Naar onze inschatting is dit de kern die prEN 18229-1 openlaat: de norm structureert eventlogging, maar de scheiding tussen genereren en controleren moet je zelf organiseren met methoden als MARCH en FactScore. Een gelaagde aanpak werken we uit in onze analyse over de gelaagde verificatieworkflow tegen hallucinaties.
Een tweede waarschuwing komt uit het onderzoek Detecting Hallucinations in Authentic LLM–Human Interactions. Die studie introduceert AuthenHallu, gebaseerd op echte mens-modeldialogen, en rapporteert dat standaard-LLM's als detectoren in realistische situaties nog onvoldoende presteren. Prestaties op kunstmatige benchmarks gelden dus niet automatisch voor echte FAQ-interacties. Domeinrisico en menselijke escalatie blijven onderdeel van het proces.
Welke governancestappen volgen na het verifiëren van een AI-FAQ?
Een geverifieerde FAQ is naar onze inschatting geen eindpunt maar een versieerbaar governance-object. De volgende stappen sluiten aan op de logvelden uit prEN 18229-1 en op de claimcontrole uit het onderzoek:
- markeer de FAQ als bevestigd, onzeker, gecorrigeerd of ingetrokken;
- bewaar de gebruikte bronpassages en de detectiescores per claim;
- stuur onzekere of tegenstrijdige claims naar een bevoegde menselijke reviewer;
- keur de nieuwe versie formeel goed voordat publicatie volgt;
- registreer de wijzigingsreden, de verantwoordelijke, de modelversie en de datum;
- publiceer pas met versienummer en plan periodieke herverificatie bij gewijzigde bronnen, beleid of modellen.
Het controleren van de onderliggende verwijzingen hoort daarbij; dat proces beschreven we in AI-citaties controleren in drie stappen. De rode draad: de combinatie van de Europese loggingontwikkeling en de recente detectiestudies verschuift het uitgangspunt van AI heeft geantwoord naar een aantoonbare keten van gebeurtenis, bewijs, oordeel en governanceactie.
Bronnen en referenties
- oSIST prEN 18229-1:2026 - AI trustworthiness framework - Part 1: Logging
- AI trustworthiness framework - Part 1: Logging (CEN/CENELEC prEN 18229-1)
- MARCH: Multi-Agent Reinforced Check for Hallucination
- Detecting Hallucinations in Authentic LLM–Human Interactions
- FactScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation
Bronnen: Het artikel steunt op de ontwerpnorm prEN 18229-1 van SIST en STANDICT en op onderzoek van de Association for Computational Linguistics (MARCH, AuthenHallu en FactScore).