Een IETF Internet-Draft van 25 september 2026 stelt een JSON-gebaseerd, hash-gekoppeld audittrailformaat voor autonome AI-agents voor, met registratie vóór een actie en een onafhankelijke recorder, maar blijft een werkdocument en geen aangenomen standaard. Betrouwbare reconstructie vereist dat u uitvoeringsfeiten, bewijsrelaties en redeneerprovenance afzonderlijk vastlegt.
Wat stelt de nieuwe IETF Internet-Draft over audittrails voor autonome AI-agents precies voor?
De werkversie draft-sharif-agent-audit-trail-05 van de Internet Engineering Task Force beschrijft een vast formaat om vast te leggen welke agent, onder welke versie en met welke autorisatie, een actie uitvoerde. Het document is uitdrukkelijk een Internet-Draft en moet als work in progress worden gelezen: het is geen vastgestelde standaard en geen bewijs van naleving.
Het voorstel gaat verder dan gewone telemetrie. De belangrijkste onderdelen:
- Agentidentiteit en sessies: welke agent, welke versie, welke sessie en welk trust level.
- Registratie vóór de actie: een record dat ontstaat voordat een agent handelt, niet pas erna.
- Hash chaining: records worden cryptografisch aan elkaar geketend, zodat achteraf wijzigen zichtbaar wordt.
- Een onafhankelijke recorder: een component buiten het agentproces die de gebeurtenissen vastlegt.
- Reconstructie na onderbreking: zogenoemde prior-generation tails om een keten na een storing weer aan elkaar te knopen.
Waarom is logging vooraf iets anders dan logging achteraf, en waarom kan één logtype niet alles reconstrueren?
Achteraf vastleggen wat een agent deed, bewijst niet dat er vóór die actie een autorisatie- of beleidscontrole bestond. Dat is precies waarom het onderscheid tussen pre-execution en post-execution records in de conceptnorm ertoe doet: een record dat vóór de handeling ontstaat, laat zien dat de controle plaatsvond toen het nog kon ingrijpen, niet dat ze er met terugwerkende kracht bij werd geschreven.
De academische literatuur wijst op een tweede grens. Naar onze lezing van de bronnen zijn er drie reconstructieniveaus die elkaar aanvullen en niet uit één logtype volgen:
- Uitvoeringsfeiten: agentversie, tool call, uitkomst en sessievolgorde. De survey From Agent Traces to Trust van onderzoekers op arXiv stelt dat het eindantwoord alleen niet verklaart hoe een agent tot een uitkomst kwam.
- Bewijsrelaties: welke bronnen, welk geheugen en welke tool-responses een handeling ondersteunden. Dezelfde survey beschrijft deze als een getypeerde graaf van relaties tussen handeling en bewijs.
- Redeneerprovenance: intent, observatie, inferentie, planwijziging en delegatie. De paper Reasoning Provenance for Autonomous AI Agents stelt expliciet dat deze provenance niet betrouwbaar uit bestaande execution traces kan worden gereconstrueerd.
Het gevolg dat in geen van de bronnen hardop wordt uitgesproken, benoemen wij hier als redactionele conclusie: wie alleen bestaande traces bewaart, kan een sessie technisch naspelen zonder ooit te kunnen aantonen waarom de agent een bepaalde actie koos. Dat gat moet apart worden vastgelegd of het bestaat niet.
Welke grenzen heeft dit bewijs, en wat blijft onaantoonbaar?
Hash chaining detecteert of records achteraf zijn gewijzigd, maar het bewijst niet dat de recorder álle gebeurtenissen heeft gezien. Een onvolledige keten die intern klopt, oogt betrouwbaar en is dat niet. De paper NovaFabric over tamper-evident, afspeelbare uitvoeringscapsules is op dit punt eerlijk: de evidence capture is niet volledig, nagebootste replay vervangt externe tool-responses niet automatisch, en de garanties gelden alleen binnen een expliciet vertrouwde rekenbasis.
Naar onze inschatting volgt daaruit een nuchtere les. Drie dingen blijven onaantoonbaar zolang u ze niet zelf organiseert:
- Of de recorder volledig was, in plaats van alleen intern consistent.
- Of een afgespeelde sessie de werkelijke externe effecten reproduceert, of alleen de modelstappen.
- Of een reconstrueerbare beslissing ook een juiste beslissing was. Reconstructie is geen rechtvaardiging.
Wat betekent dit voor bestuurders, juristen en CISO's die met gevoelige informatie werken?
Onze analyse: omdat een onafhankelijke recorder buiten het agentproces in de conceptnorm centraal staat, kan een logbestand dat de agent over zichzelf bijhoudt zijn bewijswaarde verliezen zodra die agent zelf faalt of wordt gemanipuleerd; daarom adviseren wij dat een CISO per autonome werkstroom beoordeelt of de registratie fysiek en organisatorisch moet worden gescheiden van het systeem dat ze vastlegt. Omdat registratie vóór de actie aantoont dat een autorisatie- of beleidscontrole bestond toen ze nog kon ingrijpen, is een log dat pas na afloop wordt geschreven voor een jurist zwakker bewijs; daarom verdient het aanbeveling om in contracten met leveranciers een pre-action autorisatierecord met agentversie en modelidentiteit als leveringseis op te nemen. Onze analyse: omdat reasoning provenance volgens het onderzoek niet betrouwbaar uit gewone traces valt af te leiden, kan een bestuurder achteraf mogelijk niet overtuigend uitleggen waarom een agent handelde als intent, planwijziging en delegatieketen niet apart zijn vastgelegd; daarom moet de verantwoordelijke voor een risicovolle werkstroom nu beslissen welke van de drie niveaus hij bewaart, in plaats van aan te nemen dat één systeem alles dekt. Omdat hash chaining wel wijziging maar geen volledigheid aantoont, blijft het risico bestaan dat een cruciale gebeurtenis simpelweg nooit is opgenomen; daarom hoort een periodieke integriteits- en volledigheidscontrole van de keten tot de vaste controles, niet tot een eenmalige acceptatietest.
Als samenvatting van die analyse: een werkbaar minimum om een autonome AI-handeling later te kunnen verantwoorden omvat een onafhankelijke recorder, versie- en modelidentiteit, een autorisatierecord vóór de actie, de gebruikte data- en tooltoegang, de bewijsrelaties, de menselijke escalaties, de onderbrekingen en een controle op de integriteit van de keten. Dat sluit aan op eerder werk over het per actie vastleggen van mandaat, verantwoordelijke en herstel, over het geven van een eigen identiteit met gelogde autorisatie en over least privilege als runtime-controle. Wie dieper in de beheersing van agents wil, vindt meer in ons overzicht over agentic AI en de beheersing van AI-agents.
De nieuwswaarde blijft de conceptnorm en de inhoudelijke verschuiving die eruit spreekt: van veranderlijke observability naar controleerbaar uitvoeringsbewijs. Maar zolang het document een werkversie is, is het een richting, geen keurmerk. Wie het nu overneemt, doet dat als eigen governance-keuze, niet als naleving van een vastgestelde standaard.
Bronnen en referenties
- Agent Audit Trail: A Standard Logging Format for Autonomous AI Systems, draft-sharif-agent-audit-trail-05
- From Agent Traces to Trust: A Survey of Evidence Tracing and Execution Provenance in LLM Agents
- Reasoning Provenance for Autonomous AI Agents: Structured Behavioral Analytics Beyond State Checkpoints and Execution Traces
- NovaFabric: Tamper-Evident, Replayable Evidence for Autonomous AI Agent Runs
Bronnen: Het artikel steunt op de IETF Internet-Draft draft-sharif-agent-audit-trail-05 en op drie arXiv-publicaties over evidence tracing, reasoning provenance en tamper-evidente afspeelbaarheid van AI-agentuitvoeringen.