Blog

Bewijsgerichte hallucinatiedetectie: hoe AWS, Collibra en TrustScale claims runtime toetsen

Hallucinatiedetectie wordt in 2026 bewijsgericht en runtime-gebonden. AWS, Collibra en TrustScale tonen vier methodefamilies, maar onafhankelijke evaluatie

· Door

Bovenaanzicht van een bureau met een geprinte pagina waarop losse zinnen zijn omcirkeld en met pijlen verbonden aan aparte gedrukte bronvellen.
Bewijsgerichte hallucinatiedetectie splitst een antwoord op in losse claims en toetst elke claim afzonderlijk aan een bron of regel.Beeld: IamVera.ai — originele redactionele illustratie

Geautomatiseerde hallucinatiedetectie verschuift in 2026 van algemene modelbeoordeling naar bewijsgerichte runtime-verificatie: systemen ontleden antwoorden in losse claims en toetsen die aan externe bronnen of formele beleidsregels. AWS, Collibra en TrustScale tonen dit, maar hun nauwkeurigheidsclaims zijn geen vervanging voor onafhankelijke, domeinspecifieke evaluatie.

AWS kondigde op 23 juni 2026 geautomatiseerde verfijningsworkflows aan voor Automated Reasoning-checks in Amazon Bedrock Guardrails. Deze checks gebruiken formele logica om generatieve antwoorden wiskundig te toetsen aan een door de klant gedefinieerd beleid, hallucinatierisico te signaleren en verifieerbare verklaringen te leveren. Voor wie met gevoelige informatie werkt, kan dit een aanvullende, controleerbare stap bieden: antwoorden worden dan niet alleen op plausibiliteit beoordeeld, maar ook getoetst aan expliciet beleid, met verklaringen over de uitkomst. Dat vervangt geen broncontrole of menselijke beoordeling.

Naar onze inschatting is dit de belangrijkste verandering: de vraag verschuift van klinkt dit aannemelijk naar tegen welke regel of bron is dit getoetst, en met welk bewijs. Dat maakt detectie bruikbaarder, maar verlegt de last naar de kwaliteit van het beleid en de bronnen zelf.

Wat meet hallucinatiedetectie precies?

Hallucinatiedetectie is geen enkel meetpunt. Het kan meerdere, verschillende dingen toetsen:

  • Factuality: klopt een uitspraak tegenover de externe werkelijkheid of een betrouwbare bron.
  • Faithfulness: blijft het antwoord trouw aan de aangeleverde context of documenten, zonder toevoegingen.
  • Beleidsnaleving: voldoet het antwoord aan expliciet gedefinieerde, formele regels.

Deze drie vallen niet samen. Een antwoord kan trouw zijn aan een fout brondocument, of feitelijk juist maar in strijd met beleid. Wie een detector inzet, moet daarom weten welke van deze drie het systeem daadwerkelijk controleert. De AWS-aankondiging richt zich op beleidsnaleving via formele logica; dat is iets anders dan controle tegenover de bredere werkelijkheid.

Welke geautomatiseerde detectiemethoden zijn er?

De bestaande methoden laten zich ordenen in vier families. Ze verschillen fundamenteel in wat ze aannemelijk maken en waar ze falen:

  1. Externe claim- en bronverificatie. Het antwoord wordt in atomaire claims ontleed, externe bronnen worden verzameld en elke claim wordt afzonderlijk gevalideerd. TrustScale beschrijft Argus als zo'n black-box systeem: ingestie, onderzoek, validatie, vergelijking, scoring en bescherming, met kleurgecodeerde signalen, bronverwijzingen en inline correctie. De zwakke plek zit in de bronselectie en de retrieval: een verkeerd gekozen of verouderde bron leidt tot een verkeerd oordeel.
  2. Formele logica en beleidschecks. Antwoorden worden wiskundig getoetst aan expliciet vastgelegde regels, zoals in de Automated Reasoning-checks van AWS. De kwaliteit van deze validatie hangt in belangrijke mate af van de kwaliteit, volledigheid en eenduidigheid van het beleid; AWS beschrijft daarom iteratieve beleidsverbetering en het wegnemen van ambiguïteit.
  3. Context- en kennisgraafmethoden. Hier wordt hallucinatierisico gekoppeld aan gecureerde context en grafen. Collibra beschrijft in zijn aankondiging van nieuwe mogelijkheden een contextgraaf (Live Map), governance-agents (Maestro) en Guardian Agents met machineleesbare Agent Contracts voor runtime-toezicht.
  4. Model- of agentgebaseerde beoordelaars. Een ander model beoordeelt de uitvoer. Het risico daarvan is dat de beoordelaar dezelfde fouten kan reproduceren als het gecontroleerde model.

Waarom is geen enkele detector universeel betrouwbaar?

Elke familie heeft een structurele afhankelijkheid die de detectie kan ondermijnen. Dat is geen detail, maar de kern van de beperking:

  • Formele checks zijn zo goed als het beleid dat eraan ten grondslag ligt.
  • Brongebaseerde systemen staan of vallen met bronselectie en retrieval.
  • Modelgebaseerde beoordelaars kunnen de blinde vlekken van het onderliggende model delen.

Daar komt bij dat de gepubliceerde nauwkeurigheidscijfers leveranciersclaims zijn. TrustScale noemt getallen over nauwkeurigheid en snelheid; die vormen geen onafhankelijke validatie. Ook de surveycijfers in het Collibra-bericht zijn door de leverancier gepresenteerd. Naar onze inschatting is de belangrijkste openstaande vraag daarom hoe deze systemen presteren in onafhankelijke, domeinspecifieke tests. Zolang die ontbreken, blijft een hoge score op een leverancierstest een zwak fundament voor bedrijfskritische inzet. Dat sluit aan bij de bredere lijn van gelaagde verificatie in plaats van losse tools.

Hoe richt je detectie in voor gevoelig werk?

De praktische boodschap voor professionals met vertrouwelijke informatie is een gelaagde workflow, niet één product. Wij adviseren de volgende stappen, als redactionele analyse en niet als bronuitspraak:

  1. Ontleed het antwoord in afzonderlijke claims in plaats van het geheel in één keer te beoordelen.
  2. Toets elke claim aan de relevante externe bron of aan expliciete, formele regels.
  3. Bewaar het onderliggende bewijs, zodat een oordeel later te reconstrueren is.
  4. Routeer onzekere of tegenstrijdige resultaten naar menselijke beoordeling.
  5. Registreer modelversie, gebruikt beleid, geraadpleegde bronnen en de correctiebeslissing.

Deze aanpak sluit aan bij de manier waarop toezichthouders naar validatie kijken; zie ook de vier maatregelen die NIST koppelt aan validatie van generatieve AI. Wie agents inzet, betrekt daarbij het runtime begrenzen van agentacties, precies het terrein waar Collibra's Agent Contracts op mikken. Een overzicht van methoden en producten staat in de hub AI-verificatie: methoden en producten.

De productontwikkelingen bij AWS, Collibra en TrustScale maken hallucinatiedetectie concreet runtime- en bewijsgericht. Dat is winst. Maar de afwezigheid van onafhankelijke, domeinspecifieke evaluatie blijft een structureel risico: organisaties moeten hun eigen validatie- en monitoringprocessen inrichten náást de aangeboden tools, niet in plaats daarvan.

Bronnen en referenties

  1. Automated Reasoning checks in Amazon Bedrock Guardrails add new policy refinement workflowsAWS · 2026-06-23
  2. Collibra Launches New Capabilities to Reduce the Hallucination Tax on Enterprise AICollibra · 2026-09-23
  3. TrustScale Launches Argus to Detect and Correct AI Hallucinations and Power Safe Enterprise AI AdoptionTrustScale · 2026-08-05
  4. Argus — AI Hallucination Detection & Output VerificationTrustScale · 2026-09-29

Bronnen: Het artikel steunt op de officiële aankondiging van AWS over Automated Reasoning-checks in Amazon Bedrock Guardrails en op eigen berichten van Collibra en TrustScale.

← Alle artikelen in dit thema ← Alle artikelen