Blog

Behandel AI-confidence als workflow-signaal, niet als bewijs van juistheid

Confidence scores van AI zijn vaak overmoedig en misleidend op zichzelf. Zo gebruikt u ze als signaal voor decompositie, subgroep-audits en deferral bij gevoelig

· Door

Een gedrukt vel met een cirkelvormige confidence-meter ligt apart, terwijl een hand een papieren markering plaatst bij een passage in gesorteerde stapels documenten.
Een confidence-score is een workflow-signaal dat leidt tot verduidelijken, laten beoordelen of doorsturen, niet tot een eindoordeel.Beeld: IamVera.ai — originele redactionele illustratie

Behandel een AI-confidence score niet als bewijs van juistheid, maar als workflow-signaal, want onderzoek toont dat modellen vaak overmoedig zijn en dat calibratie per taakmoeilijkheid en subgroep verschilt. Splits onzekerheid daarom uit en gebruik lage of onzekere scores om te verduidelijken, te laten controleren of naar een sterker model te routeren.

De aanleiding is concreet. MIT News beschreef op 22 april 2026 een trainingsmethode, RLCR, die de calibratiefout van taalmodellen verlaagt door calibratie expliciet te belonen, zodat een model onzekerheid kan uitspreken in plaats van met valse stelligheid te gokken. De onderliggende observatie is belangrijker dan de methode: de MIT-berichtgeving laat zien dat training met een expliciete calibratiebeloning modellen kan helpen onzekerheid uit te spreken in plaats van met valse stelligheid te gokken. Voor wie met vertrouwelijke of hoog-trust informatie werkt, betekent dat: een hoge score is geen garantie.

Waarom zijn AI-confidence scores vaak overmoedig en onbetrouwbaar?

Het arXiv-artikel Confidence Calibration in Large Language Models laat zien dat de zelfgerapporteerde zekerheid van modellen systematisch kan afwijken van de werkelijke accuratesse. Twee bevindingen zijn relevant voor de praktijk. Ten eerste hangt calibratie af van taakmoeilijkheid: bij moeilijkere taken groeit de kloof tussen gerapporteerde zekerheid en feitelijke juistheid, het zogeheten hard-easy-effect. Ten tweede zijn redeneermodellen doorgaans beter gecalibreerd dan chatmodellen, maar ook zij blijven imperfect.

De praktische consequentie: een confidence score is meetbaar en informatief, maar niet zelfvoorzienend. Naar onze inschatting is de gevaarlijkste situatie niet een lage score, maar een hoge score bij een moeilijke taak, omdat die het meest overtuigend oogt en het minst wordt gecontroleerd. Wie AI inzet bij besluitvorming met een verificatielaag tegen hallucinaties, moet de score dus koppelen aan het type taak, niet aan het antwoord alleen.

Waarom volstaat één globale confidence score niet voor gevoelige beslissingen?

Een gemiddelde die goed gecalibreerd oogt, kan lokale fouten verbergen. Het ICLR-artikel Beyond calibration: estimating the grouping loss of modern neural networks maakt onderscheid tussen verschillende faalvormen die één cijfer niet vangt. De auteurs beschrijven naast calibratiefout ook grouping loss: binnen een subgroep kan een model tegelijk overmoedig en onderzeker zijn, terwijl het globale gemiddelde er correct uitziet. Daarnaast introduceren zij de gedachte dat onzekerheid vertaald moet worden naar beslissingsrisico, en dat risicovolle gevallen doorgestuurd kunnen worden naar een sterker model of een mens.

Dat is precies het probleem met een enkele knop die "87% zeker" toont. Het cijfer suggereert één dimensie, terwijl de risico's meerdimensionaal zijn. Dit sluit aan bij de grenzen van zelfverificatie door één model: een model dat zijn eigen zekerheid rapporteert, controleert daarmee niet zijn eigen blinde vlekken.

Hoe splits ik onzekerheid uit in bruikbare componenten voor mijn workflow?

Op basis van de genoemde bronnen is het bruikbaar om onzekerheid uiteen te leggen voordat u handelt. De volgende driedeling is onze redactionele vertaling van de onderzoeksbevindingen naar een werkbaar onderscheid:

  • Epistemische onzekerheid — het model mist kennis of context. Het ACL-artikel Asking Clarification Questions to Reduce Uncertainty in Open-Domain QA laat zien dat deze onzekerheid deels ontstaat door ontbrekende informatie en kan dalen door gerichte verduidelijkingsvragen.
  • Taakambiguïteit — de vraag zelf is meerduidig. Hier helpt geen sterker model, maar een scherpere formulering of interactie voordat het model antwoordt.
  • Beslissingsrisico — de gevolgen van een fout. Het ICLR-artikel koppelt onzekerheid expliciet aan risico; een middelmatige zekerheid bij een onomkeerbaar besluit weegt zwaarder dan een lage zekerheid bij een terugdraaibare actie.

Deze decompositie verklaart waarom dezelfde score in twee situaties een andere handeling vraagt. Bij epistemische onzekerheid ligt verduidelijken of routeren voor de hand; bij taakambiguïteit ligt de bal bij de vraagsteller; bij hoog beslissingsrisico is menselijke controle het uitgangspunt, ongeacht de score.

Hoe vertaal ik een confidence score naar verduidelijking, controle of deferral?

De verzamelde bronnen wijzen naar één werkregel: gebruik de score als routeringssignaal, niet als eindoordeel. Een praktische invulling voor hoog-trust omgevingen:

  1. Meet de score en registreer die naast de exacte taakcontext, niet los ervan.
  2. Bepaal het beslissingsrisico vooraf; hoog risico verlaagt de drempel voor controle.
  3. Bij lage of onzekere score en ontbrekende informatie: laat het systeem eerst een verduidelijkingsvraag stellen, in lijn met de ACL-bevindingen.
  4. Bij aanhoudende onzekerheid op een risicovolle taak: routeer naar een sterker model of naar een mens, zoals het ICLR-artikel voorstelt.
  5. Voer subgroep-audits uit om verborgen over- of onderzekerheid op te sporen die het gemiddelde maskeert.
  6. Log de score, de context en de uitkomst, zodat calibratie over tijd toetsbaar blijft.

Dat vraagt om verificatie buiten het model zelf. Wie meerdere modellen inzet, kan multi-model verificatie inrichten zonder schijnzekerheid, waarbij onenigheid tussen modellen een sterker signaal is dan een enkele hoge score. Voor het bredere kader loont het de themahub over AI-verificatie te raadplegen. De MIT-berichtgeving over RLCR toont dat het veld nu actief probeert overmoed te verminderen in plaats van die alleen te meten; naar onze inschatting verandert dat de conclusie niet, maar verlaagt het de kosten van eerlijk gerapporteerde onzekerheid. Het eindoordeel blijft bij de professional.

Bronnen en referenties

  1. Confidence Calibration in Large Language ModelsarXiv · 2026-04-03
  2. Beyond calibration: estimating the grouping loss of modern neural networksICLR / OpenReview · 2023-04-24
  3. Teaching AI models to say "I'm not sure"MIT News · 2026-04-22
  4. Asking Clarification Questions to Reduce Uncertainty in Open-Domain QAACL Anthology · 2023-07-09

Bronnen: Het artikel steunt op arXiv (Confidence Calibration in Large Language Models), ICLR/OpenReview (Beyond calibration), MIT News over RLCR en de ACL Anthology over verduidelijkingsvragen.

← Alle artikelen in dit thema ← Alle artikelen