AI-samenvattingen van lange of meerdere documenten kunnen fors afwijken van de bron: onderzoek meet hallucinatiepercentages van enkele procenten tot ruim boven 40 procent, afhankelijk van domein en opzet. Behandel zulke samenvattingen daarom niet als snelle weergave, maar toets elke claim tegen de brontekst en laat hoog-impact stukken door een mens controleren.
De directe aanleiding is een studie op arXiv over hallucinaties bij multi-document summarization (bijgewerkt augustus 2026). Daarin rapporteren de auteurs dat bij samenvattingen van meerdere bronnen een groot deel van de gegenereerde inzichten niet door de brondocumenten wordt gedragen, met uitschieters tot ongeveer 45 procent in het nieuwsdomein en tot circa 75 procent bij conversaties, waaronder medische consulten. Nog opvallender: modellen produceren in meer dan 20 procent van de gevallen samenvattingen voor subtopics die helemaal niet in de bron voorkomen. Voor iedereen die dossiers laat samenvatten, is dat een concreet werkrisico, geen theoretische kanttekening.
Hoeveel wijken AI-samenvattingen van lange en meerdere documenten af van de bron?
De cijfers lopen sterk uiteen per taak en domein. Het overzicht van Inferya over hallucinatiepercentages per taaktype plaatst geaarde samenvattingsbenchmarks zoals Vectara HHEM (grofweg 0,7 tot 3,3 procent voor topmodellen) naast klinische casus-samenvattingen waar zonder mitigatie percentages tot ongeveer 64 procent worden gerapporteerd. De arXiv-studie voegt daar de multi-document-cijfers aan toe.
Naar onze inschatting is de belangrijkste les niet één getal, maar de spreiding zelf: een lage benchmarkscore op korte, goed gestructureerde teksten zegt weinig over een lang, rommelig, domeinspecifiek dossier. Wie zich op generieke accuracystatistieken verlaat, meet de verkeerde situatie.
- Korte, geaarde samenvattingen: laagste gemeten foutpercentages.
- Lange enkelvoudige documenten: hoger, met foutclustering aan het einde.
- Meerdere bronnen samengevoegd: substantieel deel niet door de bron gedekt.
- Domeinspecifiek (medisch, juridisch, claims): zonder mitigatie de hoogste vertekening.
Waarom stapelen fouten zich juist aan het einde van lange samenvattingen op?
Het onderzoek Hallucinate at the Last in Long Response Generation laat zien dat hallucinerende inhoud bij lange outputs systematisch naar het einde verschuift, en dat dit effect toeneemt naarmate de samenvatting langer wordt. Klassieke gemiddelde metrieken maskeren dit, omdat het begin vaak wel klopt.
De praktische consequentie is ongemakkelijk: professionals lezen slotparagrafen en conclusies vaak juist vluchtiger, terwijl daar de kans op niet-ondersteunde beweringen het grootst is. Segment-specifieke controle van de laatste delen is daarom geen luxe. Dit sluit aan bij bredere praktische methoden om AI-hallucinaties te detecteren.
Hoe toets ik een AI-samenvatting claim voor claim tegen het brondocument?
Een bruikbaar kader komt uit het peer-reviewde artikel in Scientific Reports over hallucinatiedetectie voor samenvattingen. Dat beschrijft een Question-Sort-Evaluate-aanpak: uit de samenvatting worden vragen gegenereerd, die worden gesorteerd op belang en vervolgens beantwoord op basis van de brontekst. Wijkt het antwoord uit de samenvatting af van het antwoord uit de bron, dan is de claim verdacht. Hallucinatie wordt daarbij expliciet gedefinieerd als tekst die niet door de brontekst wordt gedragen.
Vertaald naar dagelijkse praktijk komt dat neer op een herhaalbare reeks stappen:
- Splits de samenvatting op in afzonderlijke, controleerbare beweringen.
- Zoek voor elke bewering de dragende passage in het brondocument op.
- Markeer beweringen zonder dekking als mogelijk hallucinatief.
- Geef extra aandacht aan de slotdelen, waar fouten zich concentreren.
- Leg vast welke claim door welke bronpassage wordt ondersteund.
Wie dit structureel wil inrichten, kan het combineren met een gelaagde stack voor hallucinatiedetectie in plaats van één enkele tool. Meer achtergrond staat in de themahub over AI-verificatie en controleerbare workflows.
Waarom blijft menselijke controle nodig in juridische, medische en compliance-dossiers?
Zelfs een geoptimaliseerd model haalt de menselijke controle niet weg. De studie in PubMed Central over ontslagbrieven uit elektronische patiëntendossiers rapporteert dat een fijn-getuned model in ongeveer 6 procent van de samenvattingen ten minste één feitelijke inconsistentie bevatte, en dat 94 procent na menselijke verificatie klinisch acceptabel werd bevonden. Vooral bij atypische casussen bleven fouten voorkomen. De auteurs benadrukken dat menselijke review ingebouwd moet blijven.
Naar onze inschatting is die conclusie breder toepasbaar dan de zorg: in juridische dossiers, verzekeringsclaims en compliance-rapportages levert AI een eerste concept, maar de eindbeslissing en eindrapportage vragen een aantoonbaar menselijk controlepunt. In het juridische domein is dat verder uitgewerkt in een verdedigbare workflow voor juridisch AI-onderzoek.
Welke verificatie moet ik vastleggen voordat ik op een AI-samenvatting vertrouw?
Betrouwbaarheid wordt pas geloofwaardig als u kunt laten zien wat er gecontroleerd is. Dat betekent per lang document vastleggen welke samenvatting door welk model is gemaakt, welke claims tegen de bron zijn getoetst, welke als mogelijk hallucinatief zijn gelabeld en waar en door wie menselijke review heeft plaatsgevonden. Zo ontstaat een controleerbaar spoor voor audits, geschillen of incidentonderzoek.
Een privacygerichte verificatielaag zoals Vera kan dit ondersteunen door een taak door geselecteerde onafhankelijke modellen te leiden en verificatiestappen, correcties en bronnen zichtbaar te maken voor inspectie. Dat garandeert geen juistheid en neemt hallucinaties niet weg; het maakt controle mogelijk. De architectuur is bovendien ontworpen om alleen geanonimiseerde inhoud door te sturen en werkt fail-closed: mislukt de privacycontrole, dan gaat het document niet verder. Het professionele eindoordeel blijft bij de gebruiker. De kern blijft: behandel een AI-samenvatting van gevoelig materiaal als een verifieerbare claimreeks, niet als een snellere leesfunctie.
Bronnen en referenties
- From Single to Multi: How LLMs Hallucinate in Multi-Document Summarization
- Hallucinate at the Last in Long Response Generation
- A hallucination detection and mitigation framework for abstractive text summarization
- Accurate discharge summary generation using fine tuned large language models in electronic health records
- LLM Hallucination Rate by Task Type (2026 Data)
Bronnen: Het artikel steunt op studies op arXiv en alphaXiv, een peer-reviewd artikel in Scientific Reports, een klinische studie in PubMed Central en een taaktype-overzicht van Inferya.