Behandel veranderend AI-gedrag als een structurele eigenschap van frontier-modellen, niet als incident: recent academisch werk toont vier vormen van drift aan (response-, context-, non-deterministische en update-drift). Veranker governance daarom in continue benchmarking, gedragscontracten met updatedrempels en verificatie op werkstroomniveau die per zaak vastlegt welke modelversie welk antwoord gaf.
De aanleiding is een reeks recente studies op arXiv en alphaXiv die drift niet langer vrezen maar meten. De paper Test Before You Deploy: Governing Updates in the LLM Stack (4 september 2026) beschrijft hoe stille updates aan een taalmodel het gedrag op applicatieniveau kunnen breken: nauwkeurigheid, weigerpatronen en uitvoerformaten veranderen zonder dat de opdracht wijzigt. De onderzoekers stellen een governance-patroon voor met risicogebonden benchmarksuites en gedragscontracten. Naar onze inschatting is dat de belangrijkste verschuiving: drift wordt een meetbaar, contracteerbaar risico in plaats van een onverklaarbare hapering.
Welke vormen van modeldrift tonen de recente studies aan?
Uit de bronnen komt naar voren dat "modeldrift" geen enkel verschijnsel is, maar minstens vier onderscheiden vormen kent. Elke vorm vraagt om een ander controlepunt.
- Response drift — afwijking van door experts gevalideerde referentieantwoorden op een vast moment. De studie Response drift across frontier large language models meet dit over tien frontier-modellen en constateert dat alle geteste modellen substantieel afwijken, waarbij de meeste rond eenzelfde hoge afwijkingsband clusteren en slechts enkele beter presteren.
- Context drift — het geleidelijk afdrijven van doelconsistent gedrag over meerdere beurten in een gesprek of agentworkflow. De paper Drift No More? Context Equilibria in Multi-Turn LLM Dialogue formaliseert dit als divergentie van een doelconsistente referentiepolicy per beurt.
- Non-deterministische drift — variatie in uitvoer bij herhaalde identieke prompts. Quantifying Non-Deterministic Drift in Large Language Models toont dat zelfs bij vaste prompts variabiliteit ontstaat door sampling- en infrastructuurkeuzes.
- Gedragsdrift door updates — regressies of onverwachte veranderingen wanneer een leverancier gewichten of serverconfiguratie stil aanpast, zoals beschreven in Test Before You Deploy.
De bronnen laten één vraag open die praktisch de meest urgente is: hoe deze vormen op elkaar inwerken wanneer ze tegelijk in één werkstroom optreden. Naar onze inschatting maakt juist die samenloop het onmogelijk om drift met één enkele test af te dekken.
Waarom schieten eenmalige benchmarks en 'temperatuur nul' tekort?
Veel professionals gaan ervan uit dat een vaste prompt met temperatuur nul een reproduceerbaar antwoord oplevert. Quantifying Non-Deterministic Drift in Large Language Models maakt duidelijk dat dat niet klopt: sampling- en serving-infrastructuur veroorzaken variatie tussen identieke runs. Een eenmalige benchmark meet dus maar één toevallige uitkomst, niet de spreiding.
De consequentie is dat governance niet kan steunen op periodieke, losstaande tests. Wie wil weten hoe een model zich gedraagt, moet herhaald en continu meten. Dat sluit aan bij de bredere gedachte dat multi-model verificatie zonder schijnzekerheid inrichten meer waarde biedt dan blind vertrouwen op één modeluitkomst.
Hoe raakt drift lange, meerstaps AI-werkstromen in de beroepspraktijk?
De studie Beyond pass@1: A Reliability Science Framework for Long-Horizon LLM Agents introduceert maatstaven als de Reliability Decay Curve en het Meltdown Onset Point. De bevinding: prestaties dalen en het aantal meltdowns stijgt naarmate taken langer en complexer worden, juist bij frontier-modellen.
Dat is direct relevant voor de beroepspraktijk. Juridische reviews, financiële analyses en compliance-controles zijn lange, meerstaps processen. Daarin uit drift zich als overgeslagen stappen, inconsistent redeneren of plotseling falen na een reeks correcte handelingen. Korte-taakscores zijn daar structureel blind voor. Wie een fout wil kunnen herleiden, moet kunnen achterhalen waar in de keten het misging; dat is precies waarom een fout AI-antwoord traceerbaar maken per werkstroom onderdeel van governance wordt.
Welke governance-afspraken vangen drift bij modelupdates af?
Test Before You Deploy vertaalt de meetkant naar een concreet governance-patroon. Het komt neer op een discipline die updates behandelt als wijzigingen die eerst getoetst worden voordat ze in productie komen.
- Definieer per werkstroom applicatiespecifieke gedragscontracten: welke nauwkeurigheid, weigerpatronen en uitvoerformaten acceptabel zijn.
- Onderhoud driftgevoelige benchmarksuites, geordend naar risicocategorie.
- Toets nieuwe modelversies automatisch tegen die benchmarks voordat u ze adopteert.
- Stel drempelwaarden vast en trigger mitigatie — promptaanpassing, workflowwijziging of terugval op een vorige versie — zodra drift die drempel overschrijdt.
Deze contractlogica hoort ook thuis in inkoop. Wie AI afneemt, kan drempels voor acceptabele drift en meldplichten bij updates vastleggen; zie hiervoor het overzicht om AI-diensten inkopen met contractuele toetsassen. Dit is onze redactionele gevolgtrekking uit de gecombineerde bronnen, geen letterlijke aanbeveling uit één paper.
Wat moet ik per high-trust werkstroom kunnen aantonen?
De studies leggen samen bloot wat een organisatie zichtbaar moet houden om beslissingen verdedigbaar te maken, ook wanneer modelgedrag verschuift. Het bredere kader hiervoor staat in de themahub over AI-governance en modelbeheer. Per werkstroom gaat het naar onze inschatting om:
- Modelversie en wijzigingshistorie: welke exacte versie welk kritiek antwoord produceerde en wanneer een leverancier updates doorvoerde.
- Driftmetingen per werkstroom: welke response-, context- of betrouwbaarheidsdrift is waargenomen en hoe vaak mitigatie werd getriggerd.
- Benchmarks en contracten: welke suites en gedragscontracten gelden en wat recente testresultaten tonen.
- Menselijke controle en correcties: waar reviewers driftgevoelige uitvoer corrigeerden of overrulden, en hoe dat is gelogd.
De rode draad in het recente onderzoek is nuchter: modellen veranderen ook wanneer de opdracht gelijk blijft. Governance die uitgaat van statisch modelgedrag loopt daarom achter de feiten aan. De verschuiving die deze bronnen mogelijk maken, is dat drift meetbaar en contracteerbaar is geworden — en daarmee bestuurbaar.
Bronnen en referenties
- Response drift across frontier large language models
- Drift No More? Context Equilibria in Multi-Turn LLM Dialogue
- Test Before You Deploy: Governing Updates in the LLM Stack
- Quantifying Non-Deterministic Drift in Large Language Models
- Beyond pass@1: A Reliability Science Framework for Long-Horizon LLM Agents
Bronnen: Het artikel steunt op recente arXiv-papers over response-, context-, non-deterministische en update-drift en op het alphaXiv-raamwerk voor betrouwbaarheid van long-horizon LLM-agents.