Model drift betekent dat het gedrag en de prestaties van een AI-model in de tijd merkbaar veranderen, soms zelfs binnen dezelfde modelnaam. In juli 2026 werd dit concreet zichtbaar: High Learning Rate documenteerde stille wijzigingen in OpenAI's Codex-agents en Guardian-review-prompts, GetReadyForAgents meldde een verkleind contextvenster bij GPT-5.6 Sol Codex, en een Dev.to-analyse beschreef een kwaliteitsdaling bij GPT-5.5 Codex. Voor wie met gevoelige of hoog-trust informatie werkt betekent dit dat je niet op de modelnaam alleen kunt vertrouwen.
Je merkt drift alleen op via eigen metingen: golden datasets per workflow, regressietests en het loggen van welke modelversie en configuratie actief waren. Zonder die metingen kan een verslechtering ongemerkt doorwerken in beslissingen, uitleg en compliance. Het gaat dus om zichtbaar maken, niet om vertrouwen op één versienummer.
Wat gebeurde er in juli 2026 met Codex en GPT rond model drift?
De directe aanleiding is een reeks waarnemingen rond OpenAI's Codex-lijn. In de post "Your Agent Changed Under the Model Name" beschrijft High Learning Rate op 13 juli 2026 hoe OpenAI meerdere stille wijzigingen doorvoerde in zijn agent-stack: het terugdraaien van een vergroting van het contextvenster na onverwacht hoge kosten, aanpassingen aan reasoning-experimenten en het herstellen van een regressie in het gedrag van Guardian-review-prompts en tools.
Het patroon: het gedrag veranderde zonder dat de modelnaam wijzigde. Dat maakt het lastig te traceren zonder eigen metingen.
Twee andere waarnemingen versterken dit beeld. GetReadyForAgents meldde op 14 juli 2026 dat gebruikers een effectieve contextvenster-reductie zagen bij GPT-5.6 Sol Codex, van circa 353.000 naar circa 258.000 tokens, zonder prominente aankondiging. Een dag eerder, op 5 juli 2026, publiceerde een auteur op Dev.to een analyse over mogelijke reasoning-token clustering bij GPT-5.5 Codex, met ontwikkelaarsmetingen die wijzen op een daling van ongeveer acht tot tien procentpunt op complexe, meerstaps-coderingstaken vergeleken met GPT-5 Codex. OpenAI had daarop op dat moment nog geen officiële diagnose gegeven.
Onze redactionele inschatting: deze drie signalen komen uit verschillende bronnen en meten verschillende dingen (agentgedrag, capaciteit, taakkwaliteit). Samen laten ze zien dat drift in 2026 niet één fenomeen is, maar meerdere lagen die elk apart gemeten moeten worden.
Wat is interpretatie-drift en waarom is stabiele accuracy niet genoeg?
Een prestatiegrafiek die vlak blijft, is geen garantie dat het model hetzelfde blijft redeneren. Dat is de kern van een peer-reviewde studie in Scientific Reports (Nature portfolio) van 10 maart 2026, die het begrip "interpretation drift" introduceert. De auteurs tonen dat modellen onder label noise hun interne logica en uitlegregels substantieel kunnen veranderen, terwijl hun F1-score en voorspellende prestaties grotendeels stabiel blijven.
Voor werk waarin uitleg en verantwoording tellen is dat belangrijk. Twee modellen kunnen dezelfde uitkomst geven, maar op basis van andere redenering. Voor auditability betekent dit dat je niet alleen naar accuracy moet kijken, maar ook naar de consistentie van het type beslissing en de onderbouwing. Onze inschatting: juist bij onenigheid tussen meerdere modellen als verificatiesignaal is dit onderscheid tussen prestatie-drift en interpretatie-drift praktisch bruikbaar.
Hoe detecteer je model drift per workflow?
Een uitgewerkt raamwerk komt van Divinci.ai, dat op 26 mei 2026 een regressietest-aanpak voor custom LLMs beschreef. Zij onderscheiden vier soorten drift: quality drift, coverage drift, judge drift en production drift, en gebruiken een baseline-manifest plus replay van productie-traces om te bepalen of scoreverschillen door het model, de evaluator of de productieomgeving komen.
Vertaald naar een praktische checklist voor high-trust workflows:
- Leg per workflow een golden dataset vast met representatieve, gecontroleerde voorbeelden en verwachte uitkomsten.
- Log welke modelversie en configuratie actief waren bij elke run, zodat een wijziging traceerbaar is als de naam gelijk blijft.
- Scheid de evaluator van het geteste model om judge drift op te sporen wanneer de beoordelaar zelf verschuift.
- Replay productie-traces om runtime-drift te onderscheiden van modelwijzigingen.
- Zet drempels om releases te blokkeren bij aantoonbare kwaliteitsdegradatie.
- Meet niet alleen accuracy, maar ook uitlegconsistentie om interpretatie-drift te vangen.
Meer achtergrond over meetmethoden staat in de themahub over AI-verificatie en in ons overzicht van gelaagde hallucinatiedetectie.
Wat betekent model drift voor high-trust en privacygevoelige processen?
Voor lange juridische dossiers, compliance-analyses of incidentreconstructies raakt drift direct de betrouwbaarheid. Een kleiner contextvenster kan betekenen dat een deel van een lang dossier buiten beeld valt; een verschoven reasoning-profiel kan andere fouten opleveren dan de week ervoor. Onze inschatting: het risico zit niet in de verandering zelf, maar in het feit dat die verandering onopgemerkt blijft.
Hier past een verificatielaag. IamVera.ai is geen taalmodel en geen chatbot, maar een privacygerichte verificatielaag die een taak door geselecteerde onafhankelijke modellen kan routeren en verificatiestappen, correcties, onenigheden en bronnen zichtbaar maakt voor inspectie. Dat garandeert geen correctheid en elimineert geen hallucinaties, maar het kan helpen om per workflow zichtbaar te maken welke modelversies en configuraties draaiden en hoe uitkomsten zich verhouden tot baseline-gedrag. De voorbewerking en anonimisering via de Semantic Privacy Shield vinden plaats op EU-infrastructuur; de workflow is ontworpen om alleen geanonimiseerde inhoud door te sturen, en bij een mislukte privacycontrole wordt niets doorgestuurd. Het professionele eindoordeel blijft altijd bij de gebruiker.
De rode draad: behandel model drift als een verifieerbare risicolaag, niet als een statistisch effect dat je voor lief neemt.
Bronnen en referenties
Bronnen: Het artikel steunt op High Learning Rate, GetReadyForAgents en een Dev.to-analyse over Codex-wijzigingen, een Scientific Reports-studie over interpretatie-drift en een regressietest-raamwerk van Divinci.ai.