Ivo bracht op 30 september 2026 Sage uit als open-source contractmodel met zelfgerapporteerde winst op eigen LAB-taken. Omdat teams het model nu lokaal kunnen aanpassen, verschuift de bewijslast: wie Sage inzet moet zelf een reproduceerbaar validatie- en bewaarproces opzetten voordat uitkomsten in hoog-risico contractwerk leunen op die score.
Wat heeft Ivo precies uitgebracht met Sage en wat zeggen de gerapporteerde cijfers wel en niet?
Ivo beschrijft Sage als een open-source model voor langlopend, agentisch contractwerk, gebouwd op DeepSeek V4 Flash en nagetraind met reinforcement learning op 1.040 LAB-trainingstaken. Op de publieke modelkaart en evaluatierecord rapporteert Ivo resultaten op 180 achtergehouden LAB-taken, waaronder een stijging van de slaagkans op het criterium Contracts van 0,701 naar 0,913. Het model is een LoRA-adapter, een los laagje bovenop het basismodel, dat teams kunnen downloaden en lokaal draaien.
Belangrijk: dit zijn Ivo's eigen gerapporteerde resultaten onder Ivo's eigen testopzet, taakverdeling en beoordelingsprocedure. Er is geen onafhankelijke replicatie. De cijfers tonen dat het model beter scoort binnen dat kader, niet dat het juridisch correct oordeelt op de contracten van een specifiek kantoor.
Waarom bewijzen zelfgerapporteerde benchmarkwinsten geen betrouwbare contractanalyse in mijn praktijk?
Een hogere score op een eigen benchmark staat los van de vraag of het model betrouwbaar is in uw workflow. Onafhankelijk onderzoek laat zien hoe groot dat gat kan zijn, zeker bij de smalle, realistische controletaken waar contractwerk uit bestaat.
De ContractScrub-benchmark van Yejin Bang en collega's, gepresenteerd op de ICML AI4Law-workshop, test de eindcontrole van contracten op foutsoorten als verkeerd gebruik van gedefinieerde termen, onjuiste verwijzingen en inconsistent taalgebruik. Toonaangevende modellen presteerden daar zwak, ondanks sterke scores op bredere benchmarks; slechts één model haalde een macro-gemiddelde recall van 0,75. De CLAUSE-benchmark, gepubliceerd in de Findings of EACL 2026, genereert ruim 7.500 verstoorde contracten in tien categorieën en toetst of modellen subtiele juridische afwijkingen opsporen en kunnen uitleggen. De auteurs betogen dat betrouwbaarheid in de praktijk adversariële, fijnmazige tests vraagt, niet brede claims over juridisch redeneren.
Het Stanford Institute for Human-Centered Artificial Intelligence waarschuwt bovendien dat benchmarklabels niet altijd meten wat ze beweren te meten, en dat benchmarks die dezelfde eigenschap claimen te meten onderling kunnen tegenspreken. Daarom zegt een hogere Sage-score onder Ivo's protocol op zichzelf niets over nauwkeurigheid, robuustheid of veiligheid in een concrete juridische werkstroom. Zie ook onze eerdere analyse over onafhankelijke AI-verificatie.
Wat betekent de open-source release van Sage voor bestuurders, juristen en CISO's?
Onze analyse: omdat Sage open en lokaal aanpasbaar is, verschuift het object van verificatie van een vaste leveranciersdienst naar het hele lokale systeem — basismodel, adapter, prompts, tools, data, contextafhandeling en het reviewproces; daarom moet uw team niet de dienst van Ivo toetsen maar zijn eigen samengestelde configuratie, vóór eerste inzet. Omdat een LoRA-adapter, prompt of contextlimiet lokaal te wijzigen is zonder dat de score meeverandert, kan prestatie stilletjes wegzakken na een aanpassing; daarom legt u een vaste, versiebeheerde configuratie vast en hertest u na elke wijziging aan model, adapter, prompt of tools voordat die versie productie raakt. Omdat de verantwoordelijkheid voor controle en verantwoording nu bij het team ligt in plaats van bij een externe leverancier, loopt de eindverantwoordelijke bestuurder of partner het risico aansprakelijk te zijn voor een fout die niemand heeft gevalideerd; daarom wijst u één eigenaar aan die de validatie, de modelversies en de onopgeloste fouten beheert en laat u gekwalificeerde juristen de fouten beoordelen, niet het model zelf. Omdat ContractScrub en CLAUSE aantonen dat modellen juist op subtiele, zeldzame drafting-fouten struikelen, is het grootste gevaar naar onze inschatting niet de zichtbare misser maar de plausibele redline die een jurist onterecht vertrouwt; daarom bouwt u adversariële en langecontextgevallen in uw eigen testset en legt u een onafhankelijk controlepunt tussen AI-analyse en formele advisering, zoals we beschreven bij een controlepunt tegen doorwerkende hallucinaties.
Hoe richt ik een reproduceerbaar validatie- en bewaarproces in voordat ik Sage inzet?
Keur Sage alleen goed via een versiebeheerd, lokaal evaluatieprotocol dat u na elke aanpassing herhaalt en waarvan u het bewijs bewaart. Dat maakt een fout later herleidbaar en voorkomt dat een leveranciersscore als eigen verantwoording wordt gepresenteerd. Dit is onze aanbeveling als redactie, afgeleid uit de hierboven genoemde bronnen.
- Bevries het basismodel, de LoRA-adapter, de inferentie-instellingen, de prompt en het tool-harnas als één benoemde versie met vastgelegde hashes.
- Maak een vertrouwelijke, representatieve holdoutset van uw eigen overeenkomsten die nooit voor tuning wordt gebruikt.
- Test clausule-extractie, consistentie tussen documenten, onderhandelingsterughoudendheid, uitvoering van uw playbook, bron- en citatietrouw en escalatie-oordeel.
- Neem adversariële en langecontextgevallen op, zoals verstopte afwijkingen en ongebruikelijke drafting.
- Laat gekwalificeerde juristen de fouten beoordelen en vergelijk tegen uw huidige menselijke of leveranciersworkflow.
- Herhaal de test na elke lokale aanpassing en bewaar modelhashes, dataherkomst, configuratie, outputs, reviewerbeslissingen en onopgeloste fouten.
Deze aanpak sluit naar onze analyse aan bij bredere eisen rond het juistheidsbeginsel van de AVG bij generatieve AI en bij werk dat agentische AI-uitvoering herleidbaar vastlegt, zoals de IETF-conceptnorm voor AI-audittrails. De kern: Ivo's cijfers zijn een vertrekpunt voor uw eigen, reproduceerbare validatie, geen bewijs dat Sage betrouwbaar is voor uw praktijk.
Bronnen en referenties
Bronnen: Het artikel steunt op Ivo's eigen modelkaart en aankondiging van Sage, de academische benchmarks ContractScrub en CLAUSE, en een meetkundige analyse van Stanford HAI.