Anthropic en het Amerikaanse NIST stellen vast dat Z.ai's open-weight model GLM-5.3 in een deel van de tests werkende exploits bouwde en dat eenvoudige technieken de weigeringen van het model omzeilden. Dit waren gesimuleerde tests zonder toegang tot echte systemen; de les is dat zulke downloadbare modellen capability-specifieke tests, strikte isolatie en monitoring vereisen die ook na modificatie werken.
Op 29 september 2026 publiceerde het Frontier Red Team van Anthropic een beoordeling van GLM-5.3 waarin het de cybercapaciteiten en de robuustheid van de modelweigeringen onderzocht. Daarin stelt het bedrijf dat het model in een materieel, maar minderheids-aandeel van de ExploitBench-taken complete, werkende exploits produceerde, dicht in de buurt van Anthropics eigen Claude Mythos Preview. Daarnaast meldt Anthropic dat zijn gesimuleerde pogingen de weigeringsmechanismen van GLM-5.3 vaak konden omzeilen: 64% bij misleidende prompts en 92% bij vooraf ingevulde redeneertokens; bij een aangepaste, geablatieerde versie rapporteerde Anthropic 100%.
Belangrijk voor de duiding: Anthropic is een concurrent van Z.ai, en de cijfers over het omzeilen van safeguards zijn door het bedrijf zelf gerapporteerde, gesimuleerde resultaten. Het Amerikaanse NIST concludeerde onafhankelijk dat GLM-5.3 het meest cybercapabele open-weight model tot nu toe is, al loopt het volgens NIST in totale capaciteit nog achter op actuele Amerikaanse frontier-modellen.
Wat stelden Anthropic en NIST precies vast over GLM-5.3?
Anthropic rapporteert dat GLM-5.3 in zijn ExploitBench-test in 50 van de 410 pogingen werkende end-to-end exploits bouwde, tegenover 56 van de 410 voor zijn eigen Claude Mythos Preview. Ook meldt het dat misleidende prompts, voorafgevulde redeneertokens en een aangepaste versie van het model de ingebouwde weigeringen in hoge mate omzeilden; Anthropic stelt dat zijn eigen Claude-safeguards onder vergelijkbare omstandigheden niet faalden.
- Exploit-capaciteit: werkende exploits in 50 van de 410 ExploitBench-pogingen, een minderheid maar relevant deel van de taken.
- Zwakke safeguards: omzeiling met eenvoudige technieken, oplopend tot een volledig verwijderde weigering in een aangepaste modelversie.
- Onafhankelijke bevestiging: NIST noemt het model het meest cybercapabele open-weight model tot nu toe, maar nog achter op de top.
Z.ai zelf documenteert in zijn officiële modelrepository de release en de downloadbare distributie van GLM-5.3, inclusief modelgewichten en de technische context. Dat het model vrij te downloaden is, is geen detail maar de kern van de kwestie.
Waarom is 'exploit-capaciteit in een test' iets anders dan een echte inbraak?
Een model dat in een gecontroleerde test een exploit schrijft, heeft daarmee nog niets gecompromitteerd. Anthropic voerde de tests gesimuleerd uit, zonder het model directe toegang te geven tot externe systemen. Capaciteit is dus niet hetzelfde als een reëel incident, en een gerapporteerd testresultaat is geen bewijs van een publieke inbraak.
Naar onze inschatting is dit onderscheid juist de reden om nu te handelen in plaats van te wachten: het risico is aantoonbaar aanwezig in het laboratorium, en de stap van laboratorium naar productie wordt bepaald door hoe een organisatie het model inzet, niet door het model alleen. Een tweede onderscheid dat naar onze analyse uit het nieuws volgt: de standaard-weigering van een model is iets anders dan een beveiliging die ook onder vijandige prompts of na aanpassing van de gewichten blijft werken. Wie het eerste aanziet voor het tweede, overschat naar onze inschatting zijn controle.
Wat verandert er doordat GLM-5.3 een open-weight model is dat aangepast kan worden?
Bij een gehost model dwingt de aanbieder de veiligheidsmaatregelen af. Bij een open-weight model dat je downloadt, verschuift die verantwoordelijkheid naar wie het draait. De gerapporteerde omzeilingen, tot en met een geablatieerde versie waarvoor Anthropic in de simulatie een bypasspercentage van 100% rapporteerde, onderstrepen naar onze analyse dat op een ingebouwde weigering na modificatie niet als enige beveiligingslaag kan worden vertrouwd.
De bronnen laten één vraag open: welke maatregelen blijven effectief wanneer het model na download door derden wordt aangepast? Ons antwoord, als redactionele analyse: niet de weigeringslaag van het model, maar de omgeving eromheen. Dat betekent naar onze inschatting isolatie van productiesystemen, least-privilege toegang, standaard geblokkeerd uitgaand netwerkverkeer en monitoring op exploit-achtige uitvoer en tool-aanroepen. Deze controles werken onafhankelijk van wat er aan de modelgewichten is veranderd, terwijl een ingebouwde weigering dat niet doet. Dit sluit aan bij het bredere punt dat een hoge benchmarkscore geen bewijs is voor veilige inzet.
Wat betekent dit voor bestuurders, juristen en CISO's die met gevoelige informatie werken?
Onze analyse: omdat GLM-5.3 aantoonbaar werkende exploits kan produceren, is een generieke AI-goedkeuring naar onze inschatting onvoldoende; daarom adviseren wij de verantwoordelijke CISO om vóór elke productie-inzet een model- en versiespecifieke cyberevaluatie te eisen en daarbij vast te leggen of getest is met gehoste safeguards, aangepaste gewichten, tools of netwerktoegang. Omdat de weigeringslaag na modificatie kan wegvallen, is vertrouwen op de standaard-refusal naar onze inschatting riskant; daarom plaatst de infrastructuurbeheerder het model bij voorkeur in een geïsoleerde omgeving met standaard-deny uitgaand verkeer en least-privilege credentials, zodat een omzeiling geen pad naar echte systemen vindt. Omdat de tests gesimuleerd waren en een reëel incident niet uit te sluiten is, adviseren wij de organisatie om monitoring op exploit-gerichte uitvoer en tool-aanroepen in te richten plus een stop-, escalatie- en meldprocedure vast te leggen, zodat ingrijpen niet pas bij schade begint. En omdat het om een downloadbaar model gaat waarvan de herkomst en versie ertoe doen, legt de jurist of compliance-verantwoordelijke naar onze inschatting modelidentiteit, gewicht-herkomst, evaluatiecondities en goedkeuringen vast, zodat later te reconstrueren is onder welke voorwaarden het model is toegelaten.
Samengevat als checklist (naar onze analyse):
- Eis een model- en versiespecifieke cyberevaluatie vóór goedkeuring.
- Noteer of getest is met gehoste safeguards, aangepaste gewichten, tools of netwerktoegang.
- Isoleer het model van productiesystemen en gevoelige gegevens.
- Pas least-privilege credentials en standaard-deny uitgaand verkeer toe.
- Monitor op exploit-gerichte uitvoer en tool-aanroepen; bewaar logs en modelherkomst.
- Leg stop-, escalatie- en meldprocedures vast.
Dezelfde logica zagen we bij eerdere incidenten: behandel het geval waarin een AI-testomgeving productie raakt als een ketenbreed incidentresponsvraagstuk, en bouw beveiliging van private LLM-inferentie in lagen. Meer achtergrond over dit soort afwegingen staat in onze hub over AI-security en modelbeveiliging.
Bronnen en referenties
Bronnen: Het artikel steunt op de beoordeling van Anthropic van 29 september 2026, de onafhankelijke assessment van NIST (CAISI) en de officiële releasedocumentatie van Z.ai.