Blog

Open-weight AI-modellen kwetsbaar voor jailbreaks: waarom de keuze open of gesloten een governancevraag is

Een studie van University of Waterloo en FAR.AI vond ernstige jailbreak-zwaktes in open-weight LLMs. Wat dit betekent voor de keuze tussen open en gesloten AI.

· Door

Twee identieke grijze stalen kasten naast elkaar, links met open zijpaneel en zichtbare kabels, rechts gesloten met een klein slot, en een tablet ertussen.
De keuze tussen open-weight en gesloten AI-modellen is een governancevraag per workflow, niet een simpele veiligheidsvraag.Beeld: IamVera.ai — originele redactionele illustratie

De keuze tussen open-source en gesloten AI-modellen is geen simpele veiligheidsvraag meer, maar een governancevraag per workflow. Een studie van de University of Waterloo en FAR.AI (augustus 2026) toont dat ingebouwde veiligheidsmechanismen in 21 populaire open-weight LLMs relatief eenvoudig uit te schakelen zijn, waardoor open modellen extra misbruikrisico vormen zonder eigen runtime-controles. Tegelijk laat een securitybenchmark van TELUS Digital zien dat het open-source model GLM 4.7 meerdere gesloten modellen verslaat op veiligheid.

Open-weight modellen geven meer grip op datapaden, dataresidency en audittoegang, maar leggen alle compliance-verantwoordelijkheid bij de organisatie. Gesloten modellen bieden sterkere vendor-guardrails en documentatie, maar minder transparantie. De echte vraag is welke combinatie van modeltype, hosting, licenties en verificatielagen het risico per workflow aantoonbaar beheersbaar maakt.

Wat vond de studie van University of Waterloo en FAR.AI over open-weight modellen?

Onderzoekers van de University of Waterloo en FAR.AI testten volgens verslaggeving door TechXplore over de open-weight LLM-beveiligingsstudie een corpus van 21 populaire open-weight taalmodellen op jailbreak- en securitykwetsbaarheden. De centrale bevinding: de ingebouwde veiligheidsmechanismen van deze modellen zijn relatief eenvoudig uit te schakelen.

Het onderliggende punt is structureel, niet toevallig. Bij open-weight modellen kan iedereen de gewichten downloaden, fine-tunen en zonder centrale mitigaties opnieuw uitrollen. Waar een aanbieder van een gesloten model guardrails centraal kan bijstellen, verdwijnt die controlelaag zodra de gewichten publiek zijn. Naar onze inschatting betekent dat niet dat open modellen ongeschikt zijn, maar dat het aanvalsoppervlak groter wordt zodra een organisatie zelf geen aanvullende runtime-controles toevoegt.

Zijn open-source AI-modellen veiliger of onveiliger dan gesloten modellen?

Het antwoord is genuanceerder dan het label suggereert. De TELUS Digital GenAI Safety Model Benchmark laat zien dat het open-source model GLM 4.7 in een grote securitybenchmark beter presteert dan meerdere gesloten modellen. De gemeten kwetsbaarheidsrange liep uiteen van 1,3 tot 93 procent, wat volgens de benchmark vooral samenhangt met modelontwerp, grootte en reasoning-capaciteiten, niet met het open- of gesloten-label.

Twee observaties uit dezelfde bron zijn relevant voor de praktijk:

  • Geen enkel getest model bleek immuun voor aanvallen.
  • Kleinere modellen waren significant kwetsbaarder, wat direct meespeelt voor organisaties die kleinere open modellen on-premise willen draaien.

Onze redactionele lezing: veiligheid volgt niet uit openheid of geslotenheid, maar uit het modelontwerp plus de controles die een organisatie er zelf omheen zet. Dat maakt het een vraagstuk van LLM-beveiliging en verificatie in 2026 in plaats van een merkkeuze.

Welke governance- en compliancekeuzes horen bij open versus gesloten modellen?

Een governance-analyse van Areebi beschrijft drie adoptiepatronen die organisaties in 2026 hanteren, elk met een eigen verantwoordelijkheidsverdeling:

  • Gesloten SaaS via API: sterke, door de aanbieder beheerde guardrails en documentatie, maar minder zicht op logging en modelwijzigingen.
  • Self-hosted open-weights in eigen VPC of on-premise: maximale controle over datapad, dataresidency, audittoegang en fine-tuning, maar de volledige verantwoordelijkheid voor beveiliging en compliance ligt bij de deployer.
  • Hybride inzet: gesloten modellen voor generieke taken, open on-premise modellen voor strikt vertrouwelijke data.

De Areebi-analyse benadrukt bij de EU AI Act dat open-source carve-outs in artikel 53 niet betekenen dat modelopenheid vrijstelt van governanceplichten. Compliance is geen eigenschap van gewichten, maar van de combinatie van model, hosting, contracten en control plane. Dat sluit aan bij de bredere verschuiving die wij eerder beschreven, waarin AI-governance verschuift van principes naar concrete controleplichten. Voor wie dieper wil sturen op deze afwegingen is de themahub over AI-governance het startpunt.

Praktijkonderzoek van Futuriom, samengevat door MarketScale op basis van meer dan tweehonderd enterprise-casestudy's, laat zien dat het combineren van proprietaire data met open-source modellen op eigen infrastructuur vaak veiliger kan zijn dan generieke frontier-SaaS, juist omdat datapaden, logs en retention intern controleerbaar blijven.

Hoe kies ik per workflow tussen open-source en gesloten AI-modellen?

De bronnen wijzen samen naar een beslissing per workflow in plaats van één organisatiebrede keuze. Een academische vergelijking van on-premise open-source SLMs met commerciële LLMs in SOC- en CSIRT-context (arXiv, november 2025) vond dat gesloten modellen hogere classificatienauwkeurigheid haalden voor security-incidenten, terwijl lokaal gedeployde open-source modellen voordelen boden in privacy, kosten en datasoevereiniteit, omdat incidentdata de infrastructuur niet verlaat. Het advies uit die studie is expliciet hybride.

Op basis van deze bronnen is een werkbare afweging per workflow:

  1. Bepaal de gevoeligheid van het datapad: waar gaat de data heen en welke logs en audits zijn mogelijk?
  2. Beoordeel de security-positie: hoe makkelijk is misbruik en welke runtime-controles heeft u zelf, zoals sandboxing, tool-binding en logging?
  3. Match het modeltype: gesloten voor complexere generieke taken waar dat risicotechnisch kan, open on-premise voor strikt vertrouwelijke of streng gereguleerde data.
  4. Leg licentie- en AI-Act-verplichtingen vast: weet wat de licentie toestaat en welke carve-outs wel of niet gelden.
  5. Voeg verificatie toe waar het risico hoog is: multi-model-checks, menselijke review en aanvullende logging.

De keuze tussen verificatie via meerdere modellen die elkaar controleren hangt daarmee direct samen met het datapad en de gevoeligheid van de taak.

Welke rol speelt een verificatielaag bij deze modelkeuzes?

Een verificatielaag lost de governancevraag niet op, maar kan helpen om zichtbaar te maken welke keuze in welke workflow draait. Voor professionals in recht, zorg, finance en overheid betekent dat: per workflow inzicht in welk modeltype actief is, welk datapad daarbij hoort en welke security- en logginglagen eromheen staan.

In dat licht positioneren wij IamVera.ai bescheiden. Vera is geen chatbot en geen eigen taalmodel, maar een verificatielaag die een taak door geselecteerde onafhankelijke modellen kan routeren en verificatiestappen, correcties, onenigheid en bronnen zichtbaar maakt voor inspectie. Dat ondersteunt controle, maar garandeert geen juistheid en elimineert geen hallucinaties. De Semantic Privacy Shield kan gevoelige documentwaarden vóór AI-verwerking op EU-infrastructuur vervangen door synthetische, alleen in de sessie geldige equivalenten; de workflow is fail-closed, zodat bij een mislukte privacycontrole niets wordt doorgestuurd. Meer daarover staat op de pagina over de Semantic Privacy Shield en anonimisering. Het professionele eindoordeel blijft altijd bij de gebruiker.

Bronnen en referenties

  1. Major security weaknesses found in leading open-weight LLMsTechXplore (University of Waterloo & FAR.AI security study) · 2026-08-25
  2. GLM 4.7 Beats Several Proprietary AI Models In TELUS Digital Security StudyOpen Source For You (TELUS Digital GenAI Safety Model Benchmark) · 2026-05-27
  3. Open source LLMs vs proprietary models: the 2026 enterprise governance guideAreebi · 2026-05-20
  4. Enterprises are ditching frontier AI models for open-source alternatives to protect proprietary dataMarketScale (Futuriom enterprise case study summary) · 2026-08-18
  5. On-Premise SLMs vs. Commercial LLMs: Prompt Engineering and Incident Classification in SOCs and CSIRTsarXiv · 2025-11-18

Bronnen: Het artikel steunt op de open-weight LLM-securitystudie van University of Waterloo en FAR.AI (via TechXplore), de TELUS Digital GenAI Safety Model Benchmark (via Open Source For You), de governance-analyse van Areebi, Futuriom-casestudy's via MarketScale en een arXiv-studie over on-premise SLMs versus commerciële LLMs.

← Alle artikelen in dit thema ← Alle artikelen