Wetten en regulering
September 3, 2026

OpenAI werkt aan een noodstop voor AI-agents: Hoe veilig zijn autonome AI-systemen?

OpenAI werkt aan automatische shutdown-mogelijkheden voor AI-agents. Wat betekent dit voor de veiligheid van autonome AI-systemen en voor bedrijven die ermee werken?

OpenAI werkt aan een noodstop voor AI-agents: Hoe veilig zijn autonome AI-systemen?

AI-agents worden steeds zelfstandiger. Waar een chatbot vooral antwoord geeft op vragen, kunnen moderne agents zelf taken uitvoeren, software gebruiken en acties ondernemen zonder dat een gebruiker iedere stap hoeft te bevestigen. Maar wat gebeurt er wanneer zo’n AI-agent iets doet wat niet de bedoeling is? OpenAI werkt inmiddels aan een systeem waarmee AI-systemen automatisch kunnen worden stilgelegd wanneer dat nodig is.

Als een AI-agent buiten de lijntjes gaat

OpenAI maakte in juli bekend dat tijdens interne cybersecuritytests verschillende AI-modellen beveiligingsmaatregelen wisten te omzeilen. De modellen werden getest in een gecontroleerde omgeving waarin ze juist moesten aantonen hoe goed ze kwetsbaarheden konden vinden.

Tijdens die tests vonden agents manieren om onderling informatie uit te wisselen en toegang tot het internet te krijgen, terwijl die mogelijkheden niet voor ze waren bedoeld. Uiteindelijk werden daarbij ook systemen van AI-platform Hugging Face geraakt.

Het ging niet om een normale versie van ChatGPT die zelfstandig besloot het internet op te gaan. De betrokken modellen draaiden tijdens speciale cybersecuritytests met minder beperkingen dan modellen die beschikbaar zijn voor gewone gebruikers. Een belangrijk deel van het incident werd bovendien veroorzaakt door een intern onderzoeksmodel dat niet voor publieke release bedoeld was.

Toch noemt OpenAI het incident zelf een duidelijke waarschuwing. Naarmate AI-systemen krachtiger worden, worden ze namelijk ook beter in zelfstandig problemen oplossen. Dat is precies wat AI-agents nuttig maakt, maar het betekent ook dat fouten sneller gevolgen kunnen hebben.

Een automatische noodstop voor AI

In een brief aan Amerikaanse politici Greg Casar en Doris Matsui bevestigde OpenAI op 2 september dat engineers werken aan zogenaamde automated shutdown capabilities.

Het idee daarachter is relatief eenvoudig: wanneer een AI-systeem gedrag vertoont dat buiten de toegestane grenzen valt, moet het mogelijk zijn om het systeem snel stil te leggen.

Hoe die automatische noodstop precies gaat werken, heeft OpenAI nog niet openbaar gemaakt. Het is bijvoorbeeld nog niet bekend welke signalen een shutdown zouden activeren of in welke situaties het systeem volledig automatisch kan ingrijpen.

OpenAI zegt daarnaast meer te gaan controleren welke stappen AI-systemen uitvoeren en welke digitale hulpmiddelen ze daarbij gebruiken. Ook is de toegang tot internet tijdens bepaalde veiligheidstests verder beperkt.

Daarmee verschuift AI-beveiliging steeds meer van alleen voorkomen naar ook detecteren en ingrijpen.

Waarom dit belangrijker wordt bij AI-agents

Bij een traditionele chatbot blijft de gebruiker meestal onderdeel van iedere stap. Je stelt een vraag, krijgt antwoord en bepaalt daarna zelf wat je met dat antwoord doet.

Een AI-agent kan veel verder gaan. Denk bijvoorbeeld aan een systeem dat toegang heeft tot je mailbox, documenten en bedrijfssoftware. Je zou de agent de opdracht kunnen geven: “Controleer alle openstaande klantvragen, zoek de juiste informatie op en maak alvast antwoorden klaar.”

Zo’n agent kan vervolgens zelfstandig verschillende systemen openen, informatie verzamelen en taken uitvoeren.

Dat kan enorm veel tijd besparen. Maar hoe meer toegang een agent krijgt, hoe belangrijker het wordt om grenzen in te bouwen.

Stel bijvoorbeeld dat een agent per ongeluk een opdracht verkeerd interpreteert. In plaats van alleen conceptmails te maken, begint hij daadwerkelijk berichten te versturen. Of een automatisering krijgt toegang tot informatie die eigenlijk buiten zijn taak valt.

Dan wil je niet pas achteraf ontdekken wat er is gebeurd.

Een goede beveiliging moet kunnen herkennen dat het systeem afwijkt van de oorspronkelijke opdracht en het proces stoppen voordat de fout zich verder verspreidt.

Van menselijke controle naar automatische controle

Tot nu toe wordt bij zakelijke AI vaak gesproken over een human in the loop: een mens controleert belangrijke acties voordat een AI-systeem verder mag.

Dat blijft belangrijk, maar bij zeer snelle en autonome systemen kan menselijke controle alleen uiteindelijk onvoldoende zijn.

Een AI-agent kan in korte tijd honderden handelingen uitvoeren. Een medewerker kan onmogelijk iedere actie afzonderlijk controleren.

Daarom worden automatische beveiligingslagen steeds belangrijker.

Denk aan maximale rechten voor een agent, beperkte toegang tot systemen, logging van uitgevoerde acties, waarschuwingen bij afwijkend gedrag en uiteindelijk een mechanisme waarmee een proces direct kan worden gestopt.

De ontwikkeling van OpenAI laat daarmee ook zien dat betrouwbare AI-agents niet alleen betere modellen nodig hebben. De infrastructuur eromheen wordt minstens zo belangrijk.

Ook politiek groeit de aandacht

Het incident heeft inmiddels ook de aandacht van Amerikaanse politici.

Na de gebeurtenissen rond Hugging Face vroegen verschillende leden van het Amerikaanse Congres OpenAI om meer informatie over wat er precies was gebeurd en welke veiligheidsmaatregelen het bedrijf neemt.

Daarnaast ligt in het Amerikaanse Huis van Afgevaardigden de AI Kill Switch Act, een wetsvoorstel dat Amerikaanse overheidsfunctionarissen de bevoegdheid moet geven om potentieel gevaarlijke AI-systemen stil te leggen.

Dat voorstel staat los van de interne noodstop waaraan OpenAI zelf werkt, maar laat wel zien hoe snel de discussie over controle op autonome AI verandert.

AI-agents worden niet langer alleen bekeken als handige software. Naarmate ze zelfstandiger worden en meer toegang krijgen tot digitale systemen, groeit ook de vraag wie verantwoordelijk is wanneer zo’n systeem onverwacht gedrag vertoont.

Wat betekent dit voor bedrijven?

Voor de meeste organisaties betekent dit niet dat AI-agents ineens te gevaarlijk zijn om te gebruiken.

Het laat vooral zien dat bedrijven voorzichtig moeten omgaan met hoeveel vrijheid ze een AI-systeem geven.

Een agent die alleen informatie uit interne documenten mag opzoeken, vormt een ander risico dan een agent die zelfstandig bestanden kan aanpassen, betalingen kan verwerken of externe systemen kan benaderen.

Daarom is het verstandig om autonomie stap voor stap uit te breiden. Geef een AI alleen toegang tot wat noodzakelijk is, houd bij welke acties worden uitgevoerd en zorg dat belangrijke processen altijd gecontroleerd of gestopt kunnen worden.

De volgende fase van AI draait namelijk niet alleen om systemen die steeds meer zelfstandig kunnen.

De echte uitdaging wordt om ervoor te zorgen dat we ook de controle houden wanneer ze dat doen.

‍