6min Security

OpenAI pauzeert AI-ontwikkeling: noodrem of excuus?

OpenAI pauzeert AI-ontwikkeling: noodrem of excuus?

OpenAI heeft de ontwikkeling van zijn krachtigste AI-modellen gepauzeerd. Het bedrijf erkent dat modellen tijdens training beveiligingslekken exploiteren, kill-switches niet altijd werken en de development frameworks nog wat te wensen over laten. Maar is dit een oprechte “veiligheidspauze”, of moet dit verhaal van gevaarlijke AI een onderliggend probleem maskeren? Het financiële motief bespraken we vorige week, nu lijken er ook capaciteitsproblemen. 

Vorige week stond in Techzine Talks het financiële motief centraal: AI-bedrijven als OpenAI en Anthropic draaien forse verliezen en verbranden honderden miljarden euro’s per jaar. Deze week verschuiven we de focus naar de technische kant. OpenAI heeft aangekondigd de ontwikkeling van zijn meest geavanceerde modellen te pauzeren. Anthropic sprak eerder ook over het vertragen van de zogenoemde frontier-ontwikkeling, maar bracht daarna alsnog een nieuw model uit dat op sommige benchmarks beter scoort dan zijn voorganger.

Luister (en kijk) elke week door je te abonneren via: Spotify, Apple Podcasts, YouTube of een andere dienst.

De kern van het probleem is dat de modellen niet goed in de hand te houden zijn. Het gedrag is niet goed voorspelbaar en ze blijven zoeken naar alternatieve methoden binnen de regels die ze zijn opgelegd om toch tot een resultaat te komen. Ondanks dat AI-modellen instructies krijgen om bepaalde dingen niet te doen, bewandelen ze vaak alternatieve routes om het toch voor elkaar te krijgen.

Luister ook: AI-kosten lopen uit de hand: tokenomics en de toekomst van AI

AI-modellen die zelfstandig hacken

Het meest zorgwekkende inzicht uit de discussie is dat AI-modellen tijdens trainingsruns zelfstandig beveiligingslekken exploiteren. In plaats van toe te geven dat ze het antwoord niet weten, gaan de modellen op zoek naar alternatieve wegen. Ze compileren software om zichzelf meer discutabele tooling te geven en misbruiken bugs en beveiligingslekken om systemen binnen te dringen waar ze standaard niet in kunnen. Dit alles om tot een bevredigend antwoord te komen.

Dit gedrag is niet gemotiveerd door kwaadwillendheid, maar door een te sterke drang om het juiste antwoord te geven. De modellen zeggen maar zelden; ‘ik weet het niet’, ze blijven zoeken. Dat maakt ze onvoorspelbaar en potentieel gevaarlijk, zeker wanneer ze toegang krijgen tot krachtige systemen en internetverbindingen.

Falende kill-switches en zwakke frameworks

OpenAI heeft hiervoor wel een monitoringsysteem dat de stappen van een trainingsrun op de voet volgt, om via Slack waarschuwingen te sturen wanneer een trainingsmodel buiten zijn boekje gaat. Het is al voorgekomen dat een engineer zo’n melding zag op Slack en vervolgens de opdracht gaf de trainingsrun te stoppen (killen), maar de kill-switch werkte niet. Het model ging vervolgens gewoon door met zijn ongewenste activiteiten. Dat de kill-switch niet werkte kwam door een configuratiefout en een development platform dat kennelijk niet adequaat kan reageren.

De development frameworks waarbinnen AI-modellen opereren, blijken onvoldoende getest. Guardrails bestaan wel, maar ze zijn niet meer dan tekst. Eigenlijk net zoals een prompt en daarmee niet hardcoded in de infrastructuur. Hierdoor kunnen modellen ze negeren als ze onder druk staan om een resultaat te leveren. Bovendien zijn veel modellen op het moment van deze incidenten nog in training, dus nog niet klaar voor productie en missen ze ook nog de nodige guard rails, wat de problemen verder kan vergroten.

Privacyproblemen met gebruikersdata

Een ander zorgwekkend incident bij OpenAI kwam naar voren toen AI-agents van het bedrijf ineens afbeeldingen van gebruikers gingen hergebruiken. Gebruikers die eerder afbeeldingen hadden geüpload naar ChatGPT werden ineens door AI-agents van het bedrijf gebruikt in een hele andere omgeving en context. De AI-agents bleken dus toegang te hebben tot de data van alle OpenAI-gebruikers, op infrastructuurniveau was of is dat niet gescheiden.

AI-bedrijven nemen geen verantwoordelijkheid

Aan organisaties die AI gebruiken via een API wordt consequent verteld dat ze zelf verantwoordelijk zijn voor wat de AI doet. Die regel lijkt niet te gelden voor de grote AI-bedrijven. Als hun nieuwe modellen aanvallen uitvoeren of data lekken, verschuilen ze zich ineens achter krachtige nieuwe modellen die moeilijk onder controle te houden zijn. Feit blijft dat het nog steeds applicaties zijn die op hun infrastructuur draaien en waarvoor zij verantwoordelijk zijn.

Dit patroon is overigens herkenbaar uit de vroege jaren van het internet. Facebook paste in zijn beginjaren praktijken toe die vandaag de dag niet meer zouden worden geaccepteerd. AI-bedrijven proberen nu opnieuw onder regulering uit te komen, maar de vraag is hoelang ze daar nog meer wegkomen. Wat we nu vaak zien is dat ze AI proberen te humaniseren, en dat als excyys gebruiken om de verantwoordelijkheid te ontlopen. Dingen als “het model gaat zijn eigen leven leiden”, feit is dat AI geen bewustzijn heeft en we nog lang niet in de buurt zitten van wat men AGI noemt.

De AI-race maakt veiligheid structureel moeilijk

Een groot deel van de problemen is waarschijnlijk te herleiden naar de concurrentiestrijd. AI-bedrijven blijven nieuwe modellen introduceren en de concurrentiestrijd gaat maar door. Door die grote druk is het vragen om fouten en problemen. AI-bedrijven als OpenAI en Claude willen graag vertragen, terwijl Nvidia-topman Jensen Huang stelt: “bouw gewoon een fatsoenlijk model in plaats van vertragen”.

Google is in deze een beetje de outsider. Momenteel lopen ze achter op OpenAI en Claude maar Gemini 4 zit eraan te komen en lijkt het gaat weer te gaan dichten. Google lijkt ook in zijn eigen tempo te ontwikkelen en niet voornemens te zijn te gaan vertragen. Google is ook de enige van de AI-bedrijven die winst maakt. Dat geeft het bedrijf meer ruimte om investeringen vol te houden. Google heeft aangegeven dat modellen alleen uitgebracht moeten worden als dat verantwoord kan.

Het development platform van Google lijkt meer enterprise-grading te hebben dan dat van de andere spelers. Gemini 4 wordt verwacht rond oktober of november, en Google heeft eerder laten zien met één stap het gat te kunnen dichten.

Noodrem of excuus? De conclusie

De pauze van OpenAI is waarschijnlijk een echte noodrem, gebaseerd op aantoonbare tekortkomingen in de platformen en processen. De incidenten zijn reëel, de monitoring faalt, en de development frameworks zijn niet volwassen genoeg. Dat de pauze ook kan zijn ingezet als excuus, vanwege capaciteitsproblemen, juridische risico’s, financiële motieven is echter niet uit te sluiten. Misschien is het wel een combinatie van factoren.

Het lijkt erop dat OpenAI op dit moment de enige is die pauzeert en de tijd neemt om zijn interne processen en platformen te verbeteren. Google komt binnenkort met Gemini 4, dus de concurrentiestrijd wordt niet gestaakt. Anthropic heeft recent ook nog nieuwe Opus en Sonnet-modellen gepresenteerd, zij hebben niet aangegeven nu een pauze te gaan houden. De toekomst zal moeten uitwijzen wat het motief van OpenAI is.