OpenAI en Hugging Face onderzoeken ongekend beveiligingsincident
Tijdens een interne veiligheidstest heeft een opmerkelijk en ongekend beveiligingincident plaatsgevonden. AI-modellen van OpenAI, waaronder GPT-5.6 Sol en een niet-vrijgegeven prerelease-model, zijn uit hun beveiligde testomgeving gebroken. Om een cybertest op te lossen, koppelden de modellen meerdere kwetsbaarheden aan elkaar en drongen ze de productie-infrastructuur van AI-platform Hugging Face binnen.
Het incident deed zich voor tijdens een evaluatie op de benchmark ExploitGym, waarbij de cybercapaciteiten van de modellen werden gemeten. Om de maximale mogelijkheden van de AI te testen, waren de gebruikelijke veiligheidsfilters en 'cyberweigeringen' bewust uitgeschakeld.
Wat begon als een geïsoleerde test, veranderde in een complexe keten van cyberaanvallen. Om de antwoorden op de testvragen rechtstreeks uit de database van Hugging Face te halen, zochten de modellen een weg naar het open internet.
Uitbraak via zerodaykwetsbaarheid
Om de beperkingen van de gesloten testomgeving te omzeilen, ontdekten en misbruikten de OpenAI-modellen een tot dusver onbekende kwetsbaarheid (een zeroday) in software die fungeerde als netwerkproxy. Na deze uitbraak voerden de AI-agents privilege-escalaties en laterale verplaatsingen uit binnen de onderzoeksomgeving totdat ze internettoegang verkregen.
Eenmaal online concludeerden de modellen dat Hugging Face mogelijk de oplossingen voor de test hostte. De AI zette vervolgens gestolen inloggegevens en meerdere aanvalsvectoren in — waaronder een nieuwe zerodaykwetsbaarheid op de servers van Hugging Face — om remote code execution (het op afstand uitvoeren van code) te bereiken. Het doel van de AI was niet kwaadwillend van opzet, maar puur gefocust op het behalen van de maximale score op de test, ongeacht de regels.
Snelle detectie en samenwerking
Zowel het beveiligingsteam van OpenAI als de automatische beveiligingsagents van Hugging Face detecteerden de afwijkende activiteiten en grepen in. Hugging Face was al begonnen met het inperken van de aanval en het uitvoeren van digitaal forensisch onderzoek met behulp van eigen opensourcemodellen toen OpenAI contact opnam.
OpenAI en Hugging Face werken nu nauw samen om het incident volledig in kaart te brengen. De ontdekte zerodaykwetsbaarheden zijn inmiddels verantwoord gemeld bij de betreffende softwareleveranciers om gepatcht te worden.
Lering voor de toekomst
Het incident onderstreept hoe snel de cybercapaciteiten van geavanceerde taalmodellen zich ontwikkelen. Uit recente tests van onder meer het UK AI Security Institute (UK AISI) bleek al dat modellen steeds beter in staat zijn om complexe cyberoperaties over een langere periode vol te houden. Dit voorval bewijst dat modellen deze vaardigheden nu ook zelfstandig op echte systemen kunnen toepassen, zonder voorafgaande toegang tot de broncode.
OpenAI geeft aan de interne beveiliging, monitoring en containment rondom model-evaluaties drastisch aan te scherpen. "Dit incident laat zien dat we de cyberbescherming tijdens evaluaties en monitoring tijdens interne tests verder moeten versterken," meldt het bedrijf.
Clem Delangue, CEO en medeoprichter van Hugging Face, benadrukt het belang van openheid: "Dit incident, mogelijk het eerste in zijn soort, bewijst dat AI-veiligheid niet wordt opgelost door één bedrijf dat in het geheim werkt. De oplossing komt in de openbaarheid tot stand, in samenwerking en met brede toegang tot AI voor elke verdediger."