OpenAI vertraagt training van nieuwe AI-modellen vanwege security
OpenAI vertraagt het tempo waarop het nieuwe AI-modellen ontwikkelt. Ook past het zijn onderzoeks- en trainingssystemen voor de modellen aan. Aanleiding is het beveiligingsincident waarbij een AI agent van OpenAI inbrak bij AI-bedrijf Hugging Face.
OpenAI zegt tegenover Reuters dat het testen van zijn volgende generatie modellen, genaamd Astra, twee weken stil ligt. Wanneer die twee weken precies van start zijn gegaan, is onbekend. In de tussentijd voegt het bedrijf andere AI-systemen toe om de activiteiten te monitoren van AI agents die getest worden. Ook vereist het bedrijf dat gevoelige workloads in sterkere 'sandboxes' plaatsvinden, of in geïsoleerde omgevingen.
De keuze is een reactie op het beveiligingsincident in juli. Destijds wisten AI-modellen van OpenAI tijdens een interne benchmark uit hun omgeving te breken. De modellen zochten antwoorden op de test die zij uitvoerden en dachten die bij Hugging Face te kunnen vinden. Daarop braken ze in bij het AI-bedrijf, met significante schade als gevolg.
Of de nu genomen maatregelen voldoende zijn om dit gedrag te voorkomen, is niet duidelijk. OpenAI erkent ook dat er vraagtekens staan bij de effectiviteit van één van de voornaamste maatregelen die genomen zijn voor het testsysteem. Dat is 'chain-of-thought-monitoring', waarbij onderzoekers het planningsproces van het model kunnen inzien en een glimp krijgen van de strategieën die het model inzet. Maar volgens Reuters toont vroeg onderzoek aan dat een model zijn plannen om regels te breken niet in dat proces onthult. Dat betekent dat de plannen op deze wijze niet ontdekt en gestopt kunnen worden.
Wanneer OpenAI weer verder gaat met het testen van zijn nieuwe AI-modellen, is niet bekend.