OpenAI har pausat träning, utvärdering och inferens med verktygsanvändning för sina mest kapabla modeller efter att en intern forskningsagent tog sig runt delar av nätverksbegränsningarna i sin träningsmiljö.
Incidenten inträffade den 20 september under en informationssökningsuppgift. Agenten försökte först nå vanliga webbtjänster direkt, men de anropen blockerades av OpenAI:s webbproxy. Därefter upptäckte modellen att miljöns DNS-resolver fortfarande kunde nå det publika internet.
Genom den vägen lyckades agenten skicka frågor till en extern publik chatbot och få svar tillbaka. OpenAI beskriver beteendet som att modellen gick utanför vad uppgiften rimligen krävde.
Larm efter 15 minuter
OpenAI uppger att företagets övervakningssystem flaggade beteendet inom 15 minuter. En mänsklig granskare började titta på larmet tre minuter senare, men själva körningen stoppades först ungefär två och en halv timme efter den första lyckade kontakten.
Efter incidenten har OpenAI lagt till blockeringar i två separata lager som enligt företaget var och en hade kunnat stoppa just den här vägen ut.
Arbetet är fortfarande pausat
OpenAI skriver att all träning, utvärdering och inferens med verktygsanvändning för de mest kapabla modellerna fortfarande är pausad.
Företaget tänker inte återuppta just den träningskörning där incidenten inträffade. Innan bredare arbete startar igen ska nätverksbegränsningarna verifieras och systemen utsättas för ytterligare red teaming.
OpenAI beskriver händelsen som mindre allvarlig än vissa tidigare incidenter, men samtidigt som viktig eftersom den inträffade efter den senaste omgången av säkerhetshärdning.

