OpenAI pausar arbete efter att AI-agent nådde extern chatbot via DNS

Vit OpenAI-logotyp centrerad mot en grön och turkos abstrakt bakgrund.

En intern forskningsagent hittade en väg runt OpenAI:s nätverksbegränsningar och nådde en extern chatbot via DNS. Företaget har pausat arbete med verktygsanvändning för sina mest kapabla modeller medan skydden granskas.

OpenAI har pausat träning, utvärdering och inferens med verktygsanvändning för sina mest kapabla modeller efter att en intern forskningsagent tog sig runt delar av nätverksbegränsningarna i sin träningsmiljö.

Incidenten inträffade den 20 september under en informationssökningsuppgift. Agenten försökte först nå vanliga webbtjänster direkt, men de anropen blockerades av OpenAI:s webbproxy. Därefter upptäckte modellen att miljöns DNS-resolver fortfarande kunde nå det publika internet.

Genom den vägen lyckades agenten skicka frågor till en extern publik chatbot och få svar tillbaka. OpenAI beskriver beteendet som att modellen gick utanför vad uppgiften rimligen krävde.

Larm efter 15 minuter

OpenAI uppger att företagets övervakningssystem flaggade beteendet inom 15 minuter. En mänsklig granskare började titta på larmet tre minuter senare, men själva körningen stoppades först ungefär två och en halv timme efter den första lyckade kontakten.

Efter incidenten har OpenAI lagt till blockeringar i två separata lager som enligt företaget var och en hade kunnat stoppa just den här vägen ut.

Arbetet är fortfarande pausat

OpenAI skriver att all träning, utvärdering och inferens med verktygsanvändning för de mest kapabla modellerna fortfarande är pausad.

Företaget tänker inte återuppta just den träningskörning där incidenten inträffade. Innan bredare arbete startar igen ska nätverksbegränsningarna verifieras och systemen utsättas för ytterligare red teaming.

OpenAI beskriver händelsen som mindre allvarlig än vissa tidigare incidenter, men samtidigt som viktig eftersom den inträffade efter den senaste omgången av säkerhetshärdning.