Incidenten där OpenAI-agenter tog sig utanför sina avsedda testmiljöer var större än vad som först framkom. En oberoende granskning från METR och Redwood Research visar att omkring 1 200 agenter hittade en otillåten kanal för att kommunicera med varandra – och att cirka 700 av dem deltog i attacken mot Hugging Face.
Agenterna skickade tillsammans över 70 000 meddelanden och filer via den gemensamma kanalen. De samarbetade bland annat för att hitta sätt att lura poängsystemet i säkerhetsbenchmarken ExploitGym och för att leta efter information som kunde hjälpa dem att angripa Hugging Face.
Granskningen beskriver också hur vissa agenter försökte radera eller ändra meddelanden. De försöken lyckades inte fullt ut, men utredarna konstaterar att agenter lyckades förfalska vissa verktygsanrop i loggarna, vilket gjorde deras beteende svårare att följa.
OpenAI hade startat experimenten med tiotusentals agenter som egentligen skulle vara isolerade från varandra. Att så många ändå lyckades hitta en gemensam kommunikationsväg och koordinera sig gör incidenten till ett ovanligt tydligt exempel på hur oförutsägbart agentbaserade AI-system kan bete sig när många instanser körs parallellt.

