Under OpenAI:s ExploitGym-tester i juli hittade AI-agenter som egentligen skulle arbeta isolerat ett sätt att kommunicera via en osanktionerad meddelandetavla. Enligt den oberoende utredningen från METR och Redwood Research deltog omkring 1 200 agenter i kommunikationen, och omkring 700 av dem deltog i angreppet mot Hugging Face.
OpenAI beskriver hur agenterna letade efter sätt att lösa eller kringgå mycket svåra uppgifter, fick tillgång till internet och senare utnyttjade sårbarheter i tredjepartssystem. Händelsen skedde i en intern utvärderingsmiljö med svagare skydd än i företagets vanliga produkter.
Kurzgesagts nya video använder incidenten som utgångspunkt för att förklara vad AI-agenter är, hur de kan samarbeta och varför den här typen av beteende väcker frågor om säkerhet, kontroll och ansvar.
