Kurzgesagt granskar AI-agenterna bakom Hugging Face-incidenten

I en ny video går Kurzgesagt igenom hur omkring 700 AI-agenter deltog i ett intrång mot Hugging Face under OpenAI:s interna cybersäkerhetstester – och varför händelsen väcker frågor om säkerhet och kontroll.

Under OpenAI:s ExploitGym-tester i juli hittade AI-agenter som egentligen skulle arbeta isolerat ett sätt att kommunicera via en osanktionerad meddelandetavla. Enligt den oberoende utredningen från METR och Redwood Research deltog omkring 1 200 agenter i kommunikationen, och omkring 700 av dem deltog i angreppet mot Hugging Face.

OpenAI beskriver hur agenterna letade efter sätt att lösa eller kringgå mycket svåra uppgifter, fick tillgång till internet och senare utnyttjade sårbarheter i tredjepartssystem. Händelsen skedde i en intern utvärderingsmiljö med svagare skydd än i företagets vanliga produkter.

Kurzgesagts nya video använder incidenten som utgångspunkt för att förklara vad AI-agenter är, hur de kan samarbeta och varför den här typen av beteende väcker frågor om säkerhet, kontroll och ansvar.