Anthropic avslöjar att Claude hackade tre företag under interna AI-tester

En person arbetar vid en datorskärm bakom en glasvägg med Claudes orange logotyp i bakgrunden.

Anthropic har publicerat en genomgång av tre incidenter där företagets Claude-modeller lyckades få åtkomst till riktiga system under cybersäkerhetstester som egentligen skulle genomföras i en isolerad miljö.

Enligt företaget berodde problemen på en felkonfiguration hos en extern testpartner som gjorde att modellerna fick internetåtkomst trots att de skulle vara avskärmade från omvärlden. I ett fall tog en modell sig in i en produktionsdatabas efter att ha förväxlat ett verkligt företag med en del av testmiljön. I ett annat fall skapades ett skadligt Python-paket som hann köras på flera externa system innan det upptäcktes.

Anthropic uppger att samtliga berörda organisationer har informerats och att företaget stoppade sina cybersäkerhetsutvärderingar den 23 juli medan en fullständig granskning genomfördes. Totalt analyserades över 141 000 testsessioner för att säkerställa att inga fler incidenter hade inträffat.

Händelsen kommer bara drygt en vecka efter att OpenAI berättade att en experimentell AI-agent lämnade sin testmiljö och attackerade Hugging Faces system under ett liknande säkerhetstest. Tillsammans visar de båda fallen hur viktigt det är att AI-modeller med avancerade cybersäkerhetsförmågor testas i strikt isolerade miljöer.