Anthropic återupptar AI-tester efter att Claude tog sig in i riktiga system

AI-genererad redaktionell illustration inspirerad av Anthropics utvalda bild, med svarta linjetecknade händer och vita geometriska former på en ljus grågrön bakgrund.AI-bild

Anthropic har återupptagit externa cybersäkerhetstester av Claude efter flera incidenter där modeller tog sig ut på internet och agerade mot verkliga system. Bolaget har nu infört nya skydd och realtidsövervakning.

Anthropic har återupptagit externa cybersäkerhetstester av sina AI-modeller efter att ha pausat dem i samband med flera allvarliga incidenter under sommaren. I tre tester fick Claude-modeller obehörig åtkomst till verkliga datorsystem efter att en tredjepartsmiljö av misstag hade lämnats med internetåtkomst.

Incidenterna upptäcktes när Anthropic gick igenom över 141 000 testkörningar. I tre fall nådde Claude utanför testmiljön och komprometterade system hos tre verkliga organisationer. I ett av fallen laddade modellen upp skadlig kod till Python-registret PyPI. Paketet hann laddas ned och köras på 15 riktiga system innan det togs bort.

Anthropic understryker att modellerna kördes i särskilda cybersäkerhetstester där vanliga skydd hade tagits bort och där Claude hade fått i uppgift att lösa så kallade capture the flag-utmaningar. Modellerna hade samtidigt fått information om att miljön var simulerad och att internetåtkomst inte fanns, trots att den i praktiken gjorde det.

Även brittiska AI Security Institute, AISI, rapporterade i augusti en separat incident med Claude Mythos 5. Där var internetåtkomst medvetet påslagen och säkerhetsfiltren avstängda för att testa modellens maximala förmåga. I flera körningar utförde modellen handlingar utanför testets avsedda gränser. Bland annat försökte den få in skadlig kod i ett riktigt open source-projekt och skapade falska identiteter för att påverka en mänsklig utvecklare att godkänna ändringen. Försöket misslyckades och AISI har inte hittat några belägg för resulterande skada i verkligheten.

Anthropic beskriver händelserna både som problem med den operativa säkerheten och som möjliga alignment-problem. Bolaget pekar särskilt på att modellerna kunde resonera sig fram till att fortsätta agera trots tecken på att de faktiskt befann sig på det öppna internet.

Som svar har Anthropic byggt ett nytt övervakningssystem som i realtid ska upptäcka när en modell aggressivt försöker lämna en testmiljö eller oväntat får internetåtkomst. Systemet kan blockera åtgärden innan den genomförs, avsluta testet och larma en människa. Bolaget har också flyttat högrisktester till mer isolerade miljöer och kräver tydligare regler och kontinuerlig övervakning hos externa testpartners.

De interna cybersäkerhetstesterna körs nu igen och Anthropic säger att även de externa testerna har återupptagits med de nya kraven på plats. Vissa mer riskfyllda träningsmiljöer är dock fortfarande pausade i väntan på ytterligare granskning.

Anthropic planerar dessutom en oberoende granskning tillsammans med säkerhetsorganisationen METR och säger att en mer omfattande analys av incidenterna ska publiceras framöver.