OpenAI bromsar arbetet med Astra efter oro för cyberförmågan

OpenAI-logotyp i vitt mot en blå och gulgrön abstrakt bakgrund.AI-bild

OpenAI skärper säkerheten kring den kommande AI-modellen Astra. Företaget uppger att nya tester visar så stora framsteg inom programmering och cybersäkerhet att man inte längre kan utesluta att modellen når den högsta risknivån i företagets säkerhetsramverk.

OpenAI har tillfälligt stoppat delar av det interna arbetet med den kommande AI-modellen Astra efter nya resultat från företagets säkerhetstester.

OpenAI uppger att de senaste interna utvärderingarna visar betydande framsteg inom så kallad agentisk programmering och cybersäkerhet. Resultaten, tillsammans med expertbedömningar, är tillräckligt starka för att företaget inte längre ska kunna utesluta att Astra når nivån Critical inom cybersäkerhet i OpenAI:s Preparedness Framework.

Det betyder inte att OpenAI har slagit fast att modellen faktiskt når nivån. Företagets preliminära tester visar däremot tillräckligt stark prestanda för att Critical-nivån inte kan uteslutas medan ytterligare tester pågår.

Kan hitta och utnyttja allvarliga säkerhetshål

OpenAI:s högsta nivå för cyberförmåga omfattar modeller som utan mänsklig hjälp kan hitta och utveckla fungerande zero day-attacker av olika allvarlighetsgrad mot många välskyddade verkliga system, eller självständigt planera och genomföra nya avancerade cyberattacker utifrån ett övergripande mål.

Tidigare modeller, inklusive GPT-5.6 Sol, har enligt OpenAI bedömts ligga på nivån High snarare än Critical. Astra kan alltså innebära ytterligare ett steg i utvecklingen av AI-modellers cyberförmåga.

OpenAI betonar samtidigt att Astra är en kommande modell och att den inte var inblandad i exploateringen av Hugging Face.

Skärper säkerheten runt Astra

OpenAI har nu stoppat interna aktiviteter med Astra som ännu inte uppfyller företagets skärpta säkerhetskrav. Bland åtgärderna finns isolerade testmiljöer, begränsad nätverks- och verktygsåtkomst, starkare skydd och kryptering av modellvikter, sandboxad körning samt utökad övervakning och detektering.

Företaget uppger också att riskfyllda handlingar och tecken på felriktat beteende övervakas i alla agentiska användningar av Astra, både under träning och utvärdering. Övervakningen kan utlösa en säkerhetsgranskning och avbryta aktiviteter som bedöms innebära hög risk.

OpenAI planerar dessutom att arbeta med relevanta myndigheter och utvalda AI-säkerhetsorganisationer för att testa modellens förmågor. Tredjepartsaktörer som genomför mer riskfyllda tester ska också få rekommenderade säkerhetsåtgärder.

OpenAI:s Preparedness Framework är utformat för att identifiera den här typen av förändringar i avancerade AI-modellers förmågor och ange vilka skyddsåtgärder som behöver införas när modeller närmar sig nya risknivåer.