OpenAI drar i bromsen för delar av utvecklingen av sin kommande AI-modell Astra. Bakgrunden är att interna tester visar så stora framsteg inom agentbaserad programmering och cybersäkerhet att bolaget inte längre kan utesluta att modellen når den högsta risknivån för cyberförmågor i OpenAI:s eget Preparedness Framework.
En modell på den så kallade kritiska nivån skulle enligt OpenAI bland annat kunna hitta och utveckla fungerande nolldagssårbarheter i väl skyddade verkliga system utan mänsklig hjälp, eller självständigt planera och genomföra avancerade cyberattacker utifrån ett övergripande mål.
OpenAI har därför pausat de interna aktiviteter kring Astra som ännu inte uppfyller bolagets skärpta säkerhetskrav. Bland åtgärderna finns mer isolerade testmiljöer, begränsad tillgång till nätverk och verktyg, starkare skydd av modellvikter och utökad övervakning.
Reuters rapporterar att inbromsningen är ovanlig för OpenAI och följer på en period där bolaget pressat utvecklingen framåt i hård konkurrens med andra AI-företag. Sam Altman säger i en intervju med Time att han inte gillar kapplöpningen i branschen och att behovet av att reagera på vad konkurrenterna gör skapar en farlig dynamik. Han beskriver situationen som en bra tid att trappa ner takten.
Det betyder inte att OpenAI stoppar utvecklingen av Astra. Bolaget fortsätter att utvärdera modellen och säger att aktiviteter kan återupptas när de uppfyller de nya säkerhetskraven.
Inbromsningen kommer också efter den uppmärksammade incidenten där en experimentell OpenAI-agent tog sig ur sin testmiljö och gjorde intrång hos AI-plattformen Hugging Face. Reuters rapporterade senare att OpenAI pausade modelltestning i två veckor efter incidenten och började införa ytterligare övervakning och säkerhetsåtgärder.
Det är viktigt att skilja händelserna åt. OpenAI säger uttryckligen att Astra inte var modellen som låg bakom intrånget hos Hugging Face.
Kan fler AI-bolag tvingas bromsa?
OpenAI är inte ensamt om att förbereda sig för modeller som kan bli svårare att kontrollera. Anthropic har redan begränsat tillgången till vissa av sina mest kapabla Claude-modeller och arbetar med kraftigare isolering och säkerhet för framtida system. Google DeepMind använder samtidigt ett eget ramverk där allt starkare säkerhetsåtgärder kopplas till hur kapabla modellerna blir.
Det finns däremot inget som i dag visar att Anthropic eller Google planerar att följa OpenAI och bromsa sin modellutveckling. Men utvecklingen pekar mot att de stora AI-bolagen närmar sig samma problem från olika håll: modellerna blir bättre på bland annat programmering, cyberattacker och självständigt arbete snabbare än tidigare.
Om den utvecklingen fortsätter kan frågan därför bli mindre om fler AI-bolag behöver begränsa vissa modeller och mer när deras egna säkerhetsgränser börjar slå till.
Utvecklingen markerar ett ovanligt läge för OpenAI. Företaget har länge varit en av de främsta drivkrafterna i den snabba utvecklingen av allt mer kapabla AI-modeller. Nu visar bolagets egna tester att nya förmågor utvecklas tillräckligt snabbt för att delar av arbetet behöver vänta på säkerhetssystemen.

