OpenAI: Astra når kritisk cybernivå

Vit OpenAI-logotyp centrerad mot en grön och turkos abstrakt bakgrund.

OpenAI säger att kommande Astra är bolagets första modell som når den högsta kritiska nivån för cybersäkerhetskapacitet. Modellen har hittat tidigare okända sårbarheter och byggt fungerande exploitkedjor i tester.

OpenAI säger att den kommande AI-modellen Astra nu når den högsta nivån för cybersäkerhetskapacitet i bolagets Preparedness Framework. Det är första gången OpenAI klassar en modell som ”Critical” inom cyberområdet.

I tester har Astra visat en tydlig ökning i förmågan att hitta sårbarheter och utveckla fungerande exploiter jämfört med GPT-5.6 Sol. På ExploitBench fick modellen full poäng när den testades på kända sårbarheter.

OpenAI byggde även ett internt test med 20 nyare sårbarheter för att minska risken att modellen redan sett lösningarna i träningsdata. Där lyckades Astra betydligt oftare nå godtycklig kodkörning än GPT-5.6 Sol, samtidigt som modellen använde färre tokens. Under testerna hittade och utnyttjade Astra dessutom två tidigare okända zero-day-sårbarheter som en del av en exploitkedja. OpenAI uppger att dessa nu rapporteras till de berörda utvecklarna.

I ett annat test mot en härdad webbläsare lyckades Astra bygga en komplett attackkedja som tog sig ur webbläsarens sandbox och körde kommandon på värdsystemet. Modellen hittade även flera sårbarheter i ett härdat operativsystem och kombinerade dem för att gå från en vanlig användare till root-behörighet.

Det betyder inte att Astra kommer släppas fritt med samma kapacitet. OpenAI säger att testerna genomfördes med en särskild Daybreak Blue-konfiguration och att avancerade cyberfunktioner initialt bara ska göras tillgängliga för en liten grupp särskilt godkända testare.

Bolaget har också förstärkt skydden runt modellen. Astra ska bland annat ha starkare refusals för skadliga cyberförfrågningar, hårdare övervakning av högriskkonton och system som kan upptäcka och stoppa potentiellt obehöriga handlingar från modellen själv.

OpenAI uppger att vissa delar av Astras utveckling och större träningskörningar tidigare pausades medan säkerhetskraven skärptes. En större reinforcement learning-körning återstartades den 28 augusti efter att de nya kraven införts.

När Astra väl släpps kan de extra säkerhetskontrollerna ibland även stoppa legitimt arbete. OpenAI varnar för att uppgifter i ChatGPT, Codex och API:t kan pausas eller stoppas om övervakningssystemet misstänker cybermissbruk eller obehörigt beteende.

Något exakt lanseringsdatum för Astra har OpenAI ännu inte meddelat.