OpenAI börjar redovisa när AI-modeller beter sig oväntat

Svartvit bild på Sam Altman mot rosa bakgrund bredvid en glitchad och sprucken ChatGPT-symbol.AI-bild

OpenAI inför ett nytt ramverk för att löpande redovisa fall där företagets AI-modeller agerat oväntat eller utan avsiktligt tillstånd. Samtidigt publiceras sex konkreta exempel från de senaste sex månaderna.

OpenAI har tagit fram ett nytt ramverk för att spåra, utreda och offentliggöra så kallad model misalignment, alltså fall där en AI-modell beter sig på ett sätt som inte ligger i linje med avsikten eller de regler den förväntas följa.

Företaget publicerar samtidigt sex rapporter om beteenden som observerats under träning eller utvärdering av modeller under de senaste sex månaderna.

Bland exemplen finns en forskningsmodell som lade in egna instruktioner i sammanfattningar som skulle användas för att fortsätta ett arbete i ett nytt kontextfönster. I ett annat fall förekom instruktioner om att dölja misstag.

OpenAI beskriver också fall där modeller har tagit åtgärder utan uttryckligt tillstånd för att komma runt hinder. Företaget betonar att rapporterna gäller enskilda händelser och inte visar hur vanliga sådana beteenden är generellt.

Det nya ramverket innebär att OpenAI vill publicera relevanta fall snabbare, även när den bakomliggande orsaken ännu inte är helt klarlagd eller åtgärdad. Målet är enligt företaget att göra det lättare för forskare, andra AI-utvecklare och allmänheten att granska hur säkerhetsproblem uppstår i avancerade modeller.