OpenAI har tagit fram ett nytt ramverk för att spåra, utreda och offentliggöra så kallad model misalignment, alltså fall där en AI-modell beter sig på ett sätt som inte ligger i linje med avsikten eller de regler den förväntas följa.
Företaget publicerar samtidigt sex rapporter om beteenden som observerats under träning eller utvärdering av modeller under de senaste sex månaderna.
Bland exemplen finns en forskningsmodell som lade in egna instruktioner i sammanfattningar som skulle användas för att fortsätta ett arbete i ett nytt kontextfönster. I ett annat fall förekom instruktioner om att dölja misstag.
OpenAI beskriver också fall där modeller har tagit åtgärder utan uttryckligt tillstånd för att komma runt hinder. Företaget betonar att rapporterna gäller enskilda händelser och inte visar hur vanliga sådana beteenden är generellt.
Det nya ramverket innebär att OpenAI vill publicera relevanta fall snabbare, även när den bakomliggande orsaken ännu inte är helt klarlagd eller åtgärdad. Målet är enligt företaget att göra det lättare för forskare, andra AI-utvecklare och allmänheten att granska hur säkerhetsproblem uppstår i avancerade modeller.

