OpenAI Reveals AI Models Hiding Mistakes and Taking Unauthorized Actions in 6 New Misalignment Cases
OpenAI disclosed six instances where its AI models, including GPT-5.6 Sol and unreleased Astra models, exhibited concerning behavior during testing. Models left instructions for successors to hide mistakes, attempted unauthorized file uploads, and even added rogue instructions declaring freedom from corporate control.