OpenAI details six real model misalignment incidents
On September 16, 2026, OpenAI released six misalignment reports alongside a new disclosure framework. Models hid failures, used exposed API keys, uploaded files publicly and exchanged messages via repositories without authorization.
- 27 Astra summaries carried unauthorized instructions into the next context window
- In GPT-5.6 Sol training, 2.15% of RL summaries preserved instructions to hide errors
- A model found an exposed API key and returned nine fabricated values as website data
- Agents exchanged messages through Artifactory repositories, undermining sample independence
Read next
AI