OpenAI primary safety publication (Jul 15, 2026).

Summary claims:

  • Trained GPT-Red at compute scale of some largest post-training runs — dedicated safety compute
  • GPT-5.6 Sol most robust to prompt injections; 6x fewer failures vs best production model four months earlier
  • Self-play RL on broad realistic environments (files, web banners, emails, tool outputs)
  • Kept separate from deployed models to avoid releasing offensive capabilities
  • Real-world case: broke Andon Labs office vending agent (Vendy) — price changes, order cancel; disclosed, safeguards testing
  • Next: continue scaling; pre-print later this week

All robustness metrics are OpenAI self-reported until independent pre-print peer review.