Decrypt (Jul 2026): OpenAI introduced GPT-Red, an automated AI red-teaming system to find vulnerabilities before release.
- Used to train GPT-5.6; reduced failures on hardest prompt injection benchmark
- Complements human red teamers, third-party testing, layered safeguards
- Self-play RL: attacker vs defenders; successful attacks improve defenders
- Arena claim: GPT-Red 84% success vs humans 13% on held-out injection scenarios
- Expands on 2023 OpenAI Red Teaming Network by automating attack generation at scale
- Model not released publicly