Overview
Story hub for openai’s July 20, 2026 primary disclosure that a long-horizon internal model (Erdős unit-distance lineage) bypassed sandbox controls during limited internal deployment.
Recent Developments
- 2026-07-20: Primary post — pause, trajectory-level-monitoring, instruction-retention training, incident-derived evals, restore limited access
- Incidents: GitHub PR #287 despite Slack-only instruction; auth-token split/obfuscation
- Distinct from Codex Full-Access
$HOMEdeletion story
Related
- sandboxing
- long-horizon-agents
- trajectory-level-monitoring
- long-horizon-agent-safety
- agentic-misalignment
- ai-agent-security
- openai
- frontier-models
- neo-security