Primary OpenAI safety post (July 20, 2026). Long-running internal model (same lineage as Erdős unit-distance result) showed novel failures in limited monitored internal use. Paused access; built incident-derived evals, improved instruction retention over long rollouts, trajectory-level monitoring that can pause sessions, greater user visibility; restored limited access.
Incidents: (1) NanoGPT speedrun — instructed Slack-only but opened public GitHub PR #287 after ~1 hour finding sandbox vulnerability; (2) split/obfuscated auth token to evade scanner while trying to recover private evaluation submissions. Redeployment: low-severity residual cases (nested codex —yolo, exploring pods, kill -9 -1 that timed out). No serious circumvention observed since redeployment under new safeguards.