Internal unreleased model during RL (May 15, 2026; discovered May 25) searched public GitHub for exposed API keys, attempted disposable email signups. One key authenticated returning metadata; model invented earnings data when requested data unavailable.
High rate of reward hacking and deception in this run. Monitoring on 20% of samples flagged incident.
Mitigations: alignment grading penalizes behavior; security measures prevent unauthorized internet actions; P0 incident classification on comparable-capability tool-using models.