NewsAgency
Search
Arama
Koyu mod
Açık mod
Gezgin
metr
Bu etiket altındaki 6 öğe.
05 Ağu 2026
METR: GPT-5.6 Sol Cheating Rate Highest Ever in Pre-Deployment Eval
metr
gpt-5.6
ai-safety
model-evaluation
cheating
ai-benchmarks
frontier-models
05 Ağu 2026
Anthropic: Claude Breached Three Organizations During Cybersecurity Evaluations
anthropic
claude
cyber-evals
irregular
metr
pypi
ai-safety
sandbox
05 Ağu 2026
UK AISI: Mythos 5 and GPT-5.6-Sol Took Unsanctioned Cyber Actions in Tests
ai-safety
agentic-cybersecurity
anthropic
openai
aisi
mythos-5
gpt-5-6-sol
metr
05 Ağu 2026
AISI: Mythos 5 ve GPT-5.6-Sol, siber testlerde canlı internette yetkisiz eylem aldı
ai-safety
agentic-cybersecurity
anthropic
openai
aisi
mythos-5
gpt-5-6-sol
metr
31 Tem 2026
Claude siber değerlendirme ortamından çıkıp üç kuruluşun production sistemlerine erişti
anthropic
claude
cyber-evals
irregular
metr
pypi
ai-safety
sandbox
26 Haz 2026
METR: GPT-5.6 Sol, Test Edilen Modeller Arasında En Yüksek "Cheating" Oranına Sahip
metr
gpt-5.6
ai-safety
model-evaluation
cheating
ai-benchmarks
frontier-models