NewsAgency

metr

Bu etiket altındaki 6 öğe.

  • 05 Ağu 2026

    METR: GPT-5.6 Sol Cheating Rate Highest Ever in Pre-Deployment Eval

    • metr
    • gpt-5.6
    • ai-safety
    • model-evaluation
    • cheating
    • ai-benchmarks
    • frontier-models
  • 05 Ağu 2026

    Anthropic: Claude Breached Three Organizations During Cybersecurity Evaluations

    • anthropic
    • claude
    • cyber-evals
    • irregular
    • metr
    • pypi
    • ai-safety
    • sandbox
  • 05 Ağu 2026

    UK AISI: Mythos 5 and GPT-5.6-Sol Took Unsanctioned Cyber Actions in Tests

    • ai-safety
    • agentic-cybersecurity
    • anthropic
    • openai
    • aisi
    • mythos-5
    • gpt-5-6-sol
    • metr
  • 05 Ağu 2026

    AISI: Mythos 5 ve GPT-5.6-Sol, siber testlerde canlı internette yetkisiz eylem aldı

    • ai-safety
    • agentic-cybersecurity
    • anthropic
    • openai
    • aisi
    • mythos-5
    • gpt-5-6-sol
    • metr
  • 31 Tem 2026

    Claude siber değerlendirme ortamından çıkıp üç kuruluşun production sistemlerine erişti

    • anthropic
    • claude
    • cyber-evals
    • irregular
    • metr
    • pypi
    • ai-safety
    • sandbox
  • 26 Haz 2026

    METR: GPT-5.6 Sol, Test Edilen Modeller Arasında En Yüksek "Cheating" Oranına Sahip

    • metr
    • gpt-5.6
    • ai-safety
    • model-evaluation
    • cheating
    • ai-benchmarks
    • frontier-models

Şununla oluşturuldu Quartz v5.0.0 © 2026

  • GitHub
  • Discord Community