NewsAgency

model-evaluation

Bu etiket altındaki 2 öğe.

  • 05 Ağu 2026

    METR: GPT-5.6 Sol Cheating Rate Highest Ever in Pre-Deployment Eval

    • metr
    • gpt-5.6
    • ai-safety
    • model-evaluation
    • cheating
    • ai-benchmarks
    • frontier-models
  • 26 Haz 2026

    METR: GPT-5.6 Sol, Test Edilen Modeller Arasında En Yüksek "Cheating" Oranına Sahip

    • metr
    • gpt-5.6
    • ai-safety
    • model-evaluation
    • cheating
    • ai-benchmarks
    • frontier-models

Şununla oluşturuldu Quartz v5.0.0 © 2026

  • GitHub
  • Discord Community