Claude Opus 5, ARC-AGI-3’te ~%30.2 ile önceki en iyiyi yaklaşık 4 kat geride bıraktı

arc-prize, 24 Temmuz 2026 itibarıyla Claude Opus 5’in ARC-AGI-3 skorunu High reasoning effort’ta %30,16 / raporlarda %30,2 olarak doğruladı. Önceki en iyi skor, OpenAI’nin GPT-5.6 Sol modelinde Max effort ile yaklaşık %7,8’di. Kabaca 4× fark gerçek; ancak High ile Max karşılaştırıldığı için effort-matched bir liderlik değildir. Bu yazı, ürün ve fiyat odaklı anthropic-claude-opus-5-launch haberinin devamı değil; bağımsız adaptasyon benchmark doğrulamasıdır.

Ana Gelişme

ARC Prize sonuç sayfasına göre Opus 5, ARC-AGI-3’te en yüksek doğrulanmış skoru tutuyor. Test penceresinin kısa olması nedeniyle AGI-3 yalnızca High’ta koşturuldu; Max çalıştırılmadı. Model ayrıca daha önce hiçbir modelin çözemediği beş Public Demo ortamını tamamladı. ARC-AGI-1 ve ARC-AGI-2’de Max skorları sırasıyla %97,5 ve %90,4 — statik veya daha olgun testlerde tavan yakınında performans, adaptasyon testinde ise hâlâ büyük boşluk olduğunu hatırlatıyor.

THE DECODER’ın 26 Temmuz haberinde ARC Prize ekibi, liderliği daha güçlü mantıksal akıl yürütme ve bilinmeyen ortamlarda daha özerk keşif/planlama ile ilişkilendiriyor. Resmi skorlar, harici harness olmadan dil modelinin kendi performansını sayıyor.

Neden Önemli?

adaptation-benchmarks son yıllarda frontier tartışmasının “inatçı boşluğu” oldu: bilgi ve coding bench’lerinde tavan yakınındayken, etkileşimli ve tanıdık olmayan ortamlarda skorlar düşük kalıyordu. Opus 5’in ~%30’a çıkması, bu boşlukta şimdiye kadarki en büyük doğrulanmış sıçrama. Türk AI okuru için mesaj net: ürün lansmanı iddiası değil, bağımsız doğrulayıcıdan gelen adaptasyon sinyali.

Aynı nefeste abartıya sınır konmalı. Mutlak skor hâlâ yaklaşık %30 — AGI çözüldü demek doğru olmaz. High vs Max uyumsuzluğu, “4×” ifadesinin okuma şeklini değiştirir: liderlik gerçek, karşılaştırma koşulları simetrik değil.

Teknik Detaylar

arc-agi-3, modellerin eğitimde görmedikleri yeni görevleri etkileşimli ortamlarda çözmesini ölçer: kuralları çıkarmak, planlamak, uygulamak. Bu, sabit soru-cevap bench’lerinden farklı bir kapasite iddiasıdır. ARC Prize, Opus 5’in test sırasında cebirsel notasyona çeviri ve yansıma denklemleri formüle etme gibi daha önce görülmeyen davranışlar sergilediğini de kayda geçirdi — bunlar gözlem; genel zekâ kanıtı olarak okunmamalı.

İkinci bir uyarı hattı, genre-specific training tartışması. Opus 5, ARC-AGI-3 kamuya açıldıktan sonra geliştirildiği için hedefli eğitim ihtimali gündeme geldi. Guanghan Ning’in özel Witness benchmark’ında kazançların daha dar göründüğü (Opus 5 %43,4; Kimi K3 ve Fable 5 ile berabere) haberleştirildi. Greg Kamradt (ARC-AGI-3) sonuçların daha geniş kazanımları dışlamadığını söyledi; Ning de Witness’teki iyileşmenin daha geniş ama ARC-AGI-3’teki kadar büyük olmadığını netleştirdi. Bunlar atfedilmiş tartışmalar; kanıtlanmış “sadece ezber” hükmü değildir.

Bağlam

anthropic Opus 5’i 24 Temmuz’da ürün olarak yayımlamıştı. Lansman haberinde Frontier-Bench ve fiyat-performans iddiaları öne çıkıyordu; bu takip, şirketin kendi skor tablosundan bağımsız bir doğrulayıcıya kayıyor. frontier-bench ve ai-benchmarks ekosisteminde laboratuvar duyurusu ile üçüncü taraf doğrulama arasındaki fark, okuyucu güveni için kritik.

Önceki en iyi Sol Max %7,8 ile Opus 5 High %30,2 arasındaki uçurum, adaptasyon testlerinin hâlâ doygun olmadığını da gösteriyor. Statik ARC-AGI-1/2’de %90+ skorlar ile AGI-3’te %30’luk mutlak seviye yan yana durduğunda, “hangi zekâyı ölçüyoruz?” sorusu yeniden açılıyor.

Sonraki Adımlar

İzlenecekler: Opus 5’in ARC-AGI-3’te Max effort koşusu (mümkün olursa), bağımsız Witness ve benzeri adaptasyon repro’ları, ve genre-specific training iddialarının somut kanıt veya çürütme üretip üretmeyeceği. Rakip laboratuvarların aynı harness ve effort seviyesinde skor yayımlaması, 4× farkın ne kadar kalıcı olduğunu gösterecek.

Kısa özet: ARC Prize doğruladı — Opus 5 High ~%30,2; önceki en iyi Sol Max ~%7,8; beş yeni Public Demo ortamı; effort mismatch var; mutlak skor ~%30, AGI değil.


Kaynaklar