Summary
July 26, 2026 coverage: ARC Prize-verified Claude Opus 5 score of ~30.2% on ARC-AGI-3 (~4x prior best GPT-5.6 Sol Max at 7.8%), solving five previously unsolved public-demo environments. Distinct angle from Opus 5 product launch — focuses on independent adaptation/reasoning benchmark results and caveats about possible genre-specific training and narrower gains on Witness. Follow-up to anthropic-claude-opus-5-launch.
Source Analysis
Covered in PreScreening Notes and Evaluation Report below.
Research Notes
Additional sources
- 2026-07-26-arc-prize-claude-opus-5-results — official ARC Prize verified scores (primary)
- 2026-07-26-benchlm-arc-agi-3-opus-5 — leaderboard mirror (Opus 5 30.2%, Sol 7.8%, Opus 4.8 1.5%)
- 2026-07-26-groundtruth-opus-5-arc-agi-3 — effort-mismatch caveat synthesis
Key facts verified
- Verified (ARC Prize): Opus 5 High 30.16% / reported 30.2% on ARC-AGI-3; Max not run for AGI-3 (short window); five new Public Demo clears; ARC-AGI-1/2 Max 97.5% / 90.4%.
- Prior best: GPT-5.6 Sol ~7.8% at Max — lead real but not effort-matched.
- Absolute ~30% — do not claim AGI solved.
Warning
High vs Max effort mismatch must be stated. Prefer ARC Prize primary over trade press for numbers.
Broader context
adaptation-benchmarks remain the stubborn gap vs static benches where frontier models near ceiling. Complements company frontier-bench claims with independent verifier.
Related wiki
anthropic, claude-opus-5, arc-agi-3, arc-agi, arc-prize, gpt-5-6-sol, adaptation-benchmarks, frontier-bench, frontier-models, ai-benchmarks
Draft Article
Claude Opus 5, ARC-AGI-3’te ~%30.2 ile önceki en iyiyi yaklaşık 4 kat geride bıraktı
arc-prize, 24 Temmuz 2026 itibarıyla Claude Opus 5’in ARC-AGI-3 skorunu High reasoning effort’ta %30,16 / raporlarda %30,2 olarak doğruladı. Önceki en iyi skor, OpenAI’nin GPT-5.6 Sol modelinde Max effort ile yaklaşık %7,8’di. Kabaca 4× fark gerçek; ancak High ile Max karşılaştırıldığı için effort-matched bir liderlik değildir. Bu yazı, ürün ve fiyat odaklı anthropic-claude-opus-5-launch haberinin devamı değil; bağımsız adaptasyon benchmark doğrulamasıdır.
Ana Gelişme
ARC Prize sonuç sayfasına göre Opus 5, ARC-AGI-3’te en yüksek doğrulanmış skoru tutuyor. Test penceresinin kısa olması nedeniyle AGI-3 yalnızca High’ta koşturuldu; Max çalıştırılmadı. Model ayrıca daha önce hiçbir modelin çözemediği beş Public Demo ortamını tamamladı. ARC-AGI-1 ve ARC-AGI-2’de Max skorları sırasıyla %97,5 ve %90,4 — statik veya daha olgun testlerde tavan yakınında performans, adaptasyon testinde ise hâlâ büyük boşluk olduğunu hatırlatıyor.
THE DECODER’ın 26 Temmuz haberinde ARC Prize ekibi, liderliği daha güçlü mantıksal akıl yürütme ve bilinmeyen ortamlarda daha özerk keşif/planlama ile ilişkilendiriyor. Resmi skorlar, harici harness olmadan dil modelinin kendi performansını sayıyor.
Neden Önemli?
adaptation-benchmarks son yıllarda frontier tartışmasının “inatçı boşluğu” oldu: bilgi ve coding bench’lerinde tavan yakınındayken, etkileşimli ve tanıdık olmayan ortamlarda skorlar düşük kalıyordu. Opus 5’in ~%30’a çıkması, bu boşlukta şimdiye kadarki en büyük doğrulanmış sıçrama. Türk AI okuru için mesaj net: ürün lansmanı iddiası değil, bağımsız doğrulayıcıdan gelen adaptasyon sinyali.
Aynı nefeste abartıya sınır konmalı. Mutlak skor hâlâ yaklaşık %30 — AGI çözüldü demek doğru olmaz. High vs Max uyumsuzluğu, “4×” ifadesinin okuma şeklini değiştirir: liderlik gerçek, karşılaştırma koşulları simetrik değil.
Teknik Detaylar
arc-agi-3, modellerin eğitimde görmedikleri yeni görevleri etkileşimli ortamlarda çözmesini ölçer: kuralları çıkarmak, planlamak, uygulamak. Bu, sabit soru-cevap bench’lerinden farklı bir kapasite iddiasıdır. ARC Prize, Opus 5’in test sırasında cebirsel notasyona çeviri ve yansıma denklemleri formüle etme gibi daha önce görülmeyen davranışlar sergilediğini de kayda geçirdi — bunlar gözlem; genel zekâ kanıtı olarak okunmamalı.
İkinci bir uyarı hattı, genre-specific training tartışması. Opus 5, ARC-AGI-3 kamuya açıldıktan sonra geliştirildiği için hedefli eğitim ihtimali gündeme geldi. Guanghan Ning’in özel Witness benchmark’ında kazançların daha dar göründüğü (Opus 5 %43,4; Kimi K3 ve Fable 5 ile berabere) haberleştirildi. Greg Kamradt (ARC-AGI-3) sonuçların daha geniş kazanımları dışlamadığını söyledi; Ning de Witness’teki iyileşmenin daha geniş ama ARC-AGI-3’teki kadar büyük olmadığını netleştirdi. Bunlar atfedilmiş tartışmalar; kanıtlanmış “sadece ezber” hükmü değildir.
Bağlam
anthropic Opus 5’i 24 Temmuz’da ürün olarak yayımlamıştı. Lansman haberinde Frontier-Bench ve fiyat-performans iddiaları öne çıkıyordu; bu takip, şirketin kendi skor tablosundan bağımsız bir doğrulayıcıya kayıyor. frontier-bench ve ai-benchmarks ekosisteminde laboratuvar duyurusu ile üçüncü taraf doğrulama arasındaki fark, okuyucu güveni için kritik.
Önceki en iyi Sol Max %7,8 ile Opus 5 High %30,2 arasındaki uçurum, adaptasyon testlerinin hâlâ doygun olmadığını da gösteriyor. Statik ARC-AGI-1/2’de %90+ skorlar ile AGI-3’te %30’luk mutlak seviye yan yana durduğunda, “hangi zekâyı ölçüyoruz?” sorusu yeniden açılıyor.
Sonraki Adımlar
İzlenecekler: Opus 5’in ARC-AGI-3’te Max effort koşusu (mümkün olursa), bağımsız Witness ve benzeri adaptasyon repro’ları, ve genre-specific training iddialarının somut kanıt veya çürütme üretip üretmeyeceği. Rakip laboratuvarların aynı harness ve effort seviyesinde skor yayımlaması, 4× farkın ne kadar kalıcı olduğunu gösterecek.
Kısa özet: ARC Prize doğruladı — Opus 5 High ~%30,2; önceki en iyi Sol Max ~%7,8; beş yeni Public Demo ortamı; effort mismatch var; mutlak skor ~%30, AGI değil.
Kaynaklar
- ARC Prize — Claude Opus 5 results
- THE DECODER — Opus 5 on ARC-AGI-3
- BenchLM — ARC-AGI-3 leaderboard mirror
- Ground Truth — Opus 5 ARC-AGI-3 effort caveats
PreScreening Notes
- Score 7 / priority high: Independent ARC Prize-verified ~4x lead on ARC-AGI-3 is a significant frontier-benchmark development for AI audience.
- THE DECODER coverage July 26; within 48h; strong AI domain fit.
- Not a duplicate of anthropic-claude-opus-5-launch (7-done): launch covered product/pricing; this is post-launch independent bench verification + caveats.
- Credible trade coverage citing ARC Prize; Evaluation should confirm official ARC numbers and Witness caveats.
Evaluation Report
News Value
- Timeliness: High — ARC Prize results page dated Jul 24; THE DECODER Jul 26 within discovery window.
- Impact: High for frontier-bench discourse; largest verified jump on ARC-AGI-3 adaptation test.
- Prominence: Anthropic Claude Opus 5 vs OpenAI GPT-5.6 Sol; ARC Prize as independent verifier.
- Proximity: Strong for Turkish AI enthusiasts following frontier model capabilities.
- Novelty: Clear follow-up angle vs launch — independent bench verification + methodology caveats, not product/pricing rehash.
Audience Fit
Excellent for AI enthusiasts. Insightful: what ARC-AGI-3 measures (interactive unfamiliar environments / adaptation) vs static knowledge benches. Connects to claude-opus-5, frontier-bench, prior anthropic-claude-opus-5-launch.
Risk & Ethics
Warning
Effort mismatch: Opus 5 ARC-AGI-3 score (~30.16–30.2%) was evaluated at High reasoning effort only (short testing window); prior best GPT-5.6 Sol (~7.8%) was at Max. Lead is real but not effort-matched — state this explicitly. Prefer ARC Prize Opus 5 results over secondary trade press for numbers.
- Do not overclaim “AGI solved”; ARC-AGI-3 still at ~30% absolute.
- Genre-specific training / Witness caveats from coverage should be attributed, not asserted as proven.
Publication Strategy
- Format:
standard(600–800 words) — bench lead + caveats + what adaptation benches mean; not a full Opus 5 product deep-dive (already done). - Wiki to reference: anthropic, claude-opus-5, frontier-bench, anthropic-claude-opus-5-launch.
- Batch note: Keep high; complementary to DeepSeek capital story as capability counterpoint.
Suggested Angle
Türk AI okuruna: Opus 5 lansmanını tekrarlama; ARC Prize doğrulamalı ARC-AGI-3 ~%30.2 ve önceki en iyiye (~%7.8) göre kabaca 4× farkı merkeze al. Adaptasyon / etkileşimli ortam testinin ne ölçtüğünü kısaca açıkla; beş yeni çözülen public-demo ortamını belirt. High vs Max effort uyumsuzluğunu ve “AGI geldi” abartısını engelleyen uyarıyı aynı nefeste ver. Önceki anthropic-claude-opus-5-launch haberine wikilink.
Editorial Notes
Decision: Approved → pipeline/5-approved/
Angle confirmed: Independent ARC Prize verification + adaptation-bench caveats — not Opus 5 product/pricing rehash.
Format confirmed: standard (600–800 words)
Reporting instructions:
- Prefer ARC Prize primary numbers: Opus 5 High 30.16% / 30.2% on ARC-AGI-3; prior best GPT-5.6 Sol ~7.8% at Max.
- State effort mismatch in the same breath as the ~4× lead (High vs Max; Max not run for AGI-3 due to short window).
- Absolute ~30% — forbid “AGI solved” or overclaim.
- Five newly cleared Public Demo environments; ARC-AGI-1/2 Max 97.5% / 90.4% as secondary context only.
- Genre-specific training / Witness caveats: attribute to coverage, do not assert as proven.
- Cross-link prior anthropic-claude-opus-5-launch; keep this as bench follow-up.
- Timeliness (2026-07-26): ARC Prize results Jul 24 still current; no superseding scores found.
Headline suggestions (TR):
- Claude Opus 5, ARC-AGI-3’te ~%30.2 ile önceki en iyiyi yaklaşık 4 kat geride bıraktı
- ARC Prize doğruladı: Opus 5 adaptasyon testinde rekor — High vs Max uyarısıyla
- Opus 5’in ARC-AGI-3 skoru ne anlama geliyor? %30.2, beş yeni ortam ve abartı sınırları
Mandatory key points:
- ARC Prize–verified ~30.2% (30.16%) on ARC-AGI-3
- Prior best ~7.8% (GPT-5.6 Sol Max) — lead real but not effort-matched
- Five previously unsolved Public Demo environments cleared
- What ARC-AGI-3 measures (interactive unfamiliar environments / adaptation)
- Absolute score still ~30% — not AGI
- Wikilink claude-opus-5, arc-agi-3, arc-prize, adaptation-benchmarks, anthropic-claude-opus-5-launch