Summary

Epoch AI and METR published early MirrorCode benchmark results (July 2026): AI agents can autonomously reimplement real CLI programs from execute-only black-box access plus checkable specs. Claude Opus 4.6 fully reimplemented gotree (~16,900 LoC Go bioinformatics toolkit, 40+ commands) — estimated 2–17 human-weeks. Also solved choose, cal; Pkl (~61K LoC) unsolved at 1B token budget. Benchmark spans 20+ programs; open-source release planned with private test set.

Source Analysis

Verified via Epoch AI primary blog, arXiv paper (2606.30182), TechTimes coverage. METR partnership confirmed.

Research Notes

Additional Sources Found

Key Facts Verified

ClaimStatus
gotree ~16K LoC reimplementedVerified — 2,000/2,001 tests passed
Human estimate 2–17 weeksVerified — Epoch AI researcher estimates
Opus 4.7 solved in 14h for $251Verified — full June release
Pkl unsolved at 1B tokens (early)Verified — early April results
Pkl solved in full releaseVerified — 99%+ tests (June release)
17/25 programs perfect runVerified

Early benchmark results — full open-source release with private test set pending. Pkl status evolved between April preliminary and June full release; present capability bounds honestly.

Broader Context

mirrorcode-benchmark time horizons (multi-week human tasks) substantially exceed metr’s ~12-hour bug-fix horizon — signals leap in autonomous-software-development. Black-box reimplementation methodology harder to game than source-visible benchmarks. Private held-out test set preserves integrity. Directly relevant to Turkish software developers tracking coding-agents capability curves.

mirrorcode-benchmark, epoch-ai, metr, ai-benchmarks, coding-agents, autonomous-software-development, ai-models, long-horizon-agents

Evaluation Report

Publication Strategy

  • Format: standard (600-800 words)

Suggested Angle

Turkish headline: “MirrorCode: AI Ajanları Haftalar Süren Kodlama Görevlerini Otonom Yeniden Yazabiliyor”

Editorial angle: Explain the benchmark design — agents get execute-only black-box access + checkable specs, must reimplement from scratch. Lead with gotree (16,900 LoC Go, 40+ commands) as proof point. Contrast solved (choose, cal) vs unsolved (Pkl at 1B tokens in early results) to show honest capability bounds. For developers: what “week-long engineering task” means in agent terms and why private test sets matter for benchmark integrity.

Editorial Notes

Approved Angle & Format

  • Format confirmed: standard (600–800 words)
  • Angle: Haftalar süren mühendislik görevlerinin otonom yeniden implementasyonu — MirrorCode

Instructions for Reporting Agent

  • Benchmark tasarımını açıkla: execute-only black-box + checkable specs
  • gotree: ~16.900 LoC, 2.001/2.001 test geçti — ana kanıt noktası
  • Pkl durumunu dürüst sun: erken sonuçlarda 1B token’da çözülmedi; tam sürümde çözüldü
  • İnsan tahmini 2–17 hafta vs Opus 4.7: 14 saat, $251 (tam sürüm)
  • Private held-out test set’in benchmark bütünlüğü için önemi
  • METR ~12 saat horizon ile karşılaştır

Headline Suggestions (Turkish)

  • MirrorCode: AI Ajanları Haftalar Süren Kodlama Görevlerini Otonom Yeniden Yazabiliyor
  • Epoch AI ve METR’den MirrorCode: gotree 16.900 Satır Kodu Sıfırdan Yeniden Üretti
  • Black-Box Benchmark MirrorCode, Uzun Ufuklu Coding Agent Yeteneğini Ölçüyor

Key Points (Must Include)

  • gotree ~16.900 LoC, 40+ komut, 2.001 test
  • choose, cal çözüldü; Pkl erken sonuçlarda 1B token limitinde çözülmedi
  • 17/25 program perfect run (tam sürüm)
  • Black-box reimplementation metodolojisi
  • Açık kaynak release + private test set planı

Draft Article

MirrorCode: AI Ajanları Haftalar Süren Kodlama Görevlerini Otonom Yeniden Yazabiliyor

epoch-ai ve metr, MirrorCode benchmark’ının sonuçlarını Temmuz 2026’da yayımladı. Benchmark, AI ajanlarının yalnızca çalıştırılabilir black-box erişimi ve doğrulanabilir spesifikasyonlarla gerçek CLI programlarını sıfırdan yeniden implemente edip edemediğini ölçüyor. Sonuçlar, ajanların haftalar süren mühendislik görevlerini otonom tamamlayabildiğini gösteriyor.

Ana Gelişme

Benchmark tasarımı kasıtlı olarak zorlu: ajanlar kaynak kodu görmüyor, yalnızca programı çalıştırıp çıktıları gözlemleyerek (execute-only black-box) ve spesifikasyonları kontrol ederek yeniden yazım yapıyor. Bu metodoloji, kaynak kodu görünür benchmark’lara kıyasla “gaming” riskini azaltıyor.

Ana kanıt noktası gotree: yaklaşık 16.900 satırlık Go biyoinformatik toolkit’i, 40’tan fazla komutla birlikte yeniden üretildi — 2.001 testin 2.001’i geçti. İnsan mühendisler için tahmini süre 2–17 hafta arasında. Tam sürümde Claude Opus 4.7, gotree’yi 14 saatte ve 251 dolara çözdü.

Daha küçük programlar choose ve cal da başarıyla yeniden yazıldı. Pkl (~61.000 satır) ise erken sonuçlarda 1 milyar token bütçesiyle çözülemedi; ancak Haziran tam sürümünde %99+ test başarısıyla tamamlandı — yetenek sınırlarının zaman içinde genişlediğini gösteriyor.

Tam sürümde 25 programdan 17’si “perfect run” aldı. Açık kaynak release ve private held-out test set planı, benchmark bütünlüğünü korumak için kritik.

Neden Önemli?

mirrorcode-benchmark, metr’in yaklaşık 12 saatlik bug-fix horizon’unu önemli ölçüde aşıyor — long-horizon-agents ve autonomous-software-development alanında sıçrama sinyali. Türk yazılım geliştiricileri için “haftalık mühendislik görevi” artık ajan kapasitesi tartışmasının parçası.

Teknik Detaylar

Black-box reimplementation, ajanın yalnızca davranışsal gözlem ve test suite ile çalışmasını gerektiriyor. Private test set, halka açık eğitim verisine sızmayı engelleyerek ai-benchmarks güvenilirliğini koruyor.

Bağlam

coding-agents yetenek eğrisi hızla yükselirken, benchmark tasarımı da evriliyor. MirrorCode, ai-models’in üretim kodu yeniden yazımındaki sınırlarını dürüst biçimde haritalıyor.

Sonraki Adımlar

epoch-ai ve metr, tam açık kaynak release ile genişletilmiş program setini paylaşmayı planlıyor. Pkl gibi zorlu vakaların erken vs. tam sürüm farkı, benchmark sonuçlarının tarih damgasıyla okunması gerektiğini hatırlatıyor.


Kaynaklar