Summary
Epoch AI and METR published early MirrorCode benchmark results (July 2026): AI agents can autonomously reimplement real CLI programs from execute-only black-box access plus checkable specs. Claude Opus 4.6 fully reimplemented gotree (~16,900 LoC Go bioinformatics toolkit, 40+ commands) — estimated 2–17 human-weeks. Also solved choose, cal; Pkl (~61K LoC) unsolved at 1B token budget. Benchmark spans 20+ programs; open-source release planned with private test set.
Source Analysis
Verified via Epoch AI primary blog, arXiv paper (2606.30182), TechTimes coverage. METR partnership confirmed.
Research Notes
Additional Sources Found
- 2026-07-05-epoch-ai-mirrorcode-full-results — Epoch AI full results blog
- 2026-07-05-arxiv-mirrorcode-benchmark-paper — arXiv technical paper with full benchmark table
- TechTimes June 27 coverage — Pkl 60K LoC solve in full release
Key Facts Verified
| Claim | Status |
|---|---|
| gotree ~16K LoC reimplemented | Verified — 2,000/2,001 tests passed |
| Human estimate 2–17 weeks | Verified — Epoch AI researcher estimates |
| Opus 4.7 solved in 14h for $251 | Verified — full June release |
| Pkl unsolved at 1B tokens (early) | Verified — early April results |
| Pkl solved in full release | Verified — 99%+ tests (June release) |
| 17/25 programs perfect run | Verified |
Early benchmark results — full open-source release with private test set pending. Pkl status evolved between April preliminary and June full release; present capability bounds honestly.
Broader Context
mirrorcode-benchmark time horizons (multi-week human tasks) substantially exceed metr’s ~12-hour bug-fix horizon — signals leap in autonomous-software-development. Black-box reimplementation methodology harder to game than source-visible benchmarks. Private held-out test set preserves integrity. Directly relevant to Turkish software developers tracking coding-agents capability curves.
Related Wiki Pages
mirrorcode-benchmark, epoch-ai, metr, ai-benchmarks, coding-agents, autonomous-software-development, ai-models, long-horizon-agents
Evaluation Report
Publication Strategy
- Format:
standard(600-800 words)
Suggested Angle
Turkish headline: “MirrorCode: AI Ajanları Haftalar Süren Kodlama Görevlerini Otonom Yeniden Yazabiliyor”
Editorial angle: Explain the benchmark design — agents get execute-only black-box access + checkable specs, must reimplement from scratch. Lead with gotree (16,900 LoC Go, 40+ commands) as proof point. Contrast solved (choose, cal) vs unsolved (Pkl at 1B tokens in early results) to show honest capability bounds. For developers: what “week-long engineering task” means in agent terms and why private test sets matter for benchmark integrity.
Editorial Notes
Approved Angle & Format
- Format confirmed:
standard(600–800 words) - Angle: Haftalar süren mühendislik görevlerinin otonom yeniden implementasyonu — MirrorCode
Instructions for Reporting Agent
- Benchmark tasarımını açıkla: execute-only black-box + checkable specs
- gotree: ~16.900 LoC, 2.001/2.001 test geçti — ana kanıt noktası
- Pkl durumunu dürüst sun: erken sonuçlarda 1B token’da çözülmedi; tam sürümde çözüldü
- İnsan tahmini 2–17 hafta vs Opus 4.7: 14 saat, $251 (tam sürüm)
- Private held-out test set’in benchmark bütünlüğü için önemi
- METR ~12 saat horizon ile karşılaştır
Headline Suggestions (Turkish)
- MirrorCode: AI Ajanları Haftalar Süren Kodlama Görevlerini Otonom Yeniden Yazabiliyor
- Epoch AI ve METR’den MirrorCode: gotree 16.900 Satır Kodu Sıfırdan Yeniden Üretti
- Black-Box Benchmark MirrorCode, Uzun Ufuklu Coding Agent Yeteneğini Ölçüyor
Key Points (Must Include)
- gotree ~16.900 LoC, 40+ komut, 2.001 test
- choose, cal çözüldü; Pkl erken sonuçlarda 1B token limitinde çözülmedi
- 17/25 program perfect run (tam sürüm)
- Black-box reimplementation metodolojisi
- Açık kaynak release + private test set planı
Draft Article
MirrorCode: AI Ajanları Haftalar Süren Kodlama Görevlerini Otonom Yeniden Yazabiliyor
epoch-ai ve metr, MirrorCode benchmark’ının sonuçlarını Temmuz 2026’da yayımladı. Benchmark, AI ajanlarının yalnızca çalıştırılabilir black-box erişimi ve doğrulanabilir spesifikasyonlarla gerçek CLI programlarını sıfırdan yeniden implemente edip edemediğini ölçüyor. Sonuçlar, ajanların haftalar süren mühendislik görevlerini otonom tamamlayabildiğini gösteriyor.
Ana Gelişme
Benchmark tasarımı kasıtlı olarak zorlu: ajanlar kaynak kodu görmüyor, yalnızca programı çalıştırıp çıktıları gözlemleyerek (execute-only black-box) ve spesifikasyonları kontrol ederek yeniden yazım yapıyor. Bu metodoloji, kaynak kodu görünür benchmark’lara kıyasla “gaming” riskini azaltıyor.
Ana kanıt noktası gotree: yaklaşık 16.900 satırlık Go biyoinformatik toolkit’i, 40’tan fazla komutla birlikte yeniden üretildi — 2.001 testin 2.001’i geçti. İnsan mühendisler için tahmini süre 2–17 hafta arasında. Tam sürümde Claude Opus 4.7, gotree’yi 14 saatte ve 251 dolara çözdü.
Daha küçük programlar choose ve cal da başarıyla yeniden yazıldı. Pkl (~61.000 satır) ise erken sonuçlarda 1 milyar token bütçesiyle çözülemedi; ancak Haziran tam sürümünde %99+ test başarısıyla tamamlandı — yetenek sınırlarının zaman içinde genişlediğini gösteriyor.
Tam sürümde 25 programdan 17’si “perfect run” aldı. Açık kaynak release ve private held-out test set planı, benchmark bütünlüğünü korumak için kritik.
Neden Önemli?
mirrorcode-benchmark, metr’in yaklaşık 12 saatlik bug-fix horizon’unu önemli ölçüde aşıyor — long-horizon-agents ve autonomous-software-development alanında sıçrama sinyali. Türk yazılım geliştiricileri için “haftalık mühendislik görevi” artık ajan kapasitesi tartışmasının parçası.
Teknik Detaylar
Black-box reimplementation, ajanın yalnızca davranışsal gözlem ve test suite ile çalışmasını gerektiriyor. Private test set, halka açık eğitim verisine sızmayı engelleyerek ai-benchmarks güvenilirliğini koruyor.
Bağlam
coding-agents yetenek eğrisi hızla yükselirken, benchmark tasarımı da evriliyor. MirrorCode, ai-models’in üretim kodu yeniden yazımındaki sınırlarını dürüst biçimde haritalıyor.
Sonraki Adımlar
epoch-ai ve metr, tam açık kaynak release ile genişletilmiş program setini paylaşmayı planlıyor. Pkl gibi zorlu vakaların erken vs. tam sürüm farkı, benchmark sonuçlarının tarih damgasıyla okunması gerektiğini hatırlatıyor.
Kaynaklar
- MirrorCode benchmark results (Epoch AI)
- MirrorCode arXiv paper (arXiv)