MirrorCode: AI Ajanları Haftalar Süren Kodlama Görevlerini Otonom Yeniden Yazabiliyor
epoch-ai ve metr, MirrorCode benchmark’ının sonuçlarını Temmuz 2026’da yayımladı. Benchmark, AI ajanlarının yalnızca çalıştırılabilir black-box erişimi ve doğrulanabilir spesifikasyonlarla gerçek CLI programlarını sıfırdan yeniden implemente edip edemediğini ölçüyor. Sonuçlar, ajanların haftalar süren mühendislik görevlerini otonom tamamlayabildiğini gösteriyor.
Ana Gelişme
Benchmark tasarımı kasıtlı olarak zorlu: ajanlar kaynak kodu görmüyor, yalnızca programı çalıştırıp çıktıları gözlemleyerek (execute-only black-box) ve spesifikasyonları kontrol ederek yeniden yazım yapıyor. Bu metodoloji, kaynak kodu görünür benchmark’lara kıyasla “gaming” riskini azaltıyor.
Ana kanıt noktası gotree: yaklaşık 16.900 satırlık Go biyoinformatik toolkit’i, 40’tan fazla komutla birlikte yeniden üretildi — 2.001 testin 2.001’i geçti. İnsan mühendisler için tahmini süre 2–17 hafta arasında. Tam sürümde Claude Opus 4.7, gotree’yi 14 saatte ve 251 dolara çözdü.
Daha küçük programlar choose ve cal da başarıyla yeniden yazıldı. Pkl (~61.000 satır) ise erken sonuçlarda 1 milyar token bütçesiyle çözülemedi; ancak Haziran tam sürümünde %99+ test başarısıyla tamamlandı — yetenek sınırlarının zaman içinde genişlediğini gösteriyor.
Tam sürümde 25 programdan 17’si “perfect run” aldı. Açık kaynak release ve private held-out test set planı, benchmark bütünlüğünü korumak için kritik.
Neden Önemli?
mirrorcode-benchmark, metr’in yaklaşık 12 saatlik bug-fix horizon’unu önemli ölçüde aşıyor — long-horizon-agents ve autonomous-software-development alanında sıçrama sinyali. Türk yazılım geliştiricileri için “haftalık mühendislik görevi” artık ajan kapasitesi tartışmasının parçası.
Teknik Detaylar
Black-box reimplementation, ajanın yalnızca davranışsal gözlem ve test suite ile çalışmasını gerektiriyor. Private test set, halka açık eğitim verisine sızmayı engelleyerek ai-benchmarks güvenilirliğini koruyor.
Bağlam
coding-agents yetenek eğrisi hızla yükselirken, benchmark tasarımı da evriliyor. MirrorCode, ai-models’in üretim kodu yeniden yazımındaki sınırlarını dürüst biçimde haritalıyor.
Sonraki Adımlar
epoch-ai ve metr, tam açık kaynak release ile genişletilmiş program setini paylaşmayı planlıyor. Pkl gibi zorlu vakaların erken vs. tam sürüm farkı, benchmark sonuçlarının tarih damgasıyla okunması gerektiğini hatırlatıyor.
Kaynaklar
- MirrorCode benchmark results (Epoch AI)
- MirrorCode arXiv paper (arXiv)