Recursive, Otonom AI Araştırma Sisteminde İlk SOTA Sonuçlarını Açıkladı
recursive, 11 Haziran 2026’da otonom AI araştırma sisteminin erken sonuçlarını yayınladı. Sistem, hipotez önerme, implementasyon, test ve doğrulama döngüsünü insan müdahalesi olmadan yürütüyor. Kurucu ortaklardan richard-socher; ekosistem bağlantısı andrej-karpathy’nin autoresearch@home benchmark’larıyla.
Şirket bunu "ilk adımlar" olarak çerçeveliyor — otomatik araştırmanın çözüldüğü iddiasından kaçınılmalı.
Ana Gelişme
Üç Benchmark Sonucu
| Benchmark | Sonuç | Karşılaştırma |
|---|---|---|
| NanoChat Autoresearch | 0,9109 validation BPB | Topluluk en iyisi 0,9372 (1,3× hızlanma) |
| NanoGPT Speedrun | 77,5 saniye | 2+ yıllık optimize baseline 79,7 saniye |
| NVIDIA SOL-ExecBench | 0,754 ortalama SOL | Baseline 0,699 (235 kernel; %18 gap azalması) |
NanoGPT’teki 2,2 saniyelik iyileşme, 2 yılı aşkın topluluk optimizasyonunun üzerine inşa edildi — bağlam önemli.
Teknik Keşifler
- NanoChat’te en büyük kazanç: hashed bigram/trigram embedding tabloları
- GPU optimizasyonu: yeni optimizasyonlar icat etme, bilinen fikirleri yeniden yorumlama, modeling/systems katmanları arası kompozisyon
Neden Önemli?
automated-research ve ai-scientist kavramlarının pratik ilerlemesi. anthropic’in 4 Haziran’daki recursive self-improvement uyarısına karşılık, Recursive somut training/GPU sonuçları sunuyor — spektrumun “uyarı” ve “kanıt” uçları.
Open-source artifact’lar bağımsız doğrulamaya olanak tanıyor — olumlu sinyal.
Teknik Detaylar
Sistem, autoresearch@home topluluğunu aynı seed’den geçti; naive baseline’dan 1,059 → 0,9344 BPB’ye indi.
Bağlam
llm-optimization ve gpu-kernel-optimization alanında otonom araştırma, ML mühendisliği workflow’larını dönüştürebilir.
Bağlam
recursive, richard-socher’in liderliğinde automated research alanında çalışıyor. Socher, Salesforce AI ve meta-learning geçmişiyle tanınıyor. andrej-karpathy’nin autoresearch@home ekosistemi, topluluk benchmark standardı olarak işlev görüyor — Recursive’ın sonuçları bu standart üzerinde ölçülüyor.
Anthropic RSI Uyarısı ile Kontrast
4 Haziran’da anthropic, recursive self-improvement (RSI) konusunda uyarı yayınladı — kontrolsüz kendini iyileştiren sistemlerin risklerini vurguladı. Recursive’ın sonuçları, RSI spektrumunun “pratik training/GPU optimizasyonu” ucunda yer alıyor: sınırlı benchmark’larda, açık kaynak artifact’larla doğrulanabilir sonuçlar.
AI Scientist Ekosistemi
ai-scientist (Sakana/Nature) ve openai Erdős matematik breakthrough’u ile birlikte, automated research 2026’nın yükselen temalarından biri. Recursive, bu kümenin “sistemler/ML engineering” ayağını temsil ediyor.
Open-Source Doğrulama
Şirket, çalışma artifact’larını açık kaynak yayınlıyor — bağımsız araştırmacılar sonuçları reproduce edebilir. Bu, “erken sonuçlar” iddiasının güvenilirliğini artırıyor.
Sonraki Adımlar
- Open-source artifact’ların topluluk tarafından doğrulanması
- Daha geniş benchmark’lara genişleme (vision, RL, multi-modal)
- Erken sonuçlardan production-grade araştırma otomasyonuna geçiş
- gpu-kernel-optimization alanında endüstriyel adoption
Benchmark Detayları
NanoChat Autoresearch: Validation BPB (bits per byte) metriği; düşük daha iyi. Recursive 0,9109 ile topluluk en iyisi 0,9372’yi geçti — Karpathy’nin orijinal overnight BPB’sine 1,3 kat hızlanma.
NanoGPT Speedrun: 2+ yıllık topluluk optimizasyonunun üzerine 2,2 saniye kazanç — küçük ama zorlu bir baseline üzerinde anlamlı.
SOL-ExecBench: 235 GPU kernel’de ortalama SOL skoru 0,699’dan 0,754’e — donanım limitlerine olan gap %18 azaldı. Sistemler programlama topluluğu için pratik değer taşıyor.