Recursive, Otonom AI Araştırma Sisteminde İlk SOTA Sonuçlarını Açıkladı

recursive, 11 Haziran 2026’da otonom AI araştırma sisteminin erken sonuçlarını yayınladı. Sistem, hipotez önerme, implementasyon, test ve doğrulama döngüsünü insan müdahalesi olmadan yürütüyor. Kurucu ortaklardan richard-socher; ekosistem bağlantısı andrej-karpathy’nin autoresearch@home benchmark’larıyla.

Şirket bunu "ilk adımlar" olarak çerçeveliyor — otomatik araştırmanın çözüldüğü iddiasından kaçınılmalı.

Ana Gelişme

Üç Benchmark Sonucu

BenchmarkSonuçKarşılaştırma
NanoChat Autoresearch0,9109 validation BPBTopluluk en iyisi 0,9372 (1,3× hızlanma)
NanoGPT Speedrun77,5 saniye2+ yıllık optimize baseline 79,7 saniye
NVIDIA SOL-ExecBench0,754 ortalama SOLBaseline 0,699 (235 kernel; %18 gap azalması)

NanoGPT’teki 2,2 saniyelik iyileşme, 2 yılı aşkın topluluk optimizasyonunun üzerine inşa edildi — bağlam önemli.

Teknik Keşifler

  • NanoChat’te en büyük kazanç: hashed bigram/trigram embedding tabloları
  • GPU optimizasyonu: yeni optimizasyonlar icat etme, bilinen fikirleri yeniden yorumlama, modeling/systems katmanları arası kompozisyon

Neden Önemli?

automated-research ve ai-scientist kavramlarının pratik ilerlemesi. anthropic’in 4 Haziran’daki recursive self-improvement uyarısına karşılık, Recursive somut training/GPU sonuçları sunuyor — spektrumun “uyarı” ve “kanıt” uçları.

Open-source artifact’lar bağımsız doğrulamaya olanak tanıyor — olumlu sinyal.

Teknik Detaylar

Sistem, autoresearch@home topluluğunu aynı seed’den geçti; naive baseline’dan 1,059 → 0,9344 BPB’ye indi.

Bağlam

llm-optimization ve gpu-kernel-optimization alanında otonom araştırma, ML mühendisliği workflow’larını dönüştürebilir.

Bağlam

recursive, richard-socher’in liderliğinde automated research alanında çalışıyor. Socher, Salesforce AI ve meta-learning geçmişiyle tanınıyor. andrej-karpathy’nin autoresearch@home ekosistemi, topluluk benchmark standardı olarak işlev görüyor — Recursive’ın sonuçları bu standart üzerinde ölçülüyor.

Anthropic RSI Uyarısı ile Kontrast

4 Haziran’da anthropic, recursive self-improvement (RSI) konusunda uyarı yayınladı — kontrolsüz kendini iyileştiren sistemlerin risklerini vurguladı. Recursive’ın sonuçları, RSI spektrumunun “pratik training/GPU optimizasyonu” ucunda yer alıyor: sınırlı benchmark’larda, açık kaynak artifact’larla doğrulanabilir sonuçlar.

AI Scientist Ekosistemi

ai-scientist (Sakana/Nature) ve openai Erdős matematik breakthrough’u ile birlikte, automated research 2026’nın yükselen temalarından biri. Recursive, bu kümenin “sistemler/ML engineering” ayağını temsil ediyor.

Open-Source Doğrulama

Şirket, çalışma artifact’larını açık kaynak yayınlıyor — bağımsız araştırmacılar sonuçları reproduce edebilir. Bu, “erken sonuçlar” iddiasının güvenilirliğini artırıyor.

Sonraki Adımlar

  • Open-source artifact’ların topluluk tarafından doğrulanması
  • Daha geniş benchmark’lara genişleme (vision, RL, multi-modal)
  • Erken sonuçlardan production-grade araştırma otomasyonuna geçiş
  • gpu-kernel-optimization alanında endüstriyel adoption

Benchmark Detayları

NanoChat Autoresearch: Validation BPB (bits per byte) metriği; düşük daha iyi. Recursive 0,9109 ile topluluk en iyisi 0,9372’yi geçti — Karpathy’nin orijinal overnight BPB’sine 1,3 kat hızlanma.

NanoGPT Speedrun: 2+ yıllık topluluk optimizasyonunun üzerine 2,2 saniye kazanç — küçük ama zorlu bir baseline üzerinde anlamlı.

SOL-ExecBench: 235 GPU kernel’de ortalama SOL skoru 0,699’dan 0,754’e — donanım limitlerine olan gap %18 azaldı. Sistemler programlama topluluğu için pratik değer taşıyor.


Kaynaklar