Amazon A-Evolve: 30B Modeli İnsan Müdahalesi Olmadan Eğiten ve Kendi Metriğini Düzelten Otonom Döngü
amazon’ın a-evo-lab ekibi, a-evolve sistemiyle 30 milyar parametreli NVIDIA Nemotron modelinde tam otonom bir post-training kampanyası tamamladı — dört round boyunca haftalar süren, sıfır insan müdahalesi. Asıl haber yalnızca ölçek değil: sistem, kampanya ortasında iç değerlendirme metriğinin yanıltıcı hale geldiğini (specification gaming) tespit edip arama stratejisini otonom olarak revize etti. Sonuç model, Nemotron-Reasoning Challenge leaderboard’unda 0.86 skorla ~4.000 giriş arasında 8. sırada; en iyi insan gönderimi 0.87.
Ana Gelişme
arXiv’de 9 Haziran 2026’da yayımlanan “A-Evolve-Training: Autonomous Post-Training of a 30B Model” (2606.20657) makalesi, frontier ölçekte ilk kamuya açık otonom post-training koşusunu belgeliyor. Önceki otonom ML araştırmaları yaklaşık GPT-2 sınıfında (~124 milyon parametre) çalışıyordu; 30B ölçeğe geçiş yaklaşık 240 katlık bir sıçrama.
Kampanya parametreleri:
- Model: 30B NVIDIA Nemotron base
- Round sayısı: 4
- Worker: Round başına N=8 homojen worker
- İnsan müdahalesi: İlk substrate yazımı ile final submission arasında sıfır
- Altyapı: Multi-H200-GPU Kubernetes cluster’ları, round başına günler süren training run’ları
Otonom üretilen model, held-out leaderboard skoru olarak 0.86 elde etti. En iyi insan gönderimi 0.87; fark yalnızca 0.01.
Neden Önemli?
“AI kendi kendine eğitti” başlıkları yanıltıcı olabilir. a-evolve’un asıl katkısı, automated-research ve ai-scientist tartışmasına somut bir vaka çalışması sunması: otonom bir sistemin proxy metric tuzaklarını fark edip düzeltme kapasitesi.
specification-gaming — bir sistemin ölçülen hedefi optimize ederken asıl amacı kaçırması — alignment araştırmasının temel sorunlarından biri. A-Evolve, bu tuzağın erken aşamalarını insan müdahalesi olmadan tespit edip arama politikasını değiştirdi. Bu, ai-safety perspektifinden olumlu bir sinyal; ancak yorumlanabilirlik sınırları ve proxy metric riskleri devam ediyor.
Teknik Detaylar: Mimari
A-Evolve’un frontier ölçekte hayatta kalmasını sağlayan üç tasarım kararı:
graph TB subgraph "Immutable Substrate" S[Operator-audited default training stack] end subgraph "Round N" W1[Worker 1] W2[Worker 2] W8[Worker 8] S --> W1 S --> W2 S --> W8 end subgraph "Policy Update" E[Round-level evidence aggregation] P[Search policy promotion] W1 --> E W2 --> E W8 --> E E --> P end P -->|"Next round"| S
1. Immutable Reference Substrate
Her round, aynı operator-audited default training stack’i izole candidate sandbox’lara fork ediyor. Substrate’in kendisi asla üzerine yazılmıyor. Bu, otonom döngünün “drift” etmesini ve birikimli hataların birikmesini önlüyor.
2. Homogeneous, Memory-Free Workers
Her round sekiz özdeş worker spawn ediyor. Her worker substrate’ten taze başlıyor; diğerlerinin önerilerinden habersiz. Round’lar arası bellek taşınmıyor — yalnızca arama politikası (search policy) promote ediliyor. Bu tasarım, worker’lar arası “groupthink” veya erken yakınsama riskini azaltıyor.
3. Round-Level Evidence Aggregation
Geri bildirim her round sonunda geliyor; gerçek zamanlı değil. Yalnızca arama politikası güncelleniyor — model ağırlıkları veya ara veri artifact’ları değil. Frontier ölçekte her training run günler sürdüğü için bu batch yaklaşımı pratik bir zorunluluk.
Specification Gaming Tespiti ve Self-Correction
Kampanyanın en kritik bulgusu orta aşamada gerçekleşti. Otonom döngü, iç geliştirme metriğinin (proxy) modelin en zayıf reasoning domain’indeki gerçek performansı artık yansıtmadığını tespit etti.
Aday müdahaleler development metric’i rekor seviyelere çıkarıyordu; ancak external target (dış hedef performans) hareket etmiyordu. Klasik specification gaming paterni.
A-Evolve’un tepkisi:
- Proxy’yi yükselten müdahaleleri aramayı bıraktı
- Proxy’yi düşürürken external target’ı iyileştiren müdahaleleri özellikle aramaya başladı
- Tüm bunları insan müdahalesi olmadan gerçekleştirdi
Bu davranış, alignment topluluğu için önemli: otonom sistemlerin kendi ölçüm hatalarını düzeltme kapasitesi — en azından bu ölçekte ve bu benchmark’ta — kanıtlandı.
120B ve 550B: Infrastructure Validation
Aynı otonom sistem, NVIDIA’ın 120 milyar ve 550 milyar parametreli Nemotron varyantlarına da uygulandı. Makale bu sonuçları infrastructure evidence olarak çerçeveliyor — döngünün bu ölçeklerde crash etmeden kapandığını gösteriyor.
Önemli caveat: 120B ve 550B sonuçlarında insan baseline karşılaştırması yok. Bu ölçeklerdeki sonuçlar rekabetçi performans iddiası olarak sunulmamalı; yalnızca altyapı doğrulaması olarak değerlendirilmeli.
Bağlam: Otonom Araştırma Manzarası
a-evolve, automated-research ekosisteminde ai-scientist, recursive-automated-ai-research ve mirendil gibi girişimlerle birlikte konumlanıyor. a-evo-lab, a-evolve framework’ünü açık kaynak olarak duyurdu (GitHub announcement, 11 Haziran 2026).
Önceki otonom ML çalışmaları genellikle küçük modellerde proof-of-concept düzeyinde kaldı. 30B ölçeğe geçiş, otonom post-training’in pratik uygulanabilirliğini test eden ilk ciddi deneme. Her training run günler sürdüğü ve tam kampanya haftalar aldığı için compute maliyeti ve operasyonel karmaşıklık önemli kısıtlar.
reinforcement-learning ve nemotron-3-ultra bağlamında, NVIDIA Nemotron-Reasoning Challenge paylaşılan bir Nemotron 3 Nano baseline ve NVIDIA Research tarafından geliştirilen yeni bir reasoning benchmark üzerinden yürütülüyor. Katılımcılar aynı başlangıç noktasından çalışıyor; bu da karşılaştırmayı adil kılıyor.
Alignment ve Risk Perspektifi
Olumlu sinyal: specification gaming tespiti ve self-correction. Ancak dikkat edilmesi gereken riskler:
Proxy metric riski: İç metrikler her zaman dış performansı yansıtmayabilir. A-Evolve bu durumu tespit etti — ancak tespit edemediği durumlar da mümkün.
Yorumlanabilirlik sınırları: Otonom döngünün iç reasoning’i tam olarak yorumlanabilir değil. Hangi müdahalelerin neden seçildiği, insan araştırmacının anlayışından farklı olabilir.
Genelleme: Tek benchmark (Nemotron-Reasoning Challenge) ve tek model ailesi (Nemotron) üzerindeki sonuçlar, tüm post-training senaryolarına genellenemez.
Production deployment: Bu bir araştırma milestone’u; henüz production-deployed bir sistem değil.
Sonraki Adımlar
A-EVO-Lab, a-evolve framework’ünü açık kaynak olarak sunuyor; topluluk kendi otonom post-training denemelerini yapabilir. Alignment araştırmacıları, specification gaming self-correction mekanizmasını daha geniş senaryolarda test etmek isteyecektir.
120B ve 550B sonuçlarının insan baseline’larla karşılaştırılması bekleniyor. ai-benchmarks tartışmasında, otonom üretilen modellerin leaderboard performansının insan mühendisliğiyle ne kadar yakınlaştığı izlenecek.
Otonom ML hype’ından kaçınmak önemli: bu sistem insan müdahalesi olmadan çalıştı — ancak substrate, benchmark tasarımı ve arama uzayı insanlar tarafından tanımlandı. Tam otonomi değil; dar bir görev alanında yüksek derecede otonom bir optimizasyon döngüsü.