Ornith-1.0: Kendi RL Eğitim İskelesini Yazan Açık Kaynak Kodlama Modelleri

deepreinforce, 25 Haziran 2026’da MIT lisanslı ornith-1 kodlama model ailesini yayınladı. Dört boyuttaki modeller (9B–397B), self-scaffolding-rl paradigmasıyla kendi reinforcement learning eğitim iskelelerini üretmeyi öğreniyor. 397B flagship varyantı, vendor-reported verilere göre SWE-Bench Verified’da %82,4 ve Terminal-Bench 2.1’de %77,5 skor bildiriyor — kapalı frontier modellere yaklaşan performans, Hugging Face üzerinden herkesin erişimine açık.

Ana Gelişme

deepreinforce’un resmi blog yazısına göre Ornith-1.0, gemma-4 ve Qwen 3.5 temelleri üzerine inşa edildi. Model ailesi dört varyanttan oluşuyor: 9B, 31B, 35B MoE ve 397B MoE. Hugging Face’te toplam 8 artifact olarak yayınlandı; OpenAI-compatible serving desteği sunuluyor.

Temel yenilik self-scaffolding-rl paradigması. Geleneksel coding-agents sabit bir harness üzerinde eğitilirken, Ornith modelleri eğitim sürecinde kendi RL scaffold’larını — değerlendirme ortamı, reward sinyali, iterasyon döngüsü — dinamik olarak üretmeyi öğreniyor. İki aşamalı RL pipeline, GRPO loss ve async execution ile çalışıyor.

MarkTechPost’un karşılaştırmasına göre 397B varyantı, Opus 4.7’yi geçerken Opus 4.8’in gerisinde kalıyor. Anti-reward-hacking katmanları da eğitime dahil edildi.

Neden Önemli?

Ornith-1.0, aynı hafta gpt-56 ve anthropic-mythos-5-critical-infrastructure-redeploy haberlerindeki hükümet koordinasyonlu erişim kısıtlamalarına doğrudan bir karşı anlatı sunuyor. Türk geliştiriciler ve küresel bağımsız ekipler, kapalı frontier önizlemelerinin dışında kaldıkları bir dönemde MIT lisanslı, indirilebilir bir alternatife sahip oluyor.

open-source-llm ekosisteminde kodlama agent’ları hızla olgunlaşıyor. Ornith’in self-scaffolding yaklaşımı, agentic-coding-infrastructure alanında fixed-harness paradigmasından yapısal bir sapma anlamına geliyor — model sadece kod yazmıyor, kendi eğitim altyapısını da tasarlıyor.

SWE-Bench ve Terminal-Bench skorları vendor-reported'tır. Harness farklılıkları (Terminus-2 vs Claude Code) karşılaştırılabilirliği etkileyebilir. Bağımsız reprodüksiyon henüz yapılmadı.

Teknik Detaylar

Self-scaffolding RL, modelin eğitim sırasında değerlendirme ortamını, test harness’ini ve reward fonksiyonunu kendisinin üretmesi anlamına geliyor. Bu, sabit bir benchmark üzerinde fine-tuning yapan geleneksel yaklaşımdan farklı: model, karşılaştığı görev türüne göre eğitim altyapısını adapte edebiliyor.

deepreinforce’un önceki çalışmaları CUDA-L1 ve IterX, şirketin RL odaklı araştırma geleneğini gösteriyor. Ornith-1.0 bu birikimin kodlama agent’larına uygulanmış hali.

397B MoE mimarisi, büyük compute gerektiriyor — ancak 9B ve 31B varyantları daha erişilebilir deployment seçenekleri sunuyor. Hugging Face model kartlarında teknik detaylar ve inference önerileri mevcut.

Bağlam

2026’nın yaz dönemi, ai-coding-tools rekabetinde iki paralel trendi bir arada taşıyor: kapalı frontier modellerin hükümet denetimli kademeli lansmanı ve açık kaynak alternatiflerin benchmark’larda hızla yaklaşması. gpt-56 Sol’un Terminal-Bench SOTA iddiası ile Ornith-1.0’ın %77,5 skoru aynı hafta geldi — erişim eşitsizliği performans eşitsizliğinden daha belirgin hale geliyor.

swe-bench ve Terminal-Bench, kodlama agent’larının gerçek dünya yeteneğini ölçmede endüstri standardı haline geldi. Ornith’in “açık modeller arasında SOTA” iddiası bu çerçevede anlamlı; ancak kapalı frontier ile doğrudan karşılaştırma dikkatli yorumlanmalı.

Sonraki Adımlar

Bağımsiz benchmark reprodüksiyonları, Ornith-1.0 iddialarının doğrulanmasında belirleyici olacak. Topluluk, Hugging Face üzerinden modelleri test etmeye başladı.

deepreinforce’un self-scaffolding RL yaklaşımının diğer domain’lere — güvenlik analizi, bilimsel hesaplama — genişletilip genişletilmeyeceği izlenecek. Açık kaynak kodlama agent ekosisteminde rekabet, 2026’nın ikinci yarısında hızlanmaya devam edecek.


Kaynaklar