Summary

DeepReinforce released Ornith-1.0 on June 25, 2026: four MIT-licensed open-source coding models (9B–397B) that learn to generate their own RL training scaffolds. The 397B flagship claims 82.4 SWE-Bench Verified and 77.5 Terminal-Bench 2.1, competitive with frontier closed models. Built on Gemma 4 and Qwen 3.5 foundations, the release targets agentic coding workloads with a structurally different training approach from fixed-harness agents.

Source Analysis

Primary: DeepReinforce official blog + Hugging Face model cards. Corroborated by MarkTechPost, TechTimes. Models confirmed on Hugging Face under MIT license.

Research Notes

Additional Sources Found

Key Facts Verified

ClaimStatusSource
MIT license, Hugging Face availabilityVerifiedHugging Face, MarkTechPost
Four sizes: 9B, 31B, 35B MoE, 397B MoEVerifiedAll sources
Built on Gemma 4 + Qwen 3.5VerifiedOfficial blog
Self-scaffolding RL paradigmVerifiedOfficial blog, MarkTechPost
82.4 SWE-Bench / 77.5 Terminal-Bench (397B)Vendor-reportedOfficial blog — independent repro pending
Tops Opus 4.7, trails Opus 4.8Verified (MarkTechPost)MarkTechPost

Benchmark scores are vendor-reported. Harness differences (Terminus-2 vs Claude Code) may affect comparability. "SOTA among open models" is scoped claim.

Broader Context

Counter-narrative to gpt-56 government-gated closed release — open MIT-licensed alternative for Turkish developers. Introduces self-scaffolding-rl as novel agent paradigm vs fixed-harness coding-agents. Prior DeepReinforce work: CUDA-L1, IterX.

Editorial Notes

Approved angle: Kapalı frontier modellere karşı açık MIT lisanslı alternatif — Türk geliştiriciler için erişilebilir kodlama agent’ı.

Format: standard (onaylandı)

Reporting instructions:

Headline suggestions (TR):

  • Ornith-1.0: Kendi RL eğitim iskelesini yazan açık kaynak kodlama modelleri
  • DeepReinforce, MIT lisanslı Ornith-1.0 ile self-scaffolding RL paradigmını tanıttı
  • Açık kaynak kodlama agent’ları: Ornith-1.0 SWE-Bench’te frontier modellere yaklaşıyor

Key points (must include):

  • 25 Haziran release, MIT license, Hugging Face’te 8 artifact
  • 4 boyut: 9B, 31B, 35B MoE, 397B MoE
  • Gemma 4 + Qwen 3.5 tabanlı
  • Self-scaffolding RL: model kendi eğitim iskelesini üretir
  • 397B: 82.4 SWE-Bench / 77.5 Terminal-Bench (vendor-reported)
  • Opus 4.7’yi geçer, 4.8’in gerisinde (MarkTechPost)

Draft Article

Ornith-1.0: Kendi RL Eğitim İskelesini Yazan Açık Kaynak Kodlama Modelleri

deepreinforce, 25 Haziran 2026’da MIT lisanslı ornith-1 kodlama model ailesini yayınladı. Dört boyuttaki modeller (9B–397B), self-scaffolding-rl paradigmasıyla kendi reinforcement learning eğitim iskelelerini üretmeyi öğreniyor. 397B flagship varyantı, vendor-reported verilere göre SWE-Bench Verified’da %82,4 ve Terminal-Bench 2.1’de %77,5 skor bildiriyor — kapalı frontier modellere yaklaşan performans, Hugging Face üzerinden herkesin erişimine açık.

Ana Gelişme

deepreinforce’un resmi blog yazısına göre Ornith-1.0, gemma-4 ve Qwen 3.5 temelleri üzerine inşa edildi. Model ailesi dört varyanttan oluşuyor: 9B, 31B, 35B MoE ve 397B MoE. Hugging Face’te toplam 8 artifact olarak yayınlandı; OpenAI-compatible serving desteği sunuluyor.

Temel yenilik self-scaffolding-rl paradigması. Geleneksel coding-agents sabit bir harness üzerinde eğitilirken, Ornith modelleri eğitim sürecinde kendi RL scaffold’larını — değerlendirme ortamı, reward sinyali, iterasyon döngüsü — dinamik olarak üretmeyi öğreniyor. İki aşamalı RL pipeline, GRPO loss ve async execution ile çalışıyor.

MarkTechPost’un karşılaştırmasına göre 397B varyantı, Opus 4.7’yi geçerken Opus 4.8’in gerisinde kalıyor. Anti-reward-hacking katmanları da eğitime dahil edildi.

Neden Önemli?

Ornith-1.0, aynı hafta gpt-56 ve anthropic-mythos-5-critical-infrastructure-redeploy haberlerindeki hükümet koordinasyonlu erişim kısıtlamalarına doğrudan bir karşı anlatı sunuyor. Türk geliştiriciler ve küresel bağımsız ekipler, kapalı frontier önizlemelerinin dışında kaldıkları bir dönemde MIT lisanslı, indirilebilir bir alternatife sahip oluyor.

open-source-llm ekosisteminde kodlama agent’ları hızla olgunlaşıyor. Ornith’in self-scaffolding yaklaşımı, agentic-coding-infrastructure alanında fixed-harness paradigmasından yapısal bir sapma anlamına geliyor — model sadece kod yazmıyor, kendi eğitim altyapısını da tasarlıyor.

SWE-Bench ve Terminal-Bench skorları vendor-reported'tır. Harness farklılıkları (Terminus-2 vs Claude Code) karşılaştırılabilirliği etkileyebilir. Bağımsız reprodüksiyon henüz yapılmadı.

Teknik Detaylar

Self-scaffolding RL, modelin eğitim sırasında değerlendirme ortamını, test harness’ini ve reward fonksiyonunu kendisinin üretmesi anlamına geliyor. Bu, sabit bir benchmark üzerinde fine-tuning yapan geleneksel yaklaşımdan farklı: model, karşılaştığı görev türüne göre eğitim altyapısını adapte edebiliyor.

deepreinforce’un önceki çalışmaları CUDA-L1 ve IterX, şirketin RL odaklı araştırma geleneğini gösteriyor. Ornith-1.0 bu birikimin kodlama agent’larına uygulanmış hali.

397B MoE mimarisi, büyük compute gerektiriyor — ancak 9B ve 31B varyantları daha erişilebilir deployment seçenekleri sunuyor. Hugging Face model kartlarında teknik detaylar ve inference önerileri mevcut.

Bağlam

2026’nın yaz dönemi, ai-coding-tools rekabetinde iki paralel trendi bir arada taşıyor: kapalı frontier modellerin hükümet denetimli kademeli lansmanı ve açık kaynak alternatiflerin benchmark’larda hızla yaklaşması. gpt-56 Sol’un Terminal-Bench SOTA iddiası ile Ornith-1.0’ın %77,5 skoru aynı hafta geldi — erişim eşitsizliği performans eşitsizliğinden daha belirgin hale geliyor.

swe-bench ve Terminal-Bench, kodlama agent’larının gerçek dünya yeteneğini ölçmede endüstri standardı haline geldi. Ornith’in “açık modeller arasında SOTA” iddiası bu çerçevede anlamlı; ancak kapalı frontier ile doğrudan karşılaştırma dikkatli yorumlanmalı.

Sonraki Adımlar

Bağımsiz benchmark reprodüksiyonları, Ornith-1.0 iddialarının doğrulanmasında belirleyici olacak. Topluluk, Hugging Face üzerinden modelleri test etmeye başladı.

deepreinforce’un self-scaffolding RL yaklaşımının diğer domain’lere — güvenlik analizi, bilimsel hesaplama — genişletilip genişletilmeyeceği izlenecek. Açık kaynak kodlama agent ekosisteminde rekabet, 2026’nın ikinci yarısında hızlanmaya devam edecek.


Kaynaklar