Thinking Machines, 975B parametreli Inkling’i Apache 2.0 ile açık ağırlık olarak yayınladı

Eski openai CTO’su mira-murati’nin kurduğu thinking-machines-lab, ilk açık ağırlık foundation model’i inkling’i duyurdu. Model, 975 milyar toplam / yaklaşık 41 milyar aktif parametreli bir mixture-of-experts mimarisi kullanıyor; en fazla 1 milyon token context sunuyor ve apache-2.0 lisansı ile Hugging Face ve tinker üzerinden erişilebilir. Bu, ABD kaynaklı en büyük open-weights sürümlerinden biri olarak konumlanıyor; ancak genel kalitede kapalı frontier modellerin ve bazı Çin açık modellerinin gerisinde kalıyor.

Ana Gelişme

Thinking Machines Lab’in 15 Temmuz 2026 tarihli resmi duyurusuna göre Inkling, metin, görüntü ve sesi native işleyen multimodal bir MoE transformer. Pretraining yaklaşık 45 trilyon token’lık metin, görüntü, ses ve video karışımı üzerinde yapıldı. Çıktı tarafında metin odaklı üretim vurgulanıyor. Laboratuvar, Inkling’i bir ailenin ilk üyesi olarak tanımlıyor: amaç yalnızca API kiralama değil, özelleştirme ve fine-tune.

The Register’ın aktarımına göre mimari, DeepSeek-V3 tarzı bir yönlendirme düzenine yakın: 256 routed expert ve iki shared expert; token başına yaklaşık altı expert aktifleşiyor. Native 16-bit inference için iki terabayttan fazla GPU belleği gerektiği belirtiliyor — kabaca sekiz Nvidia B300 veya on altı H200 sınıfı hızlandırıcı. NVFP4 quantized sürümün ise yaklaşık yarısı kadar GPU ile çalışabildiği aktarılıyor. Bu rakamlar, self-host’un “ücretsiz model” değil, ciddi altyapı yatırımı olduğunu hatırlatıyor.

Aileye inkling-small de eşlik ediyor: 276B toplam / 12B aktif MoE, preview aşamasında. Laboratuvar, Small’ın farklı latency trade-off’u ve iyileştirilmiş data/recipe sayesinde birçok benchmark’ta büyük kardeşine yaklaşabildiğini veya onu geçebildiğini öne sürüyor. Tam ağırlıkların test sonrası yayınlanması planlanıyor. Bu, ekiplerin önce Small ile latency/maliyet dengesi kurup sonra full Inkling’e geçmesi için pratik bir yol açıyor.

Dağıtım iki ana kanal üzerinden ilerliyor. Hugging Face bloguna göre day-0 destek transformers, SGLang, llama.cpp ve vLLM gibi motorları kapsıyor; BF16 ile calibrate edilmiş NVFP4 varyantları ve speculative MTP katmanları da anılıyor. tinker platformunda fine-tuning ve API erişimi; 64K ve 256K context seçenekleri ile sınırlı süreli yüzde 50 indirim duyuruldu. Üçüncü taraf API sağlayıcıları (TogetherAI, Fireworks, Modal, Databricks, Baseten) için planlar paylaşıldı. THE DECODER’ın aktardığı fiyat bandı, 64K context’te yaklaşık 1,87 / 4,68 dolar (milyon input/output token) civarında; bu rakamlar sağlayıcı ve context’e göre değişebilir.

Neden Önemli?

us-open-weights-race-2026 ve us-china-ai-competition bağlamında Inkling, ABD’den frontier ölçekli Apache 2.0 ağırlıkların self-host ve fine-tune edilebilir biçimde çıkması anlamına geliyor. Kapalı Claude/GPT API kiralama modeline alternatif olarak laboratuvar, özelleştirme tezini öne çıkarıyor: model “sadece chat API” değil, kurumsal ve araştırma ekiplerinin kendi verisiyle uyarlayabileceği bir temel.

Türk yazılım ve ML ekipleri için pratik sonuç net: lisans ve erişim bariyeri düşüyor; ancak kalite liderliği iddiası yok. “En büyük ABD open-weights” ifadesi boyut/liderlik çerçevesidir; genel Intelligence Index’te Çin açık modelleri ve kapalı frontier sistemler hâlâ önde. Özellikle agentic workload’larda güçlü görünen, factual Q&A’de zayıf kalan bir profil, ürün mimarisini belirliyor: retrieval, citation ve insan denetimi olmadan “bilgi asistanı” olarak kullanmak riskli.

Teknik Detaylar ve Benchmark’lar

artificial-analysis ölçümlerini aktaran THE DECODER’a göre Inkling’in Intelligence Index skoru yaklaşık 41. Bu skor, Nemotron 3 Ultra (38), Gemma 4 31B (29) ve gpt-oss-120b (24) gibi ABD/batı açık ağırlık örneklerinin üzerinde; ABD open-weights liderliği anlatısını destekliyor. Agentic tarafta GDPval-AA v2 Elo yaklaşık 1.238 gibi güçlü sinyaller rapor ediliyor. Thinking Machines, Terminal Bench 2.1’de Nemotron 3 Ultra ile eşleşirken yaklaşık üçte bir token kullandığını iddia ediyor — bu vendor-reported bir verimlilik iddiası.

Factual accuracy tarafı zayıf. Aynı ölçüm setinde Omniscience üzerinde yaklaşık %40 doğruluk ve yaklaşık %63 hallucination oranı aktarılıyor. Self-host planlayan ekipler için bu, grounded RAG, kaynak zorunluluğu ve fact-check katmanlarının varsayılan olması anlamına geliyor. “Frontier open weights” ile “bilgi güvenilirliği” aynı şey değildir.

Optimizasyon tarafında laboratuvar, büyük matrix ağırlıkları için hybrid Muon + AdamW ve parametre schedule’larından söz ediyor. Reasoning / chain-of-thought davranışı ve düşünme token verimliliğinin ayarlanabilirliği de duyuruda yer alıyor. Multimodal giriş (metin, görüntü, ses; pretraining’de video) ile text-centric çıktı kombinasyonu, doküman + ekran görüntüsü + ses notu gibi karma agent workflow’larına uygun görünüyor.

Karşılaştırma: Özelleştirme vs Kapalı API vs Çin Açık Modeller

Inkling’in ticari tezi, Tinker üzerinden fine-tune ve self-host ile kapalı frontier API’ye alternatif sunmak. Kapalı Claude/GPT hatları hâlâ genel kalite ve factual accuracy’de önde görünüyor. Çin açık modelleri (moonshot-ai / Kimi sınıfı, DeepSeek, GLM hattı) ise aynı boyut sınıfında daha yüksek overall skorlar rapor edebiliyor.

Bu tablo, “en iyi model” değil “en büyük ABD açık ağırlık + özelleştirilebilir lisans” hikâyesidir. Geliştirici ve kurumlar için karar kriterleri: (1) GPU maliyeti ve NVFP4 trade-off, (2) hallucination riski, (3) Apache 2.0 uyumu, (4) agentic vs factual workload dengesi, (5) Tinker vs self-host operasyon modeli.

Dual-use ve Sorumluluk

Büyük multimodal open weights’in dual-use boyutu var: aynı açıklık, araştırma ve ürün hızını artırırken kötüye kullanım yüzeyini de genişletebilir. Bu, lisans seçiminin etik tartışmasını gündeme getirir. Bu haberin özü ürün sürümü ve konumlandırmadır; panik dili olmadan not edilmelidir ki kurumlar güvenlik, kullanım politikası ve erişim kontrolünü self-host kararının parçası yapmalıdır.

Bağlam: Laboratuvar ve Yarış

mira-murati, 2025 başında Thinking Machines Lab’i kurduktan sonra laboratuvarı yüksek sermaye ile büyüten isimlerden biri oldu. İkincil haberlerde yüksek seed bağlamı ve kurumsal özelleştirme tezi sıkça işlendi. Eğitim verisine dair yalnızca birincil blogda doğrulanmayan ikincil iddialar bu makalede yer almıyor.

open-weight-models ekosisteminde Inkling, Çin açık modelleri ve Nvidia Nemotron hattı ile aynı “ölçek + lisans” yarışına giriyor. frontier-ai-labs içinde kapalı ağırlık tutan OpenAI / Anthropic çizgisinin karşısında, açık ağırlık + platform (Tinker) hibriti seçilmiş görünüyor. Bu, open-source-llm topluluğu için ABD’den yeni bir ağırlık kaynağı; kalite yarışında ise henüz liderlik değil, rekabetçi bir oyuncu pozisyonu.

Sonraki Adımlar

Inkling-Small’ın preview’dan tam ağırlık yayınına geçişi, üçüncü taraf API’lerin canlıya alınması ve Artificial Analysis / bağımsız benchmark’ların güncellenmesi izlenecek. Hugging Face indirme ve enterprise fine-tune talep eğrisi, “ABD open-weights counterweight” anlatısının ne kadar kalıcı olduğunu gösterecek.

Pratik öneri: pilotlarda Inkling’i agentic / tool-use senaryolarında değerlendirmek; factual Q&A’de mutlaka grounded RAG ve doğrulama katmanı eklemek; production öncesi NVFP4 vs full-precision maliyet-kalite trade-off’unu ölçmek; Small ile latency SLA’sını önce kilitlemek.

Self-host Ekonomisi ve Operasyon

Inkling’i kendi altyapınızda çalıştırmak, lisans maliyetinden çok GPU ve mühendislik maliyeti demektir. The Register’ın aktardığı bellek ihtiyaçları, tam precision self-host’un yalnızca büyük laboratuvar veya bulut bütçeli ekipler için gerçekçi olduğunu gösteriyor. NVFP4 ve üçüncü taraf API’ler, bu bariyeri düşüren ara katmanlardır: ağırlıklar açık kalır, operasyon kısmen kiralanır.

Kurumsal fine-tune senaryosunda tinker üzerinden domain adaptation, “kapalı API’ye prompt mühendisliği”nden farklı bir kontrol yüzeyi sunar. Veri egemenliği, on-prem inference ve özel safety katmanı isteyen ekipler için bu ayrım kritiktir. Buna karşılık factual accuracy zayıflığı, domain adaptation’ın tek başına yeterli olmadığını; retrieval ve doğrulama mimarisinin şart olduğunu gösterir.

Benchmark okumasında Artificial Analysis Intelligence Index ile Omniscience hallucination skorunu birlikte okumak gerekir. Agentic Elo yüksekken hallucination yüksekse, ürün “ajan + tool + grounded veri” mimarisine kaymalı; “serbest bilgi sohbeti”ne değil. Bu ayrım, Inkling’i yanlış işe koşmamak için en pratik editöryal mesajdır.

Ayrıca Inkling-Small preview, latency SLA’sı sıkı olan ürünlerde full 975B’ye geçmeden önce A/B için doğal bir basamak sunar. Laboratuvarın Small’ın birçok benchmark’ta büyük kardeşe yaklaşabildiği iddiası doğruysa, maliyet/performans eğrisi beklenenden daha düz olabilir — yine de bu iddia vendor-reported’dır ve bağımsız tekrar ölçüm şarttır.

Son olarak, Inkling’in Apache 2.0 ile çıkması yalnızca teknik bir lisans detayı değil; ticari ürünleştirme ve türev model üretme özgürlüğünü de belirler. Bu, ABD open-weights yarışında “indirme izni”nden “üretim izni”ne geçişin sembolik bir adımıdır — kalite liderliği henüz gelmemiş olsa bile.


Kaynaklar