Summary
Thinking Machines Lab (founded by ex-OpenAI CTO Mira Murati) released Inkling, a 975-billion-parameter multimodal open-weights MoE model (~41B active), Apache 2.0, with 1M-token context. Largest U.S. open-weights model to date; available on Hugging Face and Tinker; trails proprietary Claude/GPT and some Chinese open models on overall quality; strong on agentic benchmarks per Artificial Analysis; weak factual accuracy (high hallucination rate). Inkling-Small (276B/12B) in preview.
Source Analysis
Research Notes
Additional Sources
- Primary: 2026-07-16-thinking-machines-inkling-official — thinkingmachines.ai introducing Inkling
- 2026-07-16-thinking-machines-inkling-huggingface — day-0 HF support, NVFP4, inference engines
- 2026-07-16-thinking-machines-inkling-axios — enterprise customization thesis; $2B seed context; Kimi K2.5 synthetic data claim
- 2026-07-16-thinking-machines-inkling-decoder — Artificial Analysis Index 41; Omniscience hallucination stats
- Original: 2026-07-16-thinking-machines-inkling-975b-open-weights (The Register)
Key Facts Verified
- Confirmed (primary): 975B total / 41B active MoE; ≤1M context; 45T multimodal tokens; Inkling-Small 276B/12B preview; Hugging Face + Tinker; Apache 2.0 per Register/HF ecosystem coverage
- Confirmed (AA via DECODER): Intelligence Index ~41 (top U.S. open-weights); factual accuracy weak (~40% / ~63% hallucination on Omniscience)
- Vendor-reported: Matches Nemotron 3 Ultra on Terminal Bench 2.1 with ~1/3 tokens (Register)
- Unverified / caution: Axios claim that final training used Kimi K2.5-generated data — not in primary blog excerpt; treat as secondary
- Framing: “Largest U.S. open-weights” is size/leadership narrative — still trails Chinese opens and closed Claude/GPT on overall quality
Broader Context
Fits us-open-weights-race-2026 and us-china-ai-competition: U.S. lab shipping frontier-scale Apache 2.0 weights for self-host/fine-tune while quality leadership remains contested. Commercial bet is tinker customization vs closed API rental.
Related Wiki
inkling · thinking-machines-lab · mira-murati · inkling-small · tinker · open-weight-models · mixture-of-experts · apache-2.0 · artificial-analysis · us-open-weights-race-2026 · open-source-llm · frontier-ai-labs · us-china-ai-competition · moonshot-ai
Draft Article
Thinking Machines, 975B parametreli Inkling’i Apache 2.0 ile açık ağırlık olarak yayınladı
Eski openai CTO’su mira-murati’nin kurduğu thinking-machines-lab, ilk açık ağırlık foundation model’i inkling’i duyurdu. Model, 975 milyar toplam / yaklaşık 41 milyar aktif parametreli bir mixture-of-experts mimarisi kullanıyor; en fazla 1 milyon token context sunuyor ve apache-2.0 lisansı ile Hugging Face ve tinker üzerinden erişilebilir. Bu, ABD kaynaklı en büyük open-weights sürümlerinden biri olarak konumlanıyor; ancak genel kalitede kapalı frontier modellerin ve bazı Çin açık modellerinin gerisinde kalıyor.
Ana Gelişme
Thinking Machines Lab’in 15 Temmuz 2026 tarihli resmi duyurusuna göre Inkling, metin, görüntü ve sesi native işleyen multimodal bir MoE transformer. Pretraining yaklaşık 45 trilyon token’lık metin, görüntü, ses ve video karışımı üzerinde yapıldı. Çıktı tarafında metin odaklı üretim vurgulanıyor. Laboratuvar, Inkling’i bir ailenin ilk üyesi olarak tanımlıyor: amaç yalnızca API kiralama değil, özelleştirme ve fine-tune.
The Register’ın aktarımına göre mimari, DeepSeek-V3 tarzı bir yönlendirme düzenine yakın: 256 routed expert ve iki shared expert; token başına yaklaşık altı expert aktifleşiyor. Native 16-bit inference için iki terabayttan fazla GPU belleği gerektiği belirtiliyor — kabaca sekiz Nvidia B300 veya on altı H200 sınıfı hızlandırıcı. NVFP4 quantized sürümün ise yaklaşık yarısı kadar GPU ile çalışabildiği aktarılıyor. Bu rakamlar, self-host’un “ücretsiz model” değil, ciddi altyapı yatırımı olduğunu hatırlatıyor.
Aileye inkling-small de eşlik ediyor: 276B toplam / 12B aktif MoE, preview aşamasında. Laboratuvar, Small’ın farklı latency trade-off’u ve iyileştirilmiş data/recipe sayesinde birçok benchmark’ta büyük kardeşine yaklaşabildiğini veya onu geçebildiğini öne sürüyor. Tam ağırlıkların test sonrası yayınlanması planlanıyor. Bu, ekiplerin önce Small ile latency/maliyet dengesi kurup sonra full Inkling’e geçmesi için pratik bir yol açıyor.
Dağıtım iki ana kanal üzerinden ilerliyor. Hugging Face bloguna göre day-0 destek transformers, SGLang, llama.cpp ve vLLM gibi motorları kapsıyor; BF16 ile calibrate edilmiş NVFP4 varyantları ve speculative MTP katmanları da anılıyor. tinker platformunda fine-tuning ve API erişimi; 64K ve 256K context seçenekleri ile sınırlı süreli yüzde 50 indirim duyuruldu. Üçüncü taraf API sağlayıcıları (TogetherAI, Fireworks, Modal, Databricks, Baseten) için planlar paylaşıldı. THE DECODER’ın aktardığı fiyat bandı, 64K context’te yaklaşık 1,87 / 4,68 dolar (milyon input/output token) civarında; bu rakamlar sağlayıcı ve context’e göre değişebilir.
Neden Önemli?
us-open-weights-race-2026 ve us-china-ai-competition bağlamında Inkling, ABD’den frontier ölçekli Apache 2.0 ağırlıkların self-host ve fine-tune edilebilir biçimde çıkması anlamına geliyor. Kapalı Claude/GPT API kiralama modeline alternatif olarak laboratuvar, özelleştirme tezini öne çıkarıyor: model “sadece chat API” değil, kurumsal ve araştırma ekiplerinin kendi verisiyle uyarlayabileceği bir temel.
Türk yazılım ve ML ekipleri için pratik sonuç net: lisans ve erişim bariyeri düşüyor; ancak kalite liderliği iddiası yok. “En büyük ABD open-weights” ifadesi boyut/liderlik çerçevesidir; genel Intelligence Index’te Çin açık modelleri ve kapalı frontier sistemler hâlâ önde. Özellikle agentic workload’larda güçlü görünen, factual Q&A’de zayıf kalan bir profil, ürün mimarisini belirliyor: retrieval, citation ve insan denetimi olmadan “bilgi asistanı” olarak kullanmak riskli.
Teknik Detaylar ve Benchmark’lar
artificial-analysis ölçümlerini aktaran THE DECODER’a göre Inkling’in Intelligence Index skoru yaklaşık 41. Bu skor, Nemotron 3 Ultra (38), Gemma 4 31B (29) ve gpt-oss-120b (24) gibi ABD/batı açık ağırlık örneklerinin üzerinde; ABD open-weights liderliği anlatısını destekliyor. Agentic tarafta GDPval-AA v2 Elo yaklaşık 1.238 gibi güçlü sinyaller rapor ediliyor. Thinking Machines, Terminal Bench 2.1’de Nemotron 3 Ultra ile eşleşirken yaklaşık üçte bir token kullandığını iddia ediyor — bu vendor-reported bir verimlilik iddiası.
Factual accuracy tarafı zayıf. Aynı ölçüm setinde Omniscience üzerinde yaklaşık %40 doğruluk ve yaklaşık %63 hallucination oranı aktarılıyor. Self-host planlayan ekipler için bu, grounded RAG, kaynak zorunluluğu ve fact-check katmanlarının varsayılan olması anlamına geliyor. “Frontier open weights” ile “bilgi güvenilirliği” aynı şey değildir.
Optimizasyon tarafında laboratuvar, büyük matrix ağırlıkları için hybrid Muon + AdamW ve parametre schedule’larından söz ediyor. Reasoning / chain-of-thought davranışı ve düşünme token verimliliğinin ayarlanabilirliği de duyuruda yer alıyor. Multimodal giriş (metin, görüntü, ses; pretraining’de video) ile text-centric çıktı kombinasyonu, doküman + ekran görüntüsü + ses notu gibi karma agent workflow’larına uygun görünüyor.
Karşılaştırma: Özelleştirme vs Kapalı API vs Çin Açık Modeller
Inkling’in ticari tezi, Tinker üzerinden fine-tune ve self-host ile kapalı frontier API’ye alternatif sunmak. Kapalı Claude/GPT hatları hâlâ genel kalite ve factual accuracy’de önde görünüyor. Çin açık modelleri (moonshot-ai / Kimi sınıfı, DeepSeek, GLM hattı) ise aynı boyut sınıfında daha yüksek overall skorlar rapor edebiliyor.
Bu tablo, “en iyi model” değil “en büyük ABD açık ağırlık + özelleştirilebilir lisans” hikâyesidir. Geliştirici ve kurumlar için karar kriterleri: (1) GPU maliyeti ve NVFP4 trade-off, (2) hallucination riski, (3) Apache 2.0 uyumu, (4) agentic vs factual workload dengesi, (5) Tinker vs self-host operasyon modeli.
Dual-use ve Sorumluluk
Büyük multimodal open weights’in dual-use boyutu var: aynı açıklık, araştırma ve ürün hızını artırırken kötüye kullanım yüzeyini de genişletebilir. Bu, lisans seçiminin etik tartışmasını gündeme getirir. Bu haberin özü ürün sürümü ve konumlandırmadır; panik dili olmadan not edilmelidir ki kurumlar güvenlik, kullanım politikası ve erişim kontrolünü self-host kararının parçası yapmalıdır.
Bağlam: Laboratuvar ve Yarış
mira-murati, 2025 başında Thinking Machines Lab’i kurduktan sonra laboratuvarı yüksek sermaye ile büyüten isimlerden biri oldu. İkincil haberlerde yüksek seed bağlamı ve kurumsal özelleştirme tezi sıkça işlendi. Eğitim verisine dair yalnızca birincil blogda doğrulanmayan ikincil iddialar bu makalede yer almıyor.
open-weight-models ekosisteminde Inkling, Çin açık modelleri ve Nvidia Nemotron hattı ile aynı “ölçek + lisans” yarışına giriyor. frontier-ai-labs içinde kapalı ağırlık tutan OpenAI / Anthropic çizgisinin karşısında, açık ağırlık + platform (Tinker) hibriti seçilmiş görünüyor. Bu, open-source-llm topluluğu için ABD’den yeni bir ağırlık kaynağı; kalite yarışında ise henüz liderlik değil, rekabetçi bir oyuncu pozisyonu.
Sonraki Adımlar
Inkling-Small’ın preview’dan tam ağırlık yayınına geçişi, üçüncü taraf API’lerin canlıya alınması ve Artificial Analysis / bağımsız benchmark’ların güncellenmesi izlenecek. Hugging Face indirme ve enterprise fine-tune talep eğrisi, “ABD open-weights counterweight” anlatısının ne kadar kalıcı olduğunu gösterecek.
Pratik öneri: pilotlarda Inkling’i agentic / tool-use senaryolarında değerlendirmek; factual Q&A’de mutlaka grounded RAG ve doğrulama katmanı eklemek; production öncesi NVFP4 vs full-precision maliyet-kalite trade-off’unu ölçmek; Small ile latency SLA’sını önce kilitlemek.
Self-host Ekonomisi ve Operasyon
Inkling’i kendi altyapınızda çalıştırmak, lisans maliyetinden çok GPU ve mühendislik maliyeti demektir. The Register’ın aktardığı bellek ihtiyaçları, tam precision self-host’un yalnızca büyük laboratuvar veya bulut bütçeli ekipler için gerçekçi olduğunu gösteriyor. NVFP4 ve üçüncü taraf API’ler, bu bariyeri düşüren ara katmanlardır: ağırlıklar açık kalır, operasyon kısmen kiralanır.
Kurumsal fine-tune senaryosunda tinker üzerinden domain adaptation, “kapalı API’ye prompt mühendisliği”nden farklı bir kontrol yüzeyi sunar. Veri egemenliği, on-prem inference ve özel safety katmanı isteyen ekipler için bu ayrım kritiktir. Buna karşılık factual accuracy zayıflığı, domain adaptation’ın tek başına yeterli olmadığını; retrieval ve doğrulama mimarisinin şart olduğunu gösterir.
Benchmark okumasında Artificial Analysis Intelligence Index ile Omniscience hallucination skorunu birlikte okumak gerekir. Agentic Elo yüksekken hallucination yüksekse, ürün “ajan + tool + grounded veri” mimarisine kaymalı; “serbest bilgi sohbeti”ne değil. Bu ayrım, Inkling’i yanlış işe koşmamak için en pratik editöryal mesajdır.
Ayrıca Inkling-Small preview, latency SLA’sı sıkı olan ürünlerde full 975B’ye geçmeden önce A/B için doğal bir basamak sunar. Laboratuvarın Small’ın birçok benchmark’ta büyük kardeşe yaklaşabildiği iddiası doğruysa, maliyet/performans eğrisi beklenenden daha düz olabilir — yine de bu iddia vendor-reported’dır ve bağımsız tekrar ölçüm şarttır.
Son olarak, Inkling’in Apache 2.0 ile çıkması yalnızca teknik bir lisans detayı değil; ticari ürünleştirme ve türev model üretme özgürlüğünü de belirler. Bu, ABD open-weights yarışında “indirme izni”nden “üretim izni”ne geçişin sembolik bir adımıdır — kalite liderliği henüz gelmemiş olsa bile.
Kaynaklar
- Inkling: Our open-weights model (Thinking Machines Lab)
- The Register: Former OpenAI CTO releases frontier open model
- THE DECODER: Artificial Analysis benchmarks and hallucination stats
- Hugging Face: Welcome Inkling by Thinking Machines
PreScreening Notes
- Score: 9 / Priority: critical — Major open-weights frontier model launch (975B MoE, Apache 2.0) from Mira Murati’s Thinking Machines Lab; largest U.S. open-weights release to date.
- Hard news (product release), same-day (Jul 16), clear AI domain fit; The Register is a credible secondary source.
- No duplicate across pipeline stages. Pass.
Evaluation Report
News Value
- Timeliness: Fresh (Jul 15–16 primary + secondary coverage). Lead story for this batch.
- Impact: High for open-source / self-host / fine-tune ecosystem; Apache 2.0 + Hugging Face availability lowers barriers for labs and enterprises that want customizable weights.
- Prominence: Mira Murati / Thinking Machines Lab (record seed, ex-OpenAI CTO) — major U.S. open-weights counterweight narrative vs closed labs and Chinese open models.
- Proximity: Strong for Turkish AI developers and ML engineers tracking open weights, MoE inference, and agentic benchmarks.
- Novelty: Genuine first public frontier-scale model from Thinking Machines; multimodal natively; clear “open when Altman won’t” framing is newsworthy but should stay factual.
Audience Fit
- Primary fit: AI enthusiasts and software/ML engineers. Actionable: licenses, context length, active-param economics, hallucination caveats, Inkling-Small trade-offs.
- Connects to existing wiki interest in open-weight-models and U.S. vs China open-model competition.
Risk & Ethics
- Claims corroborated across primary (thinkingmachines.ai), Hugging Face, Axios, VentureBeat — low misinformation risk.
-
Benchmark and “largest U.S. open-weights” framing should be cross-checked against Artificial Analysis / primary blog in Analysis; note high hallucination / factual-accuracy weakness explicitly.
- Ethics: open release of large multimodal model raises dual-use / misuse considerations — cover neutrally, not as scare piece.
Publication Strategy
- Format:
deep-dive(1200+ words) — architecture (975B/41B MoE), license, benchmarks vs Claude/GPT/Chinese opens, enterprise customization angle, limitations. - Suggested wiki: open-weight-models, mira-murati, thinking-machines-lab, mixture-of-experts.
Suggested Angle
Türkçe okuyucu için açı: “Murati’nin Thinking Machines’i, ABD’den Apache 2.0 ile 975B/41B aktif MoE Inkling’i açık ağırlık olarak çıkardı — self-host ve fine-tune isteyen ekipler için fırsat; kalite hâlâ kapalı frontier modellerin gerisinde ve factual accuracy zayıf.” Teknik terimler İngilizce kalsın; Hugging Face + Tinker erişimi ve Inkling-Small preview’ı pratik kutuda verilsin.
Editorial Notes
Decision: Approved — lead deep-dive for this batch.
Approved angle / format: Confirm Suggested Angle. Format: deep-dive (1200+ words). Priority: critical.
Reporting instructions:
- Lead with architecture + license + availability (975B/41B MoE, Apache 2.0, HF + Tinker, Inkling-Small preview).
- Explicitly contrast customization thesis vs closed Claude/GPT and Chinese open models; cite Artificial Analysis / Omniscience hallucination caveats.
-
Axios/TechCrunch-style claim that final training used Kimi K2.5-generated synthetic data is not in the primary Thinking Machines blog — attribute to secondary sources only, or omit if space is tight.
- Do not overclaim “best open model”; “largest U.S. open-weights” is size/leadership framing, not overall quality leadership.
- Dual-use / misuse of large multimodal open weights: one neutral paragraph, not scare framing.
Headline suggestions (TR):
- Thinking Machines, 975B parametreli Inkling’i Apache 2.0 ile açık ağırlık olarak yayınladı
- Mira Murati’nin laboratuvarından Inkling: ABD’nin en büyük open-weights modeli Hugging Face’te
- Inkling 975B/41B MoE: self-host ve fine-tune için fırsat, factual accuracy hâlâ zayıf
Must-include key points:
- Specs: 975B total / ~41B active, ≤1M context, multimodal pretrain (~45T tokens), text output
- Apache 2.0; Hugging Face + Tinker; Inkling-Small (276B/12B) preview
- Benchmarks: strong agentic signals; trails proprietary frontier and some Chinese opens; high hallucination / weak factual accuracy
- Enterprise angle: Tinker customization vs closed API rental; us-open-weights-race-2026 / us-china-ai-competition context