Nvidia Nemotron 3 Embed: RTEB’de birincilik, açık ağırlık RAG modelleri
nvidia, 16 Temmuz 2026’da Hugging Face blogunda nemotron-3-embed ailesini duyurdu: rag, agentic-retrieval, kod araması ve agent memory için açık embedding modelleri. Bayrak gemisi Nemotron-3-Embed-8B-BF16, yaklaşık 16–17 Temmuz itibarıyla rteb liderliğinde ortalama 78,46 NDCG@10 ile birinci; mmteb Retrieval’da yaklaşık 75,45. Bu bir frontier LLM lansmanı değil — retrieval kalitesi ve üretim verimliliği odaklı bir brifing.
Üç checkpoint var. 8B-BF16 kalite uçunu hedefliyor; Nemotron-3-Embed-1B-BF16 daha hafif bir yol; Nemotron-3-Embed-1B-NVFP4 ise Blackwell için NVFP4 quantization ile BF16’ya göre yaklaşık %99,5 accuracy retention ve 2×’e varan throughput vaat ediyor. Ortak özellikler: OpenMDW-1.1, 32.768 token context, yaklaşık 34 dil. Ağırlıklar, recipes ve nvidia NIM yolu açık; Hugging Face, NIM ve vLLM üzerinden erişim bildiriliyor.
MarkTechPost’a göre 1B modeller sıfırdan eğitilmiyor: ModelOpt NAS prune + distillation ile daha büyük teacher’dan türetiliyor. 8B tarafı Ministral tabanlı bidirectional encoder uyarlaması olarak anlatılıyor. embedding-retrieval-2026 bağlamında aile, nemotron-3-ultra agentic LLM çizgisinin retrieval kardeşi gibi konumlanıyor.
Info
RTEB birinciliği tarihli bir snapshot’tır; sıralamalar kayar. nvidia da gerçek korpus ve latency hedeflerinin NDCG’den ayrı değerlendirilmesi gerektiğini not ediyor — üretim fit ≠ liderboard skoru.
Türk geliştiriciler için pratik seçim: kalite için 8B-BF16’yı kendi veri setinde A/B; maliyet/latency için 1B veya NVFP4’ü ölçmek. open-weight-models ve quantization araç zincirine uyum, hızlı deneme için avantaj. NVIDIA blogu, daha güçlü embedding’lerin Nemotron 3 Ultra search agent ile birleşince ViDoRe V3 / BRIGHT tarzı agentic eval’lerde tahmini downstream token maliyetini düşürdüğünü de iddia ediyor — yine de bu, kendi workload’unuzda doğrulanması gereken ikincil bir sinyal.