NVIDIA published “NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval” on Hugging Face (July 16, 2026).

Model collection (open weights, datasets, recipes; OpenMDW-1.1 per MarkTechPost):

  1. Nemotron-3-Embed-8B-BF16 — flagship; #1 on RTEB (~78.5% / 78.46 avg NDCG@10); ~75.5% MMTEB Retrieval; emb dim 4096; 32k context.
  2. Nemotron-3-Embed-1B-BF16 — 1.14B; 72.4% RTEB (~27% error-rate reduction vs llama-nemotron-embed-vl-1b-v2); emb dim 2048; 32k context.
  3. Nemotron-3-Embed-1B-NVFP4 — Blackwell-optimized; up to ~2× BF16 throughput; retains 99%+ of BF16 retrieval accuracy.

Architecture notes:

  • 8B adapts Ministral-3-8B-Instruct-2512 causal decoder → bidirectional encoder; contrastive pre-training + multilingual fine-tuning (legal, finance, medical, business, education).
  • 1B via ModelOpt NAS pruning + distillation from 8B teacher (not trained from scratch).

Agentic evaluation: with Nemotron 3 Ultra search agent, stronger embeddings reduced estimated downstream token cost across ViDoRe V3, BRIGHT, BrowseComp-Plus.

Availability: Hugging Face, NVIDIA NIM, vLLM; partners evaluating include Automation Anywhere, Boomi, IBM watsonx.data, Mem0, Palantir, ServiceNow, turbopuffer, You.com, Zep, Zoom.

Primary: https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb
Model card: https://huggingface.co/nvidia/Nemotron-3-Embed-8B-BF16