NVIDIA 发布 Nemotron 3 Embed 开源嵌入模型,8B 版本登顶 RTEB 排行榜
NVIDIA 发布 Nemotron 3 Embed 系列开源嵌入模型,包含 8B BF16、1B BF16 和 1B NVFP4 三个检查点。8B 版本在 RTEB 基准上以 78.46 平均 NDCG@10 排名第一,支持 32768 token 输入。1B 版本通过 NAS 剪枝和蒸馏获得,NVFP4 量化版在 Blackwell 上吞吐量翻倍且精度损失小于 1%。本文详解模型性能…
一句话看懂
NVIDIA 发布 Nemotron 3 Embed 开源嵌入模型系列,8B 版本在 RTEB 基准上排名第一,支持 32768 token 输入,1B 量化版在 Blackwell 上吞吐量翻倍。
详细发生了什么
NVIDIA 于 2026 年 7 月 15-16 日发布 Nemotron 3 Embed 系列,包含三个开源检查点:Nemotron-3-Embed-8B-BF16(约 8B 参数)、Nemotron-3-Embed-1B-BF16(1.14B 参数)和 Nemotron-3-Embed-1B-NVFP4(1.14B 参数,4 位量化)。所有模型均为双向注意力 Transformer 编码器,通过平均池化生成嵌入,最大序列长度 32768 token,支持 34 种语言评估。
8B 版本在 RTEB(Retrieval Embedding Benchmark)上以 78.46 平均 NDCG@10 排名第一,远超此前基线。1B 版本通过 NVIDIA ModelOpt 的 NAS 剪枝和 COS+MSE 蒸馏从 8B 教师模型获得,在 RTEB 上得分 72.38。NVFP4 量化版仅损失 0.38 分(保留 99.5% 精度),但在 Blackwell 硬件上吞吐量可达 BF16 的 2 倍。
模型基于 Mistral 架构:8B 使用 Ministral-3-8B-Instruct-2512,1B 使用 Ministral-3-3B-Instruct-2512。所有检查点采用 OpenMDW-1.1 许可证。NVIDIA 还发布了优化的 NIM 微服务和 NeMo AutoModel 微调配方。
中文圈视角
对中文开发者来说,Nemotron 3 Embed 的 34 语言支持包括中文,但需注意其训练数据中中文占比未知。与国产嵌入模型(如 BGE、GTE 系列)相比,8B 版本在 RTEB 上表现更强,但参数量更大、推理成本更高。1B 版本更适合中文场景的轻量部署,NVFP4 量化版在 Blackwell 上性价比突出。
国内用户可直接通过 Hugging Face 下载模型,但需自行处理网络问题。模型许可证 OpenMDW-1.1 允许商业使用,但需注意数据出境合规。对于中文 RAG 应用,建议先用中文数据集测试检索效果,因为模型在中文任务上的表现可能不如专门的中文嵌入模型。此外,32768 token 的上下文窗口对长文档检索(如法律合同、学术论文)非常实用。
一个尚未被广泛讨论的盲点:NVFP4 量化版支持动态嵌入维度(可截断至 1024 或 512 维),这为存储和检索效率提供了灵活选择,尤其适合大规模中文语料库的索引优化。
几条值得记住的细节
- 8B 模型在 RTEB 上平均 NDCG@10 为 78.46,排名第一;1B 模型为 72.38。
- NVFP4 量化版在 Blackwell 上吞吐量可达 BF16 的 2 倍,精度保留 99% 以上。
- 所有模型支持 32768 token 输入,使用 query: 和 passage: 前缀区分查询与文档。
- 1B 模型通过 NAS 剪枝和蒸馏获得,训练数据量从 50M+ 降至 8.5M+(蒸馏)和 20K(QAD)。
- 模型可通过 Sentence Transformers 或 vLLM 的 /v2/embed 接口部署。
一句话总结
Nemotron 3 Embed 为 RAG 和检索任务提供了从高精度到高吞吐的灵活选择,中文用户可优先测试 1B 版本平衡成本与效果。