AI 快讯 编译自 marktechpost #模型发布#开源模型#多模态

Thinking Machines Lab发布Inkling-Small:276B参数开源MoE多模态模型,单卡B300可部署

Thinking Machines Lab推出开源MoE模型Inkling-Small,总参数276B,激活12B,支持文本、图像、音频输入,1M token上下文,Apache 2.0许可。NVFP4量化版可在单张NVIDIA B300上运行,推理和编程能力超越更大模型,但事实回忆有所下降。本文解析其性能、部署要求及对中文圈用户的意义。

编译发布 2026/08/02 原文发布 2026/08/02

一句话看懂

Thinking Machines Lab发布Inkling-Small,276B总参数、12B激活的开源MoE多模态模型,量化版可在单张NVIDIA B300上运行,推理和编程能力超越其975B的教师模型Inkling。

详细发生了什么

Thinking Machines Lab于8月2日发布Inkling-Small,这是一款开源权重(Apache 2.0)的混合专家(MoE)模型,总参数276B,激活参数12B,约为Inkling(975B总参数,41B激活)的四分之一。模型在NVIDIA GB300 NVL72系统上训练,原生支持文本、图像和音频输入,上下文窗口达1M token,思考强度可调。

部署方面,BF16检查点需要至少600GB聚合VRAM(4x B300或8x H200),而NVFP4量化检查点将需求降至180GB,可在单张B300(SM100+)上以W4A4运行,或在两张H200上以W4A16运行。支持SGLang、vLLM、TokenSpeed、Unsloth和Hugging Face等运行时。

架构上,Inkling-Small是42层decoder-only transformer,稀疏MoE前馈网络,每个token路由到6个专家(共256个)加上2个共享专家。图像以40x40像素patch处理,音频以dMel频谱表示,均通过轻量嵌入层与文本token联合处理。数值格式支持BF16、MXFP8和NVFP4。

性能上,Inkling-Small在多个基准上超越Inkling:Humanity’s Last Exam(文本)31.6% vs 29.7%,SWE-bench Verified 80.2% vs 77.6%,Terminal-Bench 2.1 64.7%,Toolathlon Verified 54.4% vs 45.5%,ARC-AGI-2 40.1% vs 36.5%。但事实回忆下降:SimpleQA Verified 20.6% vs 43.9%,AA Omniscience指数-9.0 vs 2.1。多模态方面,MMMU Pro 74.0%,CharXiv RQ 77.4%(用Python工具时81.3%),VoiceBench 90.1%。安全评估StrongREJECT 98.4%,FORTRESS对抗71.6%。

中文圈视角

对国内用户来说,Inkling-Small的开源权重和低部署门槛意味着更多选择。首先,模型托管在Hugging Face,国内可直接访问(但下载可能受限,可通过ModelScope等镜像获取)。其次,单卡B300部署能力让中小团队无需巨额算力即可运行276B模型,但B300在国内获取难度较高,H200双卡方案相对可行。

与国产模型对比,DeepSeek-V3(671B总参数,37B激活)和Qwen2.5-Max等模型在中文场景有优势,而Inkling-Small的多模态和1M上下文是差异化亮点。对于编程、文档理解等场景,Inkling-Small的SWE-bench 80.2%表现亮眼,但中文支持可能不如国产模型。监管方面,开源权重允许私有化部署,符合数据出境合规要求,但需注意内容安全,建议叠加Llama Guard等过滤层。

几条值得记住的细节

  • Inkling-Small总参数276B,激活12B,Apache 2.0许可,Hugging Face可下载。
  • NVFP4量化版仅需180GB VRAM,单张B300可跑,双H200也可。
  • 上下文窗口1M token,支持文本、图像、音频输入,输出仅文本。
  • 推理和编程超越Inkling,但事实回忆下降(SimpleQA 20.6% vs 43.9%)。
  • 训练后处理使用on-policy distillation,以Inkling为教师,并继续两周agentic coding RL。

一句话总结

Inkling-Small让276B级多模态模型部署门槛大降,但中文场景需权衡事实回忆和本地化支持。