Thinking Machines Lab 发布 Inkling:975B 参数开源 MoE 模型,支持可控思考深度
Thinking Machines Lab 于 2026 年 7 月 15 日发布 Inkling,一个 975B 总参数、41B 活跃参数的 MoE 多模态模型,采用 Apache 2.0 开源权重。支持 1M token 上下文窗口,可输入文本、图像和音频。核心亮点是可控思考努力(reasoning_effort),用户可按需调整推理深度以平衡性能与成本。本文详解架构、性能、部署及对…
一句话看懂
Thinking Machines Lab 发布首个从零训练的模型 Inkling,975B 参数开源 MoE,41B 活跃参数,支持 1M token 上下文和文本/图像/音频输入,核心卖点是可调节的思考深度。
详细发生了什么
2026 年 7 月 15 日,Thinking Machines Lab 正式发布 Inkling,这是该实验室首个从零训练的模型,权重以 Apache 2.0 协议开源,并可在 Tinker 平台上微调。Inkling 是一个 Mixture-of-Experts 架构的 transformer,总参数量 975B,但每次推理仅激活 41B 参数。其上下文窗口高达 1M token,预训练数据涵盖 45 万亿 token 的文本、图像、音频和视频。模型支持文本、图像和音频输入,输出为 UTF-8 文本。
实验室同时预告了 Inkling-Small,一个 276B 总参数、12B 活跃参数的 MoE 模型,在多项基准上接近或超越大版本,权重将在测试完成后发布。
架构方面,Inkling 采用 66 层 decoder-only transformer,每层 MoE 包含 256 个路由专家和 2 个共享专家,每个 token 激活 6 个路由专家。注意力机制采用滑动窗口与全局层 5:1 交错,使用相对位置嵌入而非 RoPE。多模态采用无编码器架构,音频通过 dMel 频谱图输入,图像通过四层 hMLP 编码为 40×40 像素块。
训练使用 Muon 优化器(大矩阵权重)和 Adam(其他参数),基于 NVIDIA GB300 NVL72 系统。后训练阶段通过 SFT 和异步强化学习(超过 3000 万次 rollout)完成,RL 过程也产出了模型的核心控制机制——可控思考努力。
性能方面,在 effort=0.99、temperature=1.0 设置下,Inkling 在 AIME 2026 上达到 97.1%,GPQA Diamond 87.2%,SWEBench Verified 77.6%,Terminal Bench 2.1 63.8%,FORTRESS Adversarial 78.0%(开源组第一)。与 Nemotron 3 Ultra 相比,Inkling 在 Terminal Bench 2.1 上仅用约 1/3 的 token 就达到同等性能。
部署方面,BF16 权重需要至少 2TB 聚合显存(8×B300 或 16×H200),NVFP4 量化版只需 600GB(4×B300 或 8×H200)。支持 SGLang、vLLM、TokenSpeed、Unsloth 和 Hugging Face Transformers 等运行时。
中文圈视角
Inkling 的开源策略和可控思考深度对中文圈用户有直接意义。首先,权重完全开源(Apache 2.0),国内开发者无需依赖 API 即可本地部署,但硬件门槛较高(BF16 需要 2TB 显存),实际可用性取决于算力资源。NVFP4 量化版降低了门槛,但需要 Blackwell 架构显卡,目前国内获取 B300 等高端 GPU 仍受限。
与国产模型对比:Inkling 在 Terminal Bench 2.1 上落后 GLM 5.2 约 19 个点,但在 FORTRESS(对抗性安全)上领先。对于中文场景,Inkling 的 1M token 上下文窗口和可控思考深度在长文档分析、代码审查等任务上可能有优势,但中文能力未在基准中体现,需实际测试。
可控思考努力(reasoning_effort)是一个差异化功能:用户可以在简单任务上设置低 effort 以节省 token 和延迟,在复杂推理上设置高 effort。这对于成本敏感的中文开发者尤其有用,可以按需平衡性能与开销。不过,该功能目前仅在 Hugging Face Transformers 中通过参数暴露,vLLM 等运行时是否支持尚待确认。
一个中文圈尚未讨论的盲点:Inkling 使用了相对位置嵌入而非 RoPE,实验室声称外推性更好。如果属实,对于需要处理超长上下文的国内应用(如法律文档、科研论文)可能是一个优势,但需独立验证。
几条值得记住的细节
- 模型权重:Inkling 以 Apache 2.0 协议开源,BF16 和 NVFP4 两种精度均可用。
- 可控思考努力:通过 reasoning_effort 参数调节,范围 0.2-0.99,对应 none 到 max 七个等级。
- 硬件要求:BF16 需要至少 2TB 显存(8×B300 或 16×H200),NVFP4 需要 600GB(4×B300 或 8×H200)。
- 性能亮点:在 FORTRESS Adversarial 上以 78.0% 领先开源组;AIME 2026 达 97.1%。
- Inkling-Small:276B 参数、12B 活跃参数的版本即将发布,性能接近大版本。
一句话总结
Inkling 是一个开源、可控思考深度的多模态 MoE 模型,适合需要定制化推理成本与性能平衡的开发者,但硬件门槛较高。