阿里Qwen3.8-Max正式发布:2.4万亿参数MoE模型,开放权重下周上线
阿里Qwen团队将Qwen3.8-Max转为正式可用,2.4万亿参数MoE模型支持1M上下文,定价每百万输入2美元。开放权重下周发布,但部署需多节点数据中心。本文解析技术细节、性能表现及对中文开发者的影响。
一句话看懂
阿里Qwen团队将Qwen3.8-Max转为正式可用,2.4万亿参数的MoE模型支持1M上下文,开放权重下周发布,但部署门槛高。
详细发生了什么
阿里Qwen团队宣布Qwen3.8-Max正式可用,并确认开放权重将于下周发布。同时,另一个检查点Qwen3.8-27B也将开放权重。Qwen3.8-Max是一个2.4万亿参数的混合专家(MoE)模型,支持文本、图像和视频输入,输出文本。
模型页面显示1M token的context window,最大输入991K tokens(启用思考时降至983K),最大输出131K tokens,推理预算上限262K tokens。速率限制为每分钟2M tokens和15K请求。定价为每百万输入tokens $2.00,输出$6.00,隐式缓存读取$0.25,显式缓存创建$2.50,读取$0.17。缓存输入比新鲜输入便宜8倍,因此前缀稳定性比提示长度更影响成本。
支持功能包括function calling、结构化输出、批处理、前缀补全和fine-tuning。Responses API内置五个工具:code_interpreter、web_search、web_extractor、t2i_search和i2i_search。
性能方面,Qwen3.8-Max在Terminal-Bench 2.1上得分86.6,高于Claude Opus 4.8和Claude Fable 5的84.6,但低于GPT-5.6 Sol (max)的88.8。SWE-bench Pro得分67.7(Fable 5为80.0),FrontierSWE得分73.5(Fable 5为88.8)。PaperBench领先93.0,IFBench 82.8。GPQA Diamond 92.6,略高于Qwen3.7-Max的92.4。最明显的提升在多模态和智能体能力,而非推理。视觉任务上,OSWorld-Verified 86.1,Parametric CAD Bench 91.5,OmniDocBench 1.5 92.1。相比前代,DeepSWE 1.1从21.6升至56.6,FrontierSWE从40.7升至73.5,JobBench从31.3升至53.4。
但有两个注意点:多模态表格对比的是Qwen3.7-Plus而非Qwen3.7-Max,可能高估代际差异;阿里自己的RL缩放曲线在约4000训练环境时达到峰值0.725,随后下降至0.719和0.689。
中文圈视角
对国内开发者来说,Qwen3.8-Max的开放权重发布意义重大,但部署门槛极高。2.4万亿参数的MoE模型需要多节点数据中心,普通团队难以自托管。相比之下,Qwen3.8-27B才是现实可行的本地部署选择,适合中小团队在自有GPU上运行。
国内用户可通过阿里云DashScope API直接调用,兼容OpenAI接口,切换base URL和模型ID即可集成。定价方面,$2/百万输入tokens约合人民币14元,相比GPT-5.6等海外模型有价格优势,但需注意数据出境合规问题。
国产同类模型中,DeepSeek和Kimi在推理能力上竞争激烈,但Qwen3.8-Max的多模态和智能体能力突出,尤其在长视频索引和文档处理场景。中文用户可期待其在代码生成、法律金融文档审查等领域的应用,但需关注许可证条款(尚未公布)和实际性能验证。
几条值得记住的细节
- 开放权重:Qwen3.8-Max和Qwen3.8-27B下周发布,但旗舰版需多节点数据中心。
- 定价:输入$2/百万tokens,输出$6/百万tokens,缓存输入$0.25/百万tokens。
- 上下文:1M token,最大输入991K,输出131K,推理预算262K。
- 性能:Terminal-Bench 86.6,SWE-bench Pro 67.7,多模态领先但推理提升有限。
- 部署:27B检查点适合普通硬件,旗舰版仅限云端API。
一句话总结
Qwen3.8-Max性能强劲但部署门槛高,中文开发者应关注27B版本和API定价。