AI 快讯 编译自 marktechpost #模型发布#行业分析#Agent

前Qwen技术负责人林俊阳:混合思考模式的教训与转向Agentic RL的必然性

阿里前Qwen技术负责人林俊阳在演讲与长文中复盘Qwen3混合思考模式的设计困境,指出推理思考与指令模式的矛盾,并论证从推理思考转向Agentic思考的必然性。文章涵盖动态思考预算、Agentic RL基础设施挑战及奖励破解问题,对中文AI开发者有直接参考价值。

编译发布 2026/07/05 原文发布 2026/07/05

一句话看懂

前阿里Qwen技术负责人林俊阳复盘Qwen3混合思考模式的设计缺陷,指出推理与指令模式难以兼得,并押注Agentic RL作为下一代方向。

详细发生了什么

2026年3月,阿里Qwen项目技术负责人林俊阳宣布离职,成为独立研究员。他在一场题为“Qwen: Towards a Generalist Model / Agent”的演讲中系统回顾了Qwen模型家族(QwQ-32B、Qwen2.5-Max、Qwen3、Qwen2.5-VL、Qwen2.5-Omni),并与DeepSeek-R1、Grok 3 Beta、Gemini 2.5 Pro、OpenAI o-series等基线对比。

Qwen3的核心特性是混合思考模式(hybrid thinking modes):一个thinking mode用于逐步推理,一个non-thinking mode用于即时响应,并支持动态思考预算(dynamic thinking budgets),调用方可限制模型推理的token数。Qwen3的多语言支持从29种扩展到119种,参数规模从0.6B到235B,提供GGUF、GPTQ、AWQ、MLX等量化格式,全部采用Apache 2.0许可。

林俊阳随后在一篇长文中深入解释了混合思考模式的设计困境。他指出,thinking mode和instruct mode的优化目标相反:instruct模型追求直接、简洁、低延迟,thinking模型则需要在困难问题上花费更多token。简单合并会导致两者性能同时下降——thinking行为变得臃肿,instruct行为失去清晰度。Qwen3尝试通过四阶段后训练管线(长CoT冷启动、推理RL、思考模式融合)来解决,但后续版本(2507系列)最终还是拆分为独立的Instruct和Thinking变体。

林俊阳将问题归因于数据而非模型架构。他对比了Anthropic的做法:Claude 3.7 Sonnet以混合模型形式发布,允许用户设置思考预算;Claude 4则让推理与工具调用交织,面向编码和长任务。他的核心观点是:更长的推理轨迹并不等同于更智能,思考方式应由目标工作负载而非基准测试决定。

他进一步区分了两个时代:推理思考(reasoning thinking,以o1和DeepSeek-R1为代表)和Agentic思考(agentic thinking)。推理思考依赖确定性、可验证的奖励(数学、代码、逻辑),将RL变成大规模rollout和验证的系统问题。Agentic思考则是为了行动而思考:制定计划、决定何时行动、使用工具、读取环境反馈并修正。它需要处理何时停止思考并采取行动、选择哪个工具、整合噪声观测、失败后修订计划、跨多轮和工具调用保持连贯性等挑战。

在Agentic RL中,基础设施面临更大挑战:策略存在于工具服务器、浏览器、终端和沙箱组成的harness中,训练和推理必须解耦,否则rollout吞吐量会崩溃。林俊阳认为,在SFT时代团队优化数据多样性,在Agent时代则应优化环境质量(稳定性、真实性、覆盖率和抗利用性)。他特别指出奖励破解(reward hacking)是最棘手的问题,因为工具访问扩大了攻击面。

中文圈视角

林俊阳的复盘对中文AI开发者有直接参考价值。Qwen3的混合思考模式暴露了一个核心矛盾:追求“全能”模型可能牺牲专项性能。国内厂商如DeepSeek、智谱、月之暗面等也在探索类似路线,但很少公开分享设计失败的经验。这篇内容相当于一份来自一线团队的“避坑指南”。

对于中文用户,Qwen3的119种语言支持(包括中文方言)和Apache 2.0许可意味着可以自由商用和微调。动态思考预算的代码实现(enable_thinking flag)可直接用于生产环境,但需注意thinking mode默认开启,输出会包含<think>标签,解析时需额外处理。

林俊阳强调的Agentic RL基础设施问题,对国内团队尤为重要。目前国产模型在Agent场景的落地多停留在Demo阶段,真正可用的Agent产品较少。他提出的“训练与推理解耦”“环境质量优先于数据多样性”等观点,可能成为下一阶段中文Agent开发的关键原则。

一个未被广泛讨论的盲点是:奖励破解在中文场景可能更严重。由于中文语义复杂、工具调用场景多样(如微信、支付宝等封闭生态),Agent更容易通过“投机取巧”获得高分,而真实任务完成度却很低。林俊阳的警告值得国内开发者警惕。

几条值得记住的细节

  • Qwen3提供0.6B到235B共8个尺寸,其中小模型(0.6B-4B)使用32K context并绑定输入输出embedding,大模型(8B以上)使用128K context并解绑。
  • 混合思考模式通过enable_thinking flag切换,也支持在用户消息后加/think/no_think实现每轮控制。
  • Qwen3的MoE模型(30B-A3B和235B-A22B)每token激活8个专家,总专家数128。
  • 林俊阳认为推理思考时代的主要失败模式是冗长、低价值的推理轨迹;Agentic思考时代的主要失败模式是通过工具访问和env泄露进行奖励破解。
  • 他预测“harness engineering”将变得比模型架构更重要,多Agent编排中需要专门的orchestrator来规划路由并控制上下文污染。

一句话总结

混合思考模式是过渡方案,Agentic RL才是未来——但基础设施和奖励破解是绕不过的坎。