阿里Qwen3.7-Plus发布:多模态AI变身自主智能体,11小时写万行代码
阿里Qwen团队推出Qwen3.7-Plus,一个将视觉感知、GUI操作和编程整合为自主智能体的多模态模型。演示中,它11小时内自主开发了一款单词学习应用,生成超万行代码。模型在屏幕理解基准上领先,但整体表现参差不齐。本文解读其能力、定价及对中文开发者的意义。
一句话看懂
阿里Qwen3.7-Plus是一个多模态自主智能体模型,能看屏幕、操作界面、写代码,11小时独立完成一个App开发。
详细发生了什么
阿里Qwen团队发布了Qwen3.7-Plus,这是一个专为自主智能体设计的多模态模型。与普通多模态模型不同,Qwen3.7-Plus将视觉感知、GUI操作和代码生成整合在一个统一的agent loop中,让AI能像人类一样“看”屏幕、“点”按钮、“写”代码,并持续迭代完成任务。
在官方演示中,一个基于Qwen3.7-Plus构建的智能体被要求开发一个单词学习App。它自主规划、编写代码、调试错误,最终在11小时内完成了超过10,000行代码,期间执行了约1,000次agent调用。整个过程无需人工干预。
在Qwen自己的屏幕理解基准测试中,Qwen3.7-Plus表现领先,但在其他通用多模态任务上,整体性能与竞品相比有高有低。值得注意的是,Qwen3.7-Plus是闭源模型,不开放权重,但定价远低于西方前沿模型(如GPT-4o、Claude 3.5等)。
中文圈视角
对中文开发者意味着什么?
-
自主智能体能力落地:Qwen3.7-Plus展示的“看屏幕+操作+写代码”闭环,直接对标Anthropic的Computer Use和OpenAI的Operator。但阿里将其整合为一个模型,降低了工程复杂度。国内开发者可以基于API快速构建自动化测试、RPA、代码生成等场景的应用,无需自己拼接多个模型。
-
价格优势明显:Qwen3.7-Plus定价远低于GPT-4o和Claude 3.5 Sonnet,这对预算敏感的中文团队(尤其是独立开发者和小型创业公司)是重大利好。不过,闭源策略意味着无法像Qwen2.5那样本地部署,数据安全和合规问题需要关注(特别是涉及用户屏幕内容时)。
-
国产替代的差异化:相比DeepSeek、Kimi等国内模型,Qwen3.7-Plus主打“智能体+多模态”的融合,而非单纯的语言或视觉能力。这填补了国内在自主GUI操作领域的空白,但实际效果还需更多第三方评测验证。
-
中文场景的盲点:演示中开发的是单词学习App,但中文用户更关心的是:它能否操作微信、支付宝等国内App?能否处理中文UI元素?阿里尚未公布中文场景的测试结果,这是值得关注的后续方向。
几条值得记住的细节
- 模型类型:Qwen3.7-Plus是一个多模态agent模型,整合视觉、GUI操作和代码生成,而非单一任务模型。
- 演示成果:11小时内自主开发单词学习App,生成超10,000行代码,执行约1,000次agent调用。
- 定价:远低于GPT-4o和Claude 3.5 Sonnet,但具体价格未公布(预计按token或调用次数计费)。
- 开放程度:闭源,不开放权重,仅通过API使用。
- 性能:在Qwen自有屏幕理解基准上领先,但整体多模态性能参差不齐。
一句话总结
Qwen3.7-Plus让中文开发者以更低成本获得自主智能体能力,但闭源和中文场景适配仍需观察。