AI 快讯 编译自 the_decoder #模型发布#多模态AI#智能体

阿里Qwen3.7-Plus发布:多模态AI变身自主智能体,11小时写万行代码

阿里Qwen团队推出Qwen3.7-Plus,一个将视觉感知、GUI操作和编程整合为自主智能体的多模态模型。演示中,它11小时内自主开发了一款单词学习应用,生成超万行代码。模型在屏幕理解基准上领先,但整体表现参差不齐。本文解读其能力、定价及对中文开发者的意义。

编译发布 2026/06/06 原文发布 2026/06/06

一句话看懂

阿里Qwen3.7-Plus是一个多模态自主智能体模型,能看屏幕、操作界面、写代码,11小时独立完成一个App开发。

详细发生了什么

阿里Qwen团队发布了Qwen3.7-Plus,这是一个专为自主智能体设计的多模态模型。与普通多模态模型不同,Qwen3.7-Plus将视觉感知、GUI操作和代码生成整合在一个统一的agent loop中,让AI能像人类一样“看”屏幕、“点”按钮、“写”代码,并持续迭代完成任务。

在官方演示中,一个基于Qwen3.7-Plus构建的智能体被要求开发一个单词学习App。它自主规划、编写代码、调试错误,最终在11小时内完成了超过10,000行代码,期间执行了约1,000次agent调用。整个过程无需人工干预。

在Qwen自己的屏幕理解基准测试中,Qwen3.7-Plus表现领先,但在其他通用多模态任务上,整体性能与竞品相比有高有低。值得注意的是,Qwen3.7-Plus是闭源模型,不开放权重,但定价远低于西方前沿模型(如GPT-4o、Claude 3.5等)。

中文圈视角

对中文开发者意味着什么?

  1. 自主智能体能力落地:Qwen3.7-Plus展示的“看屏幕+操作+写代码”闭环,直接对标Anthropic的Computer Use和OpenAI的Operator。但阿里将其整合为一个模型,降低了工程复杂度。国内开发者可以基于API快速构建自动化测试、RPA、代码生成等场景的应用,无需自己拼接多个模型。

  2. 价格优势明显:Qwen3.7-Plus定价远低于GPT-4o和Claude 3.5 Sonnet,这对预算敏感的中文团队(尤其是独立开发者和小型创业公司)是重大利好。不过,闭源策略意味着无法像Qwen2.5那样本地部署,数据安全和合规问题需要关注(特别是涉及用户屏幕内容时)。

  3. 国产替代的差异化:相比DeepSeek、Kimi等国内模型,Qwen3.7-Plus主打“智能体+多模态”的融合,而非单纯的语言或视觉能力。这填补了国内在自主GUI操作领域的空白,但实际效果还需更多第三方评测验证。

  4. 中文场景的盲点:演示中开发的是单词学习App,但中文用户更关心的是:它能否操作微信、支付宝等国内App?能否处理中文UI元素?阿里尚未公布中文场景的测试结果,这是值得关注的后续方向。

几条值得记住的细节

  • 模型类型:Qwen3.7-Plus是一个多模态agent模型,整合视觉、GUI操作和代码生成,而非单一任务模型。
  • 演示成果:11小时内自主开发单词学习App,生成超10,000行代码,执行约1,000次agent调用。
  • 定价:远低于GPT-4o和Claude 3.5 Sonnet,但具体价格未公布(预计按token或调用次数计费)。
  • 开放程度:闭源,不开放权重,仅通过API使用。
  • 性能:在Qwen自有屏幕理解基准上领先,但整体多模态性能参差不齐。

一句话总结

Qwen3.7-Plus让中文开发者以更低成本获得自主智能体能力,但闭源和中文场景适配仍需观察。