AI 快讯 编译自 marktechpost #模型发布#功能更新#行业分析

Anthropic Claude Sonnet 5 发布:Agentic 编码能力逼近 Opus 4.8,API 定价更低

Anthropic 发布 Claude Sonnet 5,在 SWE-bench Pro、OSWorld 等基准测试中全面超越 Sonnet 4.6,部分指标接近 Opus 4.8。API 定价 $2/$10 per MTok(8月31日前),标准价 $3/$15。新增 effort levels 控制推理深度。本文对比三款模型性能、定价及成本权衡,并分析对中文开发者的实际意义。

编译发布 2026/06/30 原文发布 2026/06/30

一句话看懂

Anthropic 发布 Claude Sonnet 5,在 agentic 编码和工具使用上大幅提升,性能逼近旗舰 Opus 4.8,但 API 定价更低,成为开发者性价比新选择。

详细发生了什么

Anthropic 于 2026 年 6 月 30 日发布 Claude Sonnet 5,定位为“最具 agentic 能力的 Sonnet 模型”。它能够规划、驱动浏览器和终端,并自主执行长任务。Sonnet 5 即日起成为 Free 和 Pro 计划的默认模型,Max、Team、Enterprise 用户可手动选择,同时上线 Claude Code 和 Claude Platform。

在基准测试中,Sonnet 5 全面超越前代 Sonnet 4.6:SWE-bench Pro 得分 63.2%(Sonnet 4.6 为 58.1%,Opus 4.8 为 69.2%);OSWorld-Verified 得分 81.2%(Sonnet 4.6 为 78.5%);Terminal-Bench 2.1 得分 80.4%(Sonnet 4.6 为 67.0%);Humanity’s Last Exam(with tools)得分 57.4%(Sonnet 4.6 为 46.8%,Opus 4.8 为 57.9%)。在知识工作基准 GDPval-AA v2 上,Sonnet 5 以 1,618 分略超 Opus 4.8 的 1,615 分。

API 定价方面,Sonnet 5 推出限时优惠:输入 $2/MTok,输出 $10/MTok,持续至 2026 年 8 月 31 日;之后恢复标准价 $3/$15。作为对比,Opus 4.8 为 $5/$25,Sonnet 4.6 为 $3/$15。Sonnet 5 还引入了 effort levels(低、中、高、极高),更高 effort 会消耗更多 token 进行推理,提升质量的同时也增加成本。

中文圈视角

对中文开发者而言,Sonnet 5 的发布意味着在 agentic 编码和自动化任务上多了一个高性价比选择。目前国内用户访问 Anthropic API 需要梯子,且不支持中国大陆手机号注册,门槛较高。但若通过海外云服务(如 AWS Bedrock)或第三方代理,仍可使用。

与国产模型对比:DeepSeek V3 在代码生成上表现不俗,但在 agentic 任务(如多步工具调用、浏览器操作)上仍落后于 Sonnet 5。Kimi 的 long context 能力与 Sonnet 5 的 1M token context 相当,但 agentic 可靠性不足。智谱 GLM-4 在中文理解上有优势,但国际基准测试成绩普遍低于 Sonnet 5。

对中文用户的具体场景:如果你做海外项目或使用英文代码库,Sonnet 5 的 agentic 能力能显著提升调试和自动化效率;但若主要处理中文内容,建议同时测试国产模型,因为 Sonnet 5 的中文能力未经充分验证。此外,数据出境和内容安全需注意:若涉及敏感数据,应优先选择国内合规模型。

一个中文圈尚未讨论的盲点:Sonnet 5 的 tokenizer 更新可能导致相同文本 token 数增加 1.0-1.35 倍,这意味着实际成本可能高于标价,开发者需在成本估算中考虑这一因素。

几条值得记住的细节

  • 基准测试:Sonnet 5 在 SWE-bench Pro 上 63.2%,接近 Opus 4.8 的 69.2%,远超 Sonnet 4.6 的 58.1%。
  • API 定价:限时优惠 $2/$10 per MTok 至 8 月 31 日,之后标准价 $3/$15;Opus 4.8 为 $5/$25。
  • Effort levels:新增低/中/高/极高四级,高 effort 下成本可能超过 Opus 4.8。
  • Context window:Sonnet 5 支持 1M token context,与 Opus 4.8 相同。
  • 安全性:Sonnet 5 故意降低网络攻击能力,安全敏感任务建议使用 Opus。

一句话总结

Sonnet 5 以更低价格提供接近 Opus 的 agentic 编码能力,是开发者提升自动化效率的性价比之选,但需注意 tokenizer 变化带来的实际成本。