AI 快讯 编译自 the_decoder #AI Agent#成本效益#指标

METR 提出“支出地平线”指标,精确计算 AI Agent 何时比人类更贵

METR 发布新指标“支出地平线”,量化 AI Agent 解决任务的成本效益。早期测试显示在 NanoGPT 任务上效果不佳,但新模型可能改变局面。本文解读该指标的意义、盲点及对中文圈用户的影响。

编译发布 2026/07/27 原文发布 2026/07/27

一句话看懂

METR 推出“支出地平线”指标,用美元量化 AI Agent 何时比人类更贵,但早期测试结果并不理想。

详细发生了什么

AI 安全研究机构 METR 发布了一项新指标——“支出地平线”(expenditure horizon),旨在精确计算 AI Agent 在解决特定问题时,何时其成本会超过雇佣人类完成同样工作的成本。该指标将 AI 的运行成本(包括计算资源、API 调用、人工监督等)与人类工资进行对比,给出一个明确的美元数值。

METR 在 NanoGPT 速度跑(speedrun)任务上进行了初步测试,结果并不令人振奋:当前 AI Agent 在多数子任务上的成本仍然高于人类。不过,METR 也承认该指标存在盲点,例如未考虑 AI 的可扩展性和 24/7 运行优势。此外,新一代模型(如 GPT-5、Claude 4.5)的推出可能会显著改变成本效益曲线。

中文圈视角

对中文用户而言,这个指标的实际意义有限,但提供了一个思考框架。国内用户使用 OpenAI 或 Anthropic 的 API 通常需要梯子,且成本因汇率和网络延迟更高。相比之下,国产模型如 DeepSeek、Kimi 和智谱 GLM 的 API 价格更低,且无需额外网络工具。

在具体场景中,例如代码生成或内容创作,国内模型在简单任务上的成本可能已经接近甚至低于人类。但 METR 的指标主要针对复杂、多步骤的 Agent 任务,这类场景下国产模型的能力仍有差距。此外,数据安全和合规问题也限制了国内企业大规模部署海外 AI Agent。

一个中文圈尚未讨论的盲点是:该指标忽略了 AI 的“学习曲线”——模型通过 fine-tuning 或 prompt 优化后,成本可能迅速下降。而人类工资通常只涨不跌。

几条值得记住的细节

  • METR 的“支出地平线”指标以美元为单位,对比 AI Agent 与人类完成同一任务的成本。
  • 在 NanoGPT 速度跑测试中,当前 AI Agent 的成本效益低于人类。
  • 该指标未考虑 AI 的 24/7 运行、可复制性和扩展性优势。
  • 新一代模型(如 GPT-5)可能大幅降低 AI Agent 的成本。
  • METR 计划将指标开源,并邀请社区贡献更多任务场景。

一句话总结

METR 的指标提醒我们:AI Agent 在成本上超越人类仍需时日,但新模型和规模化效应可能加速这一进程。