METR 提出“支出地平线”指标,精确计算 AI Agent 何时比人类更贵
METR 发布新指标“支出地平线”,量化 AI Agent 解决任务的成本效益。早期测试显示在 NanoGPT 任务上效果不佳,但新模型可能改变局面。本文解读该指标的意义、盲点及对中文圈用户的影响。
一句话看懂
METR 推出“支出地平线”指标,用美元量化 AI Agent 何时比人类更贵,但早期测试结果并不理想。
详细发生了什么
AI 安全研究机构 METR 发布了一项新指标——“支出地平线”(expenditure horizon),旨在精确计算 AI Agent 在解决特定问题时,何时其成本会超过雇佣人类完成同样工作的成本。该指标将 AI 的运行成本(包括计算资源、API 调用、人工监督等)与人类工资进行对比,给出一个明确的美元数值。
METR 在 NanoGPT 速度跑(speedrun)任务上进行了初步测试,结果并不令人振奋:当前 AI Agent 在多数子任务上的成本仍然高于人类。不过,METR 也承认该指标存在盲点,例如未考虑 AI 的可扩展性和 24/7 运行优势。此外,新一代模型(如 GPT-5、Claude 4.5)的推出可能会显著改变成本效益曲线。
中文圈视角
对中文用户而言,这个指标的实际意义有限,但提供了一个思考框架。国内用户使用 OpenAI 或 Anthropic 的 API 通常需要梯子,且成本因汇率和网络延迟更高。相比之下,国产模型如 DeepSeek、Kimi 和智谱 GLM 的 API 价格更低,且无需额外网络工具。
在具体场景中,例如代码生成或内容创作,国内模型在简单任务上的成本可能已经接近甚至低于人类。但 METR 的指标主要针对复杂、多步骤的 Agent 任务,这类场景下国产模型的能力仍有差距。此外,数据安全和合规问题也限制了国内企业大规模部署海外 AI Agent。
一个中文圈尚未讨论的盲点是:该指标忽略了 AI 的“学习曲线”——模型通过 fine-tuning 或 prompt 优化后,成本可能迅速下降。而人类工资通常只涨不跌。
几条值得记住的细节
- METR 的“支出地平线”指标以美元为单位,对比 AI Agent 与人类完成同一任务的成本。
- 在 NanoGPT 速度跑测试中,当前 AI Agent 的成本效益低于人类。
- 该指标未考虑 AI 的 24/7 运行、可复制性和扩展性优势。
- 新一代模型(如 GPT-5)可能大幅降低 AI Agent 的成本。
- METR 计划将指标开源,并邀请社区贡献更多任务场景。
一句话总结
METR 的指标提醒我们:AI Agent 在成本上超越人类仍需时日,但新模型和规模化效应可能加速这一进程。