AI 快讯 编译自 the_decoder #模型发布#AI 数学#评测基准

Claude Fable 5 在 FrontierMath 最难题目上超越 GPT-5.5 达 13 个百分点,AI 数学推理能力再跃升

Anthropic 最新模型 Claude Fable 5 在 FrontierMath 最困难级别上达到 88% 准确率,远超 GPT-5.5 的 75%,较年初 Opus 4.5 的不足 10% 实现飞跃。本文解析这一突破对数学研究、AI 评测及中文用户的实际意义。

编译发布 2026/06/13 原文发布 2026/06/13

一句话看懂

Anthropic 的 Claude Fable 5 在 FrontierMath 最难题目上达到 88% 准确率,比 GPT-5.5 高出 13 个百分点,较年初的 Opus 4.5 提升近 9 倍。

详细发生了什么

据 The Decoder 报道,Anthropic 最新模型 Claude Fable 5 在 FrontierMath 基准测试的最困难级别(Tier 4)上取得了 88% 的准确率。相比之下,OpenAI 的 GPT-5.5 在同一级别约为 75%,而 Anthropic 年初发布的 Opus 4.5 甚至低于 10%。FrontierMath 由 Epoch AI 开发,包含数百道极具挑战性的数学题,涵盖数论、实分析、代数拓扑等领域,旨在测试 AI 的深度推理能力。Claude Fable 5 的进步表明,AI 在数学推理方面的能力正以前所未有的速度提升。

中文圈视角

对中文用户而言,这一消息有几点值得关注:

  1. 可用性与平替:Claude Fable 5 目前通过 Anthropic API 和 claude.ai 提供,国内用户需解决网络访问问题。国产模型如 DeepSeek-Math 和智谱的 GLM-4 在数学推理上也有不错表现,但尚未在 FrontierMath 这类高难度基准上公开评测。
  2. 应用场景:数学推理能力的飞跃对科研、教育、金融等领域意义重大。例如,中文用户可利用 Claude Fable 5 辅助数学研究、生成高难度竞赛题解或验证复杂公式。不过,对于日常数学问题(如中小学数学),现有模型已足够,这一突破更多影响专业领域。
  3. 评测盲点:FrontierMath 题目以英文形式呈现,中文数学社区的评测基准(如 C-Eval 的数学子集)难度较低。中文用户需关注模型在中文数学题上的表现,因为语言和符号习惯可能影响推理效果。

几条值得记住的细节

  • Claude Fable 5 在 FrontierMath 最困难级别(Tier 4)准确率达 88%,GPT-5.5 为 75%,Opus 4.5 低于 10%。
  • FrontierMath 包含数百道专业数学题,由 Epoch AI 设计,难度远超现有基准。
  • 该测试覆盖数论、实分析、代数拓扑等领域,要求模型具备深度推理能力。
  • Claude Fable 5 的进步速度惊人:从 Opus 4.5 到 Fable 5 仅用了约 6 个月。
  • 目前 Claude Fable 5 通过 Anthropic API 和 claude.ai 提供,定价尚未公布。

一句话总结

Claude Fable 5 的数学推理能力大幅领先,但中文用户需关注网络访问和中文场景下的实际表现。