AI 快讯 编译自 the_decoder #模型能力#研究评测#行业分析

研究反驳Anthropic与OpenAI:自主AI研究能力被高估,论文遭拒

最新研究显示,Claude Opus 4.8和GPT-5.6 Sol在独立撰写AI研究论文时,被原审稿人评为'Reject'。尽管能完成工程流程,但缺乏研究判断与创造力。本文解析研究细节,并探讨对中文圈AI研发的启示。

编译发布 2026/08/14 原文发布 2026/08/14

一句话看懂

一项由普林斯顿大学与英国AI安全研究所合作的研究发现,Claude Opus 4.8和GPT-5.6 Sol在独立撰写AI研究论文时,被原作者评为’Reject’,表明自主AI研究能力被高估。

详细发生了什么

这项研究给AI智能体提供了六天时间、$3,000的API额度以及GPU访问权限,要求它们独立完成AI研究论文的撰写。测试使用了Claude Opus 4.8和GPT-5.6 Sol两个前沿模型,目标是模拟完整的科研流程。

研究结果令人意外:这些模型虽然能够处理研究工程的全过程,包括文献检索、实验设计、代码实现和论文写作,但在研究判断、创造性问题解决以及放弃失败方法的能力上明显不足。原始未发表的NeurIPS论文作者对AI生成的论文进行了评审,一致给出了’Reject’的评价。

这项研究由普林斯顿大学和英国AI安全研究所联合进行,直接反驳了Anthropic和OpenAI关于自主AI研究即将实现的声明。研究表明,当前AI在科研中更适合作为辅助工具,而非独立研究者。

中文圈视角

对中文圈用户而言,这项研究具有重要参考价值。国内AI研发社区,如DeepSeek、Kimi等,也在探索AI辅助科研的边界。虽然这些模型在中文环境下可能表现不同,但核心问题——AI缺乏真正的科研判断力——是共通的。

对于国内科研人员,这意味着AI工具(如ChatGPT、Claude或国产模型)可以用于文献综述、代码调试等辅助工作,但不应期望它们独立完成创新性研究。此外,国内在AI安全研究方面相对滞后,这项研究提醒我们,在追求模型能力提升的同时,也需要关注其局限性和安全风险。

值得注意的是,国内用户使用这些前沿模型可能需要特殊网络环境,但国产模型如DeepSeek-R1在推理任务上已有不俗表现,可作为替代选择。

几条值得记住的细节

  • 研究使用了Claude Opus 4.8和GPT-5.6 Sol,每个模型获得$3,000 API额度和GPU访问权。
  • 任务时间限制为六天,要求独立完成从选题到论文撰写的全过程。
  • 评审者为未发表NeurIPS论文的原始作者,对AI论文给出’Reject’评级。
  • 模型在工程流程上表现良好,但在研究判断和创造性问题上失败。
  • 研究由普林斯顿大学和英国AI安全研究所合作,旨在评估自主AI研究的可行性。

一句话总结

AI能帮你写代码、查文献,但真正的科研创新还得靠人脑。