AI 快讯 编译自 interconnects #AI写作#模型能力#行业分析

AI 写作能力停滞:我写了一本 AI 教科书,AI 何时能做得更好?

AI 在长文非虚构写作上进步缓慢,作者 Nathan Lambert 结合写书经历,分析模型在组织知识、连贯表达上的短板,并探讨对科学研究和中文用户的实际影响。

编译发布 2026/08/12 原文发布 2026/08/12

一句话看懂

AI 在长文非虚构写作上进步停滞,作者结合写书经历,指出模型缺乏组织知识的能力,并质疑其自主解决科学问题的前景。

详细发生了什么

AI 写作的批评大多集中在创意写作,但作者认为,非虚构写作才是 LLM 真正有用的领域。然而,经过几年使用,他发现模型在长文写作上进步有限,甚至停滞。他以自己撰写 RLHF 教科书为例,指出模型能改错别字、处理 LaTeX,但无法组织整章内容,常出现逻辑混乱和概念错误。

作者对比了 GPT 和 Claude 的表现:GPT 擅长找错别字,Claude 更有编辑品味。但他强调,模型在单元级任务上出色,却难以将多个部分连贯起来,错误会累积。他认为,写作能力与编码、数学等领域的飞速进步形成鲜明对比,且缺乏专门的训练数据来改进。

作者还提到,尽管 Anthropic 在黎曼猜想上取得进展,但科学问题范围广泛,模型的知识覆盖有限。他担忧,若模型连成熟科学都无法清晰呈现,遑论自主解决开放问题。

中文圈视角

对中文用户而言,这一观察同样适用。国内模型如 Kimi K2 在长文写作上表现不错,但同样存在组织能力不足的问题。中文写作的语境更复杂,模型常出现“AI 味”重、逻辑跳跃的毛病。

对于依赖 AI 辅助写作的中文用户,建议将模型定位为“编辑器”而非“作者”:让它改错别字、提供建议,但最终内容需人工把关。国产模型如 DeepSeek、Kimi 在短文本生成上可用,但长文仍需人工重写。

此外,中文圈对 AI 写作的讨论多聚焦于“替代人类”,但作者的观点提醒我们:AI 在创造性写作上或许能模仿,但在需要深度思考和知识组织的非虚构写作上,仍有明显短板。这或许能缓解部分人的焦虑,也提示我们应更理性看待 AI 的能力边界。

几条值得记住的细节

  • 作者认为,模型在长文非虚构写作上停滞,而编码和数学已超人类。
  • GPT 5.5 Pro 能发现 200-300 页手稿中的深层错别字。
  • Claude 作为编辑更有品味,能提供有趣建议。
  • 作者书中不到 1% 的句子来自 AI,但都是他认可的。
  • 模型在单元级任务上出色,但难以串联多个部分,错误会累积。

一句话总结

AI 写作辅助有用,但长文仍需人类主导,别指望它独立完成深度内容。