OpenAI GPT-5.6 Sol Ultra 一小时破解50年未解数学猜想,引发AI创造力争议
OpenAI最新模型GPT-5.6 Sol Ultra在不到一小时内证明了悬而未决50年的Cycle Double Cover猜想。数学家评价证明方法初等但缺乏引用。本文分析事件细节、中文圈可用性及对AI创造力的启示。
一句话看懂
OpenAI GPT-5.6 Sol Ultra 用64个子代理并行工作,不到一小时证明了50年未解的Cycle Double Cover猜想,但数学家批评其缺乏对前人工作的引用。
详细发生了什么
据The Decoder报道,OpenAI的最新模型GPT-5.6 Sol Ultra在不到一小时内成功证明了Cycle Double Cover猜想。该猜想由数学家W. T. Tutte在1970年代提出,核心是:每个无桥连通图都存在一组环(cycle)覆盖每条边恰好两次。50年来无人能解。
GPT-5.6 Sol Ultra采用了64个子代理(subagents)并行工作的架构,每个子代理负责探索证明的不同部分,最终合成完整证明。数学家Thomas Bloom审阅后表示,证明方法“出奇地初等”(surprisingly elementary),但批评模型没有引用已知的相关工作,导致证明在学术严谨性上存在缺陷。
这一成果引发了更深层的讨论:AI是否只是重新组合已有知识,还是真正创造了新东西?
中文圈视角
对中文用户而言,GPT-5.6 Sol Ultra目前可能无法直接使用。OpenAI的顶级模型通常需要订阅Plus或Pro计划(约$20-$200/月),且需海外网络访问。不过,国内已有类似尝试:DeepSeek的DeepSeek-Math模型在数学推理上表现突出,但尚未达到破解50年难题的水平。智谱的GLM-4也具备数学解题能力,但主要针对竞赛题和标准问题。
这一事件对中文圈的具体影响在于:
- 科研辅助:如果AI能解决长期未解猜想,未来数学家可能将其作为“合作者”使用,但需要解决引用和可解释性问题。
- 教育场景:初等证明方法意味着AI可能帮助数学学习者理解复杂概念,但缺乏引用可能误导学生。
- 合规盲点:国内对AI生成内容的学术规范尚不明确,若学生或研究者直接使用AI输出而不加核实,可能引发学术不端。
中文圈目前较少讨论的点是:AI证明的“初等性”是否意味着它只是找到了人类忽略的简单路径,而非真正的突破?这或许比“AI取代数学家”更值得关注。
几条值得记住的细节
- 模型名称:GPT-5.6 Sol Ultra,Sol系列专门用于科学推理。
- 并行架构:64个子代理同时工作,协调完成证明。
- 时间:不到1小时,而人类数学家可能需要数年。
- 批评:Thomas Bloom指出证明缺乏对已知定理的引用,学术上不完整。
- 猜想:Cycle Double Cover Conjecture,图论中关于图覆盖的经典问题。
一句话总结
AI能解50年难题,但“创造”与“重组”的边界仍模糊,对中文用户而言,工具可用但需警惕学术规范。