前OpenAI研究员:单纯扩大规模行不通,训练数据需投入超1000亿美元
前OpenAI研究员Andrew Ho和剑桥学者Adam Hunt指出,大语言模型正变得专业化而非通用化,在编码和数学上表现优异,其他领域却停滞甚至倒退。Ho离职创办专注训练数据的公司,预测AI实验室需在定向数据收集上投入超1000亿美元。本文解读这一趋势对中文AI圈的影响。
一句话看懂
前OpenAI研究员Andrew Ho认为,单纯扩大模型规模已无法提升通用能力,未来AI实验室需在高质量训练数据上投入超1000亿美元。
详细发生了什么
前OpenAI员工Andrew Ho与剑桥研究员Adam Hunt共同观察到,当前大语言模型的发展正偏离通用智能目标。模型在编码和数学等特定领域表现越来越强,但在其他能力上停滞甚至倒退。Ho认为,仅靠扩大模型规模(scaling)已无法解决这一失衡问题。
为此,Ho决定离开OpenAI,创办一家专注于高质量、专业化训练数据的公司。他预测,未来AI实验室将需要在定向数据收集上投入超过1000亿美元,以弥补通用能力的短板。Hunt的研究也支持这一观点:模型训练需要更精细的数据策略,而非单纯增加数据量。
中文圈视角
这一观点对中文AI圈有直接启示。目前国内大模型如DeepSeek、Kimi、智谱GLM等也在追求更大参数规模,但同样面临“偏科”问题:在中文数学、代码benchmark上分数很高,但在开放域对话、常识推理、多语言理解上表现参差不齐。
Ho的预测意味着,单纯堆算力、堆参数的路可能走到尽头。对国内AI公司而言,与其盲目追求千亿参数,不如在高质量中文训练数据上深耕——例如专业领域语料(医疗、法律、教育)、低资源方言数据、以及针对中文用户场景的精细化标注。
此外,数据获取的合规性也是中文圈独特挑战。国内对数据隐私、内容安全有严格监管,海外数据采集模式不能直接复制。因此,中文AI公司需要探索符合本地法规的数据策略,比如与机构合作、使用合成数据等。
几条值得记住的细节
- Andrew Ho是前OpenAI研究员,已离职创办训练数据公司。
- 他预测AI实验室在定向数据收集上的投入将超过1000亿美元。
- 剑桥研究员Adam Hunt指出模型在编码和数学上进步,其他领域停滞。
- 问题根源在于“规模扩大”策略无法提升通用智能。
- 新公司专注提供高质量、专业化的训练数据,而非通用数据。
一句话总结
大模型“偏科”问题凸显,未来AI竞争将从拼算力转向拼数据质量,中文AI公司需提前布局。