微软CEO纳德拉炮轰OpenAI和Anthropic:禁止蒸馏却用他人数据训练,呼吁企业掌控AI学习基础设施
微软CEO萨提亚·纳德拉公开批评OpenAI和Anthropic存在“反向信息悖论”:它们以合理使用为由训练公开数据,却禁止他人蒸馏自家模型,同时从用户交互中学习。纳德拉呼吁企业掌控自己的学习基础设施,而微软恰好提供相关解决方案。本文分析这一争议对中文AI生态的启示。
一句话看懂
微软CEO纳德拉指责OpenAI和Anthropic搞“双重标准”:一边用公开数据训练模型,一边禁止别人蒸馏它们的模型,还从用户交互中学习。
详细发生了什么
微软CEO萨提亚·纳德拉公开批评OpenAI和Anthropic,称它们存在“反向信息悖论”。他指出,这些AI实验室在合理使用原则下大规模抓取公开数据训练模型,却通过服务条款禁止用户或竞争对手对其模型进行蒸馏(distillation)。更讽刺的是,它们还利用用户与产品的交互数据(如对话记录)来改进模型。纳德拉认为,企业应该掌控自己的学习基础设施,而不是依赖这些封闭的AI平台。当然,微软恰好销售Azure AI等基础设施服务,这波批评也被视为商业策略的一部分。
中文圈视角
这场争论对中文AI圈有直接启示。首先,国内大模型厂商如百度文心、阿里通义千问、字节豆包等,同样面临数据获取与模型保护的矛盾。它们大量使用中文互联网数据训练,但也在服务条款中限制模型蒸馏。纳德拉的批评点醒我们:如果国内厂商也采取类似“只进不出”策略,可能引发开发者社区反弹。其次,微软的“企业掌控基础设施”方案,对应到国内就是阿里云、华为云、腾讯云等提供的模型训练和部署服务。对于中文企业用户,选择自建还是使用闭源API,需要权衡数据主权、成本和技术控制力。最后,监管层面,中国《生成式人工智能服务管理暂行办法》要求训练数据合法合规,但模型蒸馏的边界尚未明确,未来可能成为合规焦点。
几条值得记住的细节
- 纳德拉称OpenAI和Anthropic的行为是“反向信息悖论”:训练用公开数据,但禁止蒸馏。
- 这些AI实验室还利用用户交互数据(如对话)改进模型,但用户往往不知情。
- 纳德拉呼吁企业“掌控自己的学习基础设施”,微软Azure AI正是其解决方案。
- 蒸馏技术常用于将大模型能力压缩到小模型,降低成本,但被禁止后开发者只能依赖API。
- 这场争论本质是AI行业数据使用规则和模型保护之间的博弈。
一句话总结
AI巨头“只进不出”的数据策略引发争议,中文开发者需警惕类似条款对创新和自主性的限制。