AI 快讯 编译自 the_decoder #行业分析#数据合规#模型训练

微软MAI模型被曝使用未授权网络数据训练,与承诺的“商业许可数据”相悖

微软声称其MAI模型仅使用“清洁商业许可数据”训练,但调查发现实际使用了Common Crawl等未授权网络数据。本文揭露微软与其他AI公司一样依赖合理使用原则,将屏蔽责任推给网站所有者,并分析对中文圈用户的影响。

编译发布 2026/06/05 原文发布 2026/06/05

一句话看懂

微软MAI模型被曝使用未授权的Common Crawl网络数据训练,与其宣传的“企业级清洁商业许可数据”承诺矛盾。

详细发生了什么

微软一直标榜其大型语言模型训练方式与众不同,声称MAI系列模型仅使用“清洁且商业许可的数据”。然而,调查发现微软实际上使用了Common Crawl等未授权网络数据来训练MAI模型。与其他AI实验室一样,微软依赖“合理使用”原则,并将阻止其爬虫的责任推给网站所有者。这意味着,尽管微软在营销中强调数据合规性,其实际做法与OpenAI、Google等公司并无本质区别。

中文圈视角

对中文用户而言,这一事件有几点值得关注:

  1. 国产模型的合规优势:国内AI公司如DeepSeek、Kimi等,在训练数据上受到更严格的监管,通常需要明确数据来源授权。微软的“双标”行为反而凸显了国产模型在数据合规上的潜在优势。

  2. 对开发者的影响:如果微软MAI模型确实使用了未授权数据,那么基于MAI构建的应用可能面临版权风险。中文开发者若计划使用MAI模型,需警惕数据溯源问题,尤其是涉及商业场景时。

  3. 监管启示:中国已出台《生成式人工智能服务管理暂行办法》,要求训练数据来源合法。微软事件表明,即使国际巨头也难以完全遵守承诺,这或促使国内监管进一步细化数据使用规范。

  4. 盲点:中文圈较少讨论的是,Common Crawl中中文内容占比不足5%,但微软爬虫可能抓取了大量中文网站。网站所有者需主动检查robots.txt并屏蔽微软爬虫,否则其内容可能被用于训练MAI模型。

几条值得记住的细节

  • 微软MAI模型使用了Common Crawl数据集,该数据集包含大量未经授权的网页内容。
  • 微软声称其训练数据“清洁且商业许可”,但实际做法与其他AI公司一致。
  • 微软依赖“合理使用”原则,将屏蔽责任推给网站所有者,而非主动获取授权。
  • 这一发现来自对微软公开技术文档和第三方调查的分析。
  • 微软尚未对此事发表正式回应。

一句话总结

微软MAI模型的数据合规承诺被证伪,中文用户需警惕其版权风险,国产模型或成更安全选择。