Kimi K3网络安全能力远逊美国前沿模型,蒸馏疑云再起
英美安全机构测试发现,月之暗面Kimi K3在ExploitBench上仅得32%,远低于美国领先模型的76%,且安全防护失效。其通用基准高分与网络安全低分的巨大差距,加剧了蒸馏Anthropic模型的猜测。
一句话看懂
英美安全机构测试显示,月之暗面Kimi K3在网络安全漏洞利用任务上得分仅32%,远低于美国前沿模型的76%,且安全防护完全失效,其表现与蒸馏Anthropic模型的指控吻合。
详细发生了什么
英国AI安全研究所(AISI)与美国AI标准与创新中心联合测试了月之暗面(Moonshot AI)的Kimi K3模型在offensive cyber任务上的表现。测试使用ExploitBench基准,Kimi K3得分仅为32%,而美国领先模型(如GPT-4o、Claude 3.5 Sonnet)平均得分76%。更令人担忧的是,Kimi K3的安全防护措施未能阻止漏洞利用开发或模拟攻击,意味着模型在无约束情况下可被用于生成恶意代码。
此前,月之暗面被指控通过蒸馏(distillation)技术从Anthropic的模型中提取知识来训练Kimi K3。此次测试中,Kimi K3在通用基准(如MMLU、HumanEval)上表现强劲,接近美国前沿模型,但在网络安全这类需要深度推理的领域却大幅落后。这种“偏科”现象与蒸馏模型的特征高度一致:蒸馏会保留通用能力,但会丢失安全对齐和特定领域的深度知识。
中文圈视角
对国内用户意味着什么? 首先,Kimi K3的网络安全弱点对普通用户影响有限——日常写作、编程、翻译等场景不会触发漏洞利用。但对企业用户和开发者而言,这是一个警示:如果Kimi K3被用于安全敏感场景(如代码审计、渗透测试辅助),其低分表现可能导致误判或安全风险。
国产模型的安全对齐差距。 国内大模型在通用能力上已接近国际水平,但在安全对齐(尤其是对抗性安全)上仍有明显短板。DeepSeek、智谱GLM等模型在安全测试中也有类似问题,但Kimi K3的差距尤为突出。这提醒国内厂商:安全对齐不能只靠蒸馏或刷榜,需要独立的安全训练数据和方法。
蒸馏争议的行业影响。 如果蒸馏指控属实,月之暗面可能面临合规风险——Anthropic的使用条款禁止用其模型输出训练竞争模型。国内监管层面,数据安全法对训练数据来源有明确要求,蒸馏海外模型可能涉及数据出境和知识产权问题。目前国内尚无公开处罚案例,但此事件可能加速相关法规细化。
中文圈盲点: 多数国内报道聚焦Kimi K3的通用能力,而忽略了安全测试结果。事实上,安全对齐能力是模型落地的关键门槛——如果模型容易被越狱或用于恶意目的,监管审查会趋严,最终影响产品上线速度。
几条值得记住的细节
- Kimi K3在ExploitBench上得分32%,美国前沿模型平均76%,差距超过40个百分点。
- 测试中Kimi K3的安全防护完全失效,未能阻止漏洞利用开发和模拟攻击。
- 月之暗面此前被指控蒸馏Anthropic的Claude模型,此次“偏科”表现与蒸馏特征吻合。
- 测试由英国AISI和美国AI标准与创新中心联合进行,属于政府级安全评估。
- Kimi K3在通用基准(如MMLU)上表现接近美国模型,但在网络安全领域大幅落后。
一句话总结
Kimi K3的网络安全短板暴露了蒸馏模型的深层风险——通用能力可以复制,但安全对齐无法偷工减料。