Anthropic 用 Claude Mythos 发现密码学缺陷:60 小时、10 万美元 API 费,人类只负责喊加油
Anthropic 研究人员使用 Claude Mythos 在 HAWK 和简化版 AES 中发现了数学漏洞,虽无实际影响,但展示了 AI 辅助密码学研究的潜力。文章公开了研究过程中的提示词,包括拼写错误,揭示了如何通过反复鼓励让模型坚持寻找“值得发表”的发现。
一句话看懂
Anthropic 用 Claude Mythos 在 60 小时内、花费约 10 万美元 API 费,发现了 HAWK 和简化版 AES 的数学弱点,人类主要工作是不断鼓励模型“别放弃”。
详细发生了什么
Anthropic 研究人员发布了一篇博客,详细记录了如何使用 Claude Mythos 来寻找密码学算法的数学缺陷。他们针对 HAWK(一种后量子签名方案)和 AES 的一个简化版本(AES-128 r7)进行了攻击尝试,并成功发现了理论上的弱点。不过,研究团队明确表示:“这些结果对当今计算机系统没有实际影响。”
最引人注目的不是结果本身,而是研究过程中使用的提示词。这些提示词包含拼写错误和口语化表达,例如:“the models tend to think it is impossible to solve so they don’t try they need a good amount of prompting.”(模型倾向于认为问题无法解决,所以它们不尝试,需要大量提示。)
另一个提示词写道:“no again the goal is that we have highly inteligent model as good top researcher, we want to find new attacks”(不,再说一次,目标是让高度智能的模型像顶级研究员一样,我们要找到新的攻击方法)。研究人员还强调:“again we are not looking for low hanging fruit, we want proper research to find genuinly hard findings.”(我们不是在找容易的成果,我们要做真正的研究,找到真正困难的发现。)
整个实验持续了 60 小时,估计 API 成本约 10 万美元。人类的主要干预就是不断鼓励模型不要放弃,并引导它寻找“值得发表”的发现。相关代码和提示词已开源在 GitHub。
中文圈视角
这件事对中文 AI 社区有几点启发:
-
提示词工程的新高度:这些提示词展示了如何通过“心理按摩”让模型坚持复杂任务。中文用户在做类似研究时,可以借鉴这种“鼓励式”提示策略,而不是简单给出指令。
-
成本门槛:10 万美元的 API 费用对个人或小团队来说不低,但国内类似服务(如 DeepSeek、Kimi)的 API 价格更低,或许可以更低成本复现类似实验。不过,国内模型在数学推理和密码学领域的表现如何,尚需验证。
-
国产替代的可能性:目前国内没有直接对标 Claude Mythos 的模型,但智谱 GLM、DeepSeek 等也在强化推理能力。如果国内厂商能开放类似的长时运行、高 token 消耗的 API 服务,中文研究者也能开展类似探索。
-
合规与安全:密码学研究成果可能涉及敏感领域,国内研究者需注意相关法规,避免触碰红线。
几条值得记住的细节
- 实验总时长 60 小时,API 成本约 10 万美元。
- 发现的漏洞针对 HAWK 和 AES-128 r7(简化版 AES),无实际影响。
- 研究人员公开了提示词,包含拼写错误和口语化表达。
- 人类的主要干预是鼓励模型“不要放弃”和“找值得发表的东西”。
- 代码和提示词已开源在 GitHub(anthropics/cryptography-research-demo)。
一句话总结
AI 不仅能写诗画画,还能在密码学前沿研究中当“研究员”,只要人类舍得花 10 万美元 API 费并不断给它打气。