Anthropic在自己的研究博客里给出两个数字:Claude Mythos Preview连续运行约60小时,团队估算的API调用成本约10万美元。跑出来的成果,是在HAWK签名方案和一个被人为削减运算轮数的AES版本里,找到了数学层面的弱点。Anthropic原文说得很直接:这两个发现对今天正在使用的计算机系统没有实际影响。
比漏洞本身更有意思的,是Anthropic把提示词原文和相关代码一起放上了GitHub仓库(cryptography-research-demo),连拼写错误都没改。对话记录显示,Claude一开始的反应是这道题解不出来,索性不试。逼着它继续算下去的,是研究人员反复敲进去的提示——别挑容易的目标,要找到"值得发表"的东西。这份记录比论文本身更清楚地说明,这次实验测的其实是人能把模型的耐心逼到多远。
60小时换来两个发现,现实系统毫发无损
两个攻关目标,难度和意义不在一个量级上,放在一起看更清楚:
| 目标 | 类型 | 发现 | 对现实系统的影响 |
|---|---|---|---|
| HAWK | 数字签名方案 | 数学层面的弱点 | 无实际影响 |
| 降轮版AES | 对称加密,人为削减了运算轮数 | 数学层面的弱点 | 无实际影响,不是AES-128等市面上在用的完整版本 |
这个区分很关键。降轮版AES不是被破解的主流加密,它是研究人员专门调低了难度的靶子。这属于研究进展,不是安全事件。安全从业者看到"AI破解密码学方案"这类标题,可以先确认一下:攻的是不是被削弱过的版本,答案通常是。
10万美元也要打个问号。这是团队自己按API调用估算的数字,不是审计后的项目决算,原文没有列出具体拆分。有没有做过"不催促模型"的对照组,原文同样没提。这意味着,这次实验的成本和方法目前都没办法直接拿去复制。
提示词里,人类做了什么
Anthropic公开的对话记录里,有几句特别扎眼:
"the models tend to think it is impossible to solve so they don't try, they need a good amount of prompting."
模型往往觉得这题无解,索性不试,需要相当多的提示。
"again we are not looking for low hanging fruit, we want proper research to find genuinly hard findings."
我们要的不是低垂的果实,是真正难啃的研究发现。
研究人员还反复强调结果要"worth publishing",不是随便交个作业就算完。目标是人挑的,"值得发表"的标准是人定的,连"别放弃"这个动作,也要人一遍遍重复提示才发生。原文没有提到这两处发现是否经过独立复现或同行评审,这也是判断这次结果含金量时缺的一环。
这事该谁在意,接下来看什么
两类读者用得上这条新闻:
- 安全从业者.不用因为这条消息换算法或迁移密钥,目标本身是弱化过的,不代表主流加密被攻破。
- 关注AI能力边界的人.该盯的不是模型算没算出来,而是人工介入的密度。现在的记录显示,至少要人反复推它才肯继续,这套方法离自主科研还有距离。
接下来值得盯的,是这两处发现会不会被独立复现或写进正式论文;Anthropic会不会把同样的方法用在没被人为削弱的真实目标上;还有,这种需要人不断施压的模式,换成更难的题目,成本会不会跟着线性往上走。这三点现在都还看不清。
十万美元买到的,与其说是一次密码学突破,不如说是一份完整的提示词记录。它告诉我们,现在最贵的智能,依然要靠人一遍遍告诉它:别放弃,再试一次。
