密码学家 Matthew Green 看完 Anthropic 最新的密码分析成果后,写了篇博客。标题很克制:「一些想法」,但内容不克制。

先说 Anthropic 做了什么。他们让未发布的 Claude Mythos 模型去跑密码分析,出了两个结果:一个攻击了后量子签名方案 HAWK,另一个是对缩减轮次 AES 的改进攻击。
HAWK 这个结果,用 Green 的话说,「可能直接杀死了一个正在认真考虑标准化的密码方案。」
而且用的不是什么新武器。Green 反复强调这一点:AI 没有发明新的数学。它做的是把已知工具——那些密码学家早就握在手里的锤子和扳手——组合得比人类更彻底。他引用了 Claude 自己对攻击贡献的评估,并表示这个评估「读起来让人尴尬」。不是对 AI 尴尬,是对这个领域尴尬。
有些人干了一辈子密码分析,没想到灯下黑到这个程度。
HAWK 是一种基于模格同构问题(module-LIP)的后量子签名方案,跟 Falcon 有亲戚关系但依赖的困难问题不同。它的全部存在理由就是比替代方案更高效。Anthropic 的攻击大约减半了安全比特数——理论上可以靠加倍密钥尺寸来补偿,但这样一来 HAWK 就没有存在意义了。攻击代码已经在几小时内跑通了弱化版挑战实例,虽然没直接攻破真实部署参数,但方向很清晰。
AES 那个攻击就平淡多了。7 轮 AES 早就有已知攻击,这次只是在 2013 年工作的基础上做了一个常数因子的改进。需要 2^89 次密码运算和 2^105 次选定明文加密,跟实际威胁差着好几个天文单位。Green 的用词是「我们知识体系中的一个小增量」。
Anthropic 团队的方法论也值得注意:告诉 AI 去找结果,然后让它一直跑,直到找到为止。Green 看了他们公布的 prompt,觉得很说明问题。模型已经能理解现有密码分析文献、合成真正的新攻击路径、在没有详细人类干预的情况下完成扩展——也不需要有人站在旁边告诉它每一步该怎么走。

但 Green 也泼了半盆冷水。
他自己也在用这些高级模型,也收到过「令人惊讶的结果」。问题是:模型产出看起来像结果的东西,不代表它真的是结果。模型在制造「看起来合理但实际有误导性」的输出方面,比制造真正发现要擅长得多。
对于 HAWK 攻击,验证很简单——代码跑几个小时,对就对错就错。对于 AES 那种更微妙的加速攻击,验证就难了。用 Lean 这类系统做形式化证明有帮助,但命题陈述怎么写本身就是一个容易出错的问题。
这引出了全文最有信息量的判断:验证正在取代生成,成为新的瓶颈。谁能分辨真假发现?答案是极少数有足够专业判断力的人类专家,而他们的注意力是稀缺资源。Green 提到,最近几个高调的数学成果——包括陶哲轩博客讨论的那个 Jacobian 猜想反例——都共享同一个模式:要么附有机器可验证的证明,要么是可计算验证的反例,要么需要大量专家审阅。这个模式不是偶然。
Green 给三方受众分别留了话。
对密码学用户:对称密码是故意设计得「脏」和鲁棒的——容易用,难解构。他不认为往里面多灌几万小时的智能就能轻易攻破。即使 AI 能推进,它们同样会帮助设计更强的密码。公钥密码更脆弱——历史上能构造陷门函数的数学结构屈指可数,没有足够多的人类穷尽所有分析方向。但时机恰好:整个领域正在向后量子算法迁移,增强版密码分析能力来得正是时候。
对科学家:这是最好的时代,你有一个能力强大、但还没聪明到能完全取代你的 AI 合作者。
对所有人:如果你觉得这些模型只是「高级自动补全」,别这么想了。但如果你觉得 AGI 已经到了,也打住。Green 给了一个比喻:跟这些工具工作像在一片池塘里跋涉,地面随时可能陡然下沉。你前一秒还在齐腰的水里,后一秒就开始游泳。对有经验的研究者来说,能力和无能之间的那条线很容易找到——但它正在缓慢外移。
Anthropic 的 Mythos 还没有公开发布。这两个结果更像是一次能力展示,告诉我们那条线现在画在哪里。
参考来源: