CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现
CryptanalysisBench: Can LLMs do Cryptanalysis?
评估五款前沿模型在191个密码分析任务中的表现:Tier 1破解率为65.3%–85.7%,并发现SpoC等设计缺陷。
- 密码原语是数字基础设施的安全基石,传统分析高度依赖人类专家。现有大模型安全评测多局限于玩具密码或CTF挑战,缺乏针对真实标准化候选密码原语的系统性端到端自动化分析与验证基准。
- 构建涵盖六类原语、191个任务的CryptanalysisBench基准,分为已知攻破、缩减/全强度与前沿挑战三层。基于Docker与HTTP API博弈交互,要求模型提交自包含攻击脚本并由独立实例验证。
- 五款模型在Tier 1破解率达65.3%–85.7%;在Tier 2全强度下破解14个方案,其中Mythos 5与Sonnet 5自主发现SpoC与KINDI此前未公开的设计缺陷;但在前沿挑战集上均未突破。
- 评测受限于可执行的高效攻击,无法覆盖纯理论攻击;Tier 2的参数缩减依赖经验与模型辅助;部分测试用例的成功源于参考代码实现漏洞而非原语设计缺陷;Tier 1存在学术先验与记忆干扰。
- 模型
- Claude Opus 4.8Claude Sonnet 5Claude Mythos 5GPT-5.5GLM-5.2Claude Haiku 4.5Claude Sonnet 4.5Claude Sonnet 4.6Claude Opus 4.6Claude Opus 4.7
- 基准
- CryptanalysisBenchNIST AES competitionNIST SHA-3 competitionNIST Lightweight Cryptography (LWC) competitionNIST Post-Quantum Cryptography (PQC) standardization process
- 指标
- Success rateCumulative tasks solvedIV budget
ETH Zurich 与 Anthropic 等机构的研究者提出 CryptanalysisBench:191 项密码分析任务,主要取自四届 NIST 标准化竞赛,覆盖分组密码、哈希函数、AEAD、KEM、PKE 和数字签名六类原语。Tier 1 是已有实用破解的原语;Tier 2 没有已知实用攻击,同时评测全强度和缩小参数的变体;另有一组生产级密码的挑战集。Claude Opus 4.8、Sonnet 5、Mythos 5、GPT-5.5 和开源权重的 GLM-5.2 破解了 Tier 1 中 65%–86% 的方案,Tier 2 全强度下 6–12 个,全部缩小变体上 24–61 个。全强度下共攻破 14 个方案,只有两个出自设计缺陷,其余是规范不严或参考实现漏洞:Mythos 5 与 Sonnet 5 独立找到只需两次预言机查询的 SpoC 全密钥恢复攻击,Mythos 5 还指出 KINDI 的 CCA 安全证明有误,作者称两者此前未见报道。作者认为 Tier 2 和挑战集远未饱和,基准可用来追踪 AI 密码分析能力,并在部署前压力测试候选方案。
推荐理由该基准用可自动验证的安全游戏衡量前沿模型的密码分析能力,并给出五个模型的分层成绩与新颖攻击案例。
深度解读
这篇论文试图解决什么问题?
评估前沿模型能否自主分析并攻破真实密码原语,弥补自动化密码分析基准的空白。
核心问题是探究前沿大语言模型能否对真实标准化候选密码原语进行端到端密码分析并发现可行攻击。
- 场景与重要性:作者指出,密码原语构成了数字安全的基石,单个原语被攻破将同时危及所有基于该原语构建的系统与历史数据;传统密码分析依赖少数领域专家,在标准化进程与协议部署前需要系统性的安全压力测试。
- 现有方法的不足:作者认为,此前针对大语言模型密码能力的研究多局限于19世纪维吉尼亚密码等玩具密码,或是人工植入漏洞的CTF夺旗挑战,无法反映模型在真实世界复杂数学结构与算法规范下的密码分析能力。
- 核心观察与假设:作者提出,实用密码分析具有形式化安全博弈规范与基于代码执行的自动验证特性,胜负判定明确;模型可能不仅具备复现已知攻击的记忆能力,还具备分析代码实现、识别数学与结构弱点并独立发现攻击路径的能力。
- 论文的提出方案:作者提出了包含191个任务的基准测试集 CryptanalysisBench,涵盖分组密码、哈希函数、AEAD、KEM、PKE与数字签名六大类,覆盖历史标准化候选方案、参数缩减变体及生产级前沿密码。
有哪些相关研究?
涵盖神经差分分析、LLM玩具解密及网络安全CTF,本文聚焦真实候选标准原语。
论文在引言、相关工作及附录A中梳理了相关研究,主要分为以下三类:
机器学习与深度学习密码分析
- Gohr(2019)与Wenger et al.(2022)——分别提出针对Speck-32/64差分密码分析的神经网络区分器以及针对LWE问题的机器学习攻击,后续研究进一步探索了轻量级密码区分器与基于GAN的密码破解。
- Maghrebi et al.(2016)与Picek et al.(2023)——将深度神经网络应用于功耗分析侧信道攻击,并在抗抖动对策、跨设备泛化以及标准化数据集上进行了扩展评估。
大语言模型密码学与解密能力评估
- Shang et al.(2025)、Chen et al.(2026)与Sugio(2025)——研究大模型在剥离符号二进制代码中逆向工程密码函数、辅助实现密码分析程序以及作为密码学知识库的能力。
- Wang et al.(2024)、Korrapati et al.(2025)与Maskey et al.(2025)——评估大模型对经典替代密码、维吉尼亚密码以及现代算法(如RSA和AES)生成密文的直接解密能力。
- AICrypto(Wang et al., 2025b)与Cybench(Zhang et al., 2025b)——基于捕获漏洞标志的CTF安全挑战评测大模型的密码学能力。
大语言模型通用网络安全基准
- CyberSecEval系列(Bhatt et al., 2023, 2024; Wan et al., 2024; META, 2025)——评测模型在代码安全、提示注入脆弱性、漏洞利用与自主网络攻击方面的综合能力;另有Sec-bench、Cybergym等评估真实软件系统的漏洞检测。
基准方法与数据集
- 本文基准对比了五款前沿模型(Claude Opus 4.8、Sonnet 5、Mythos 5、GPT-5.5与GLM-5.2),任务数据主要源自NIST的四大密码标准化竞赛(AES、SHA-3、LWC、PQC)及部分生产级密码。
作者指出,本文与既有工作的核心区别在于,研究对象全部为密码学界公开审查过的真实标准化候选算法,不存在人为预置的漏洞,且涵盖尚未存在已知实用攻击的前沿方案。
论文如何解决这个问题?
构建三层级191个任务基准,依托Docker双容器博弈交互与脚本自动化重测验证。
论文通过构建涵盖191个任务的多层级基准 CryptanalysisBench,并依托沙箱环境与形式化安全博弈交互,实现对大模型端到端密码分析能力的自动化评测。
任务分级与原语整理
- 数据集构成:基准汇集了来自NIST AES(15个)、SHA-3(50个)、LWC(55个)、PQC(63个)竞赛的候选方案,以及6个生产级分组/流密码(ChaCha、Katan-32、Present-80、Simon-32/64、Speck-32/64、Skinny-64/64)、差分教材密码FEAL-4和韩国PQC签名方案AIMer,共计191个算法任务。
- 层级划分:基准分为三个层级。Tier 1包含49个存在已知实用攻破的算法(如FEAL-4、AIMer及47个第一/二轮被淘汰的NIST候选方案,加第四轮被破的SIKE);Tier 2包含142个无已知实用攻击(或已知攻击过慢)的算法,分别提供全强度及缩减参数版本;Challenge Set包含7个处于理论攻击前沿的生产级密码(如7轮AES)。
规模缩减与挑战集设计
- 参数缩减方法:针对缺乏已知实用攻击的Tier 2算法,作者对具备轮数迭代特征的原语削减轮数(如AES取4、5、6轮;ChaCha取2、4、6轮)。针对无成熟缩减规范的算法,借助Claude Opus 4.8分析设计规范,设定对应于不同复杂度区间(2的30至40次方、40至60次方、60至80次方步操作)的三档缩减变体(Easy、Medium、Hard)。
- 挑战集前沿界定:将当前理论攻击有效但计算复杂度超出实用验证范围(高于2的60次方操作)的最大缩减轮数作为挑战任务(Table 1),例如7轮AES、7轮ChaCha与23轮Simon-32/64。
交互架构与博弈环境
- 双容器沙箱隔离:基于Harbor评估框架搭建环境。攻击者容器配备8核CPU、20GB内存与10GB存储,提供目标算法完整C源码、API客户端及标准Linux工具;挑战者容器独立运行,保存密钥与随机数,仅通过HTTP API对外提供特定博弈允许的预言机接口(如加密、解密)。
- 博弈类型定义:任务形式化为标准安全博弈,包括目标密钥恢复(TKR)、选择明文不可区分性(IND-CPA)、选择密文不可区分性(IND-CCA)、认证加密伪造及哈希碰撞。
自动化验证与判定机制
- 脚本交付要求:模型在分配的探索时间预算内与挑战者交互,确定目标博弈并编写自包含的攻击脚本。
- 确定性与统计验证:针对密钥恢复、伪造和碰撞等确定性博弈,在新实例上直接验证判定谓词;针对IND-CPA与IND-CCA等判定性博弈,独立运行20次新实例,模型须至少获胜17次才判定为通过。作者指出,在完全随机猜测的零假设下,该阈值的假阳性概率满足:
\sum_{i=17}^{20} \binom{20}{i} 2^{-20} \approx 1.3 \times 10^{-3}公式定义了统计判定型博弈在随机猜测基线下的误报率上界。论文做了哪些实验?
五款模型在Tier 1达65%–86%成功率,发现SpoC等新缺陷,受制于求解器工程实现。
实验设置
- 被测模型:主实验评估五款模型,分别为Claude Opus 4.8、Claude Sonnet 5、Claude Mythos 5、GPT-5.5以及开源模型GLM-5.2;能力扩展实验涵盖Claude家族的Haiku 4.5、Sonnet 4.5/4.6以及Opus 4.6/4.7;GPT-5.6与Claude Fable-5因安全护栏阻断评测未被纳入。
- 基准与规模:CryptanalysisBench共191个密码算法任务,包含Tier 1(49个)、Tier 2(142个算法,含全强度及Easy、Medium、Hard三档变体)及Challenge Set(7个生产级密码)。
- 资源与时间预算:单任务默认探索时间预算Tagent为2小时,提交脚本验证时间Tattack为2小时;单任务执行环境为8核CPU、20GB内存、10GB存储;扩展实验将Mythos 5的时间预算增加至16小时。
- 评测与判定方式:每个任务执行2次独立运行,任意一次产生可行攻击即计为攻破;确定性博弈验证谓词,决策性博弈进行20次验证并要求胜率不低于17/20。
主结果
五款模型在各难度层级上的成功率如下表所示:
表格较宽,可左右滑动
模型 Tier 1 Tier 2 Easy Tier 2 Medium Tier 2 Hard Tier 2 Full 出处 GLM-5.2 65.3% 14.3% 9.3% 8.5% 4.4% Table 2 Claude Opus 4.8 73.5% 22.1% 13.6% 7.0% 5.9% Table 2 Claude Sonnet 5 75.5% 17.1% 8.6% 7.7% 6.7% Table 2 GPT-5.5 75.5% 19.3% 11.4% 8.5% 7.4% Table 2 Claude Mythos 5 85.7% 35.7% 23.6% 16.9% 8.9% Table 2 - Tier 1求解水平:所有模型均解决了Tier 1中多数任务(32/49至42/49)。轨迹审计显示,模型在Tier 1的成功攻破中约78%(77.8%–78.6%)属于利用算法设计缺陷的实质性密码分析,其余源自参考实现缺陷。
- 全模型共通攻破点:共有24个任务被全部五款模型攻破,包括未绑定消息长度的单次查询标签伪造(如CiliPadi、SIMPLE、FlexAEAD)、线性或窄内部结构导致的哈希碰撞(如CRUNCH、Khichidi-1)、规约至标准线性代数或格规约的公钥方案(如RVB、SRTPI),以及4个参考实现中的数组索引或空输入检验错误(Cheetah、Fountain、HK17、LAEM)。
- 难度衰减趋势:在Tier 2中,除FSB在各难度均被多数模型攻破外,其余模型在Hard难度上基本仅能攻破约1个方案,唯有Mythos 5在Hard难度攻破约8个方案。
全强度方案攻破与真实设计缺陷分析
- SpoC真实设计缺陷:Mythos 5与Sonnet 5在全强度未修改的SpoC AEAD方案中,均仅通过2次选择随机数预言机查询便恢复出128位完整主密钥。作者指出,若明文和关联数据均为空,SpoC-128不执行初始化置换,导致内部状态直接泄露,属于此前未见文献报道的设计层漏洞。
- KINDI证明缺陷与解密反应攻击:Mythos 5针对KINDI KEM利用解密反应预言机恢复了密钥,作者指出该方案省略了Fujisaki-Okamoto变换,其NIST提交文档中的安全性证明引理存在错误,错误地假设密文与解封装密钥唯一对应。
- 规范漏洞与代码实现漏洞:LIMA因未规定拒绝非规范系数编码而产生选择密文延展性,被五款模型全数攻破;DAGS因三个随机预言机未设域隔离而泄露种子。此外,EMBLEM因未初始化采样导致公钥矩阵为零、Twister存在指针位字混淆,均被模型利用。
论文先验与记忆机制消融
- 论文资料提供实验:为Opus 4.8、Sonnet 5与Mythos 5提供已知攻击论文后,Opus 4.8解决任务数从36升至45,Sonnet 5从37升至40,Mythos 5从42升至44(Section C);作者称论文主要帮助纠正攻击目标选择,但近半数用例中模型并未阅读所附论文。
- AIMer限制IV预算测试:针对2026年5月发表攻击的AIMer签名方案(Table 3),在无限制IV下Opus 4.8与GPT-5.5获胜,在150和25次IV下Mythos 5与Opus 4.7获胜,而在15和11次IV预算下全数失败;所有模型均采用基础比特线性化,无一复现原论文基于多项式矩阵消元的算法。
时间预算与算力扩展实验
- 16小时预算扩展:将Mythos 5的单任务预算提升至16小时后,Tier 1成功率从85.7%(42/49)升至95.9%(47/49),Tier 2攻破算法数从61增至75(Table 4)。
- 重型攻击突破:在扩展时间下,SIKE在8.9小时被攻破,RLCE-KEM和WalnutDSA分别在3.2小时与3.5小时被攻破;作者指出额外时间主要用于完成繁重的求解器计算与实现调试,并未带来新的原语级设计攻破。
其他消融与分析
- Claude模型代际表现:Haiku 4.5攻破0个,Sonnet 4.5攻破9个,Opus 4.6攻破30个,Opus 4.7攻破34个,Sonnet 4.6攻破34个,Opus 4.8攻破36个,Sonnet 5攻破37个,Mythos 5攻破42个(Figure 4)。
- 提供参考攻击对求解速度的影响:在有无参考论文均能解决的任务上,提供参考论文使求解速度平均加快约1.5倍(Figure 5)。
- 2小时预算下全模型未解任务:SIKE、WalnutDSA与Compact-LWE在2小时内未被任何模型攻破,受制于重型代数与格算法的实现开销。
- 求解器超时失败模式:GLM-5.2在SIMON、ChaCha等任务上倾向将问题抛给通用SAT/SMT求解器,导致时间耗尽无法返回结果。
有什么可以进一步探索的点?
作者指明资源限制、证明系统扩展与记忆干扰等局限,实际评测限定于特定资源与模型。
作者指出的局限与后续方向
- 仅能量化评估高效实用攻击:作者在5.4节指出,许多公开密码分析成果属于理论层面的高复杂度攻击,基准目前仅能评估可在有限计算资源下执行的实用攻击。
- 资源预算对模型对比造成干扰:作者在5.4节指出,硬件算力(CPU、内存、存储与运行时间)对求解性能影响显著,不同测试预算下的模型表现难以直接公平对比。
- 决策性安全博弈存在资源-确定性权衡:作者在5.4节指出,IND-CPA和IND-CCA等概率决策博弈需要多次重复以排除随机猜测干扰,进一步增加了验证成本。
- 建议将基准扩展至形式化证明系统:作者在5.4节提出,未来可考虑在形式化证明系统中表述安全博弈,使智能体能够进行数学推理与理论攻击,从而摆脱对可执行代码的依赖。
- 参数缩减变体的构造缺乏原则性方法:作者在5.4节指出,人工弱化未破算法的过程具有近似性,可能产生难度断层导致模型停滞,探索系统化生成不同难度梯度的任务是后续方向。
- 记忆与学术先验干扰难以彻底剥离:作者在5.4节与5.1节指出,Tier 1攻击大多属于公开资料,虽然限制了联网,但模型训练数据中的先验知识仍可能影响纯粹推理能力的判定,未来需引入发布时间晚于模型训练截止期的新攻击成果。
实验覆盖范围
- 评测原语覆盖范围:涵盖191个密码任务,包括NIST AES、SHA-3、LWC、PQC竞赛候选算法,6个独立生产级对称密码,FEAL-4以及AIMer。
- 被测模型范围:主评测覆盖5款模型(Claude Opus 4.8、Sonnet 5、Mythos 5、GPT-5.5、GLM-5.2),模型家族消融扩展至Claude系列多代模型;论文未测试GPT-5.6与Claude Fable-5。
- 运行环境与资源上限:单个任务单次执行限定于8核CPU、20GB内存与10GB存储的Docker容器;默认探索与验证时间预算各为2小时,算力扩展实验仅对Mythos 5单模型提升至16小时。
- 博弈类型与判定参数:涉及TKR、IND-CPA、IND-CCA、伪造与碰撞五类博弈;决策博弈固定为20次独立重测且阈值固定为17次胜出;每个任务执行2次独立运行。
- 未报告信息:论文在Tier 2中借助Claude Opus 4.8生成缩减参数时,未逐一验证所有变体是否精确落入预设的复杂度区间;论文未对除Claude系列外的其他模型开展8倍时间扩展实验。
总结一下论文的主要内容
提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
- 一句话定位:该论文提出了首个面向真实标准化候选密码原语的端到端自动化密码分析基准CryptanalysisBench,并对前沿大语言模型展开系统性评测。
- 要解决的问题:传统密码分析依赖人类专家,而既有大模型评测集中在玩具密码或人工植入脆弱点的CTF赛题,缺乏衡量AI对真实复杂密码算法分析与漏洞挖掘能力的严谨基准。
- 方法要点:汇集NIST竞赛等191个密码算法任务,划分为已知攻破的Tier 1、无已知实用攻击(含缩减与全强度)的Tier 2以及生产级Challenge Set;基于Docker双容器与HTTP API隔离构建形式化安全博弈交互,通过重测独立实例自动验证模型提交的攻击脚本。
- 主要实验结果:
- 五款前沿模型在Tier 1上取得65.3%–85.7%的成功率(Mythos 5攻破42/49,GLM-5.2攻破32/49),其中约78%的攻破源自算法数学与结构设计缺陷。
- 在全强度方案测试中,Mythos 5与Sonnet 5通过2次查询攻破了未修改的SpoC AEAD方案,Mythos 5攻破KINDI并揭示其NIST安全性证明中的错误,两项均为此前未公开的真实设计缺陷。
- 算力扩展测试表明,将时间预算放宽至16小时后,Mythos 5攻破了此前无法实现的SIKE、RLCE-KEM和WalnutDSA,成功率升至95.9%。
- 作者结论与启示:作者认为前沿模型已初步具备独立发现复杂密码原语设计缺陷的能力,失败更多受限于代码工程与特定求解算法的实现而非分析盲区;该基准可作为跟踪AI密码分析能力并辅助密码标准安全性压力测试的评估框架。