评测与基准arXiv:2607.18538 · 7月21日CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力编程 Agent·测试Claude Opus 4.8、Claude Sonnet 5、Claude Mythos 5 等 10 个·应用层危险能力摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。完整解读