CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
完整解读
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力