Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
另有 16 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
审计由智能体从零构建并部署的真实应用的安全缺陷
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 EvoRiskBench,评测工作区智能体的运行时安全风险
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读