Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现
作者构建了含40个攻击的SLEIGHT-BENCH基准,Opus 4.6监控器在1% FPR下有50%攻击从未被捕获。
- 32%Opus 4.6带扩展思考在ControlArena提示词、1% FPR下的单次试验捕获率(Figure 2)
- 20 of 40Opus 4.6带扩展思考在ControlArena提示词、1% FPR、10次试验中从未捕获的攻击数(Section 5.1)
- 52%Opus 4.6使用Claude Code智能体脚手架在ControlArena提示词下的捕获率(Figure 2)
评估代码智能体监控器在面对利用概念盲点的多样化规避攻击时的检测能力与防御失效情况。
涉及AI控制协议、智能体监控基准与LLM能力缺陷研究,本文侧重于前沿监控器针对性盲点的系统化构建。
梳理11类监控盲点,人机协同生成轨迹并剥离推理,经5个沙箱智能体验证器检验真实性与危害。
在1% FPR下前沿监控器单次捕获率为2%–54%,50%攻击能持续规避Opus 4.6,增加算力与针对性提示词可局部改善。
局限包括合成轨迹缺少真实交互、良性分布可能失真,后续需探索动态红队;实验覆盖6个模型与40个攻击案例。
评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。