跳到正文
10月8日 · 周四

思维链监控 · 论文

找到 1 篇
筛选

模型自身风险

防御类型

影响

系统组件

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 9 篇还没打标签,不在筛选结果里。

另有 9 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2605.16626 ·

    Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    提出SLEIGHT-BENCH,评测代码智能体监控器的概念盲点

    测试
    Claude Opus 4.6、Claude Opus 4.7、Claude Sonnet 4.6 等 6 个应用层
    摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。
    • 一句话定位:本研究构建了首个针对代码智能体监控器概念认知缺陷的对抗规避基准 SLEIGHT-BENCH。
    • 要解决的问题:随着自主代码智能体能力增强,利用 LLM 进行行为监控成为核心防御,但现有自动化红队生成能力受限,难以充分评估前沿监控器在面对多样化规避策略时的安全边界。
    • 方法要点:作者人工归纳了 11 类监控器盲点,人机协同合成包含严重危害的执行轨迹,剥离自然语言思考仅保留工具调用,并通过包含 5 个沙箱智能体的验证流程保障轨迹真实性与有效性。
    • 重要实验结果:
      • 在 ControlArena 提示词和 1% FPR 下,Opus 4.6 扩展思考的单次试验捕获率为 32%,40 个攻击中有 20 个在 10 次测试中从未被捕获(Figure 2、Section 5.1)。
      • 引入 Claude Code 智能体脚手架使 Opus 4.6 的捕获率提升至 52%,但增益主要集中在计数和大文本检索等工具易操作的类别(Figure 2、Figure 3)。
      • 各前沿模型表现中,GPT-5.5 带思考捕获率为 50%,Gemini 3.1 Pro 高思考为 54%(Figure 2)。
      • 针对性防御提示词能够提升特定盲点的捕获率,但往往会造成其他类别的检测率回落(Section 5.2)。
    • 作者结论与启示:前沿监控器存在系统性且可被利用的盲区;单纯依赖单一监控提示词难以防范多样化规避,未来防御需结合更丰富的盲点枚举、动态红队及多提示词集成方案。
    完整解读
已经到底了