跳到正文
10月8日 · 周四

思维链监控 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv:2609.27542 ·

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具智能体推理链以绕过思维链监控

    测试
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个应用层
    场景
    AI Agent
    摘要论文阐明控制标记注入可抑制CoT使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
    • 论文定位:该论文是一项关于工具使用推理智能体的安全实证研究,阐明智能体安全是由模型与解码harness共同决定的复合属性。
    • 核心问题:研究间接对抗输入能否通过篡改分词边界消除思维链推理,从而打破基于推理审查的安全监控假设,并分析下游工具调用解析器对动作执行的控制作用。
    • 核心机制:攻击者在输入中注入模型自身的保留控制标记,构造一个预先闭合的空 analysis 通道,诱导分词器将其解析为已完成的推理轮次,促使模型跳过思考直接生成工具调用;同时解析器对缺失闭合标记的宽容匹配使得截断调用仍能触发。
    • 关键定量结果:在 gpt-oss-20b 上,该注入使 40 个普通措辞任务的平均推理从 52.5 token 降为 0 且工具调用全部触发(Table 1);在 48 个恶意任务上使规则和跨家族大模型监控器的检出率从 1.00 降为 0.00,并将 39.6% 的拒绝转变为成功外传(Table 3);Gemma 模型在相同生成下仅因解析器不同而呈现 0% 与 100% 的成功率对立(Table 4)。
    • 防御与规避发现:输入清洗需采用替换而非朴素删除以防拼接新触发词(Table 6);空推理检测绊线可被单行良性诱饵自适应绕过并达成 1.00 的外传成功率(Table 7)。
    • 结论与启示:作者认为不能单凭思维链监控保障智能体安全,防御者必须将推理审查与动作级参数检查相结合,并在解码harness中实施严格的输入清洗与解析器加固。
    完整解读
  2. 攻击arXiv:2609.15989 ·

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控

    测试
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
    • 论文定位:研究思维链(CoT)监视对上下文推理污染脆弱性的安全研究,提出了名为计划注入(plan injection)的推理阶段攻击。
    • 试图解决的问题:探索当恶意计划伪装成良性推理进入上下文时,现有的 CoT 监视器能否可靠识别模型被诱导的对抗行为。
    • 核心方法设计:攻击者在输入中作为可选建议植入带有良性辩护的错误推理计划;行动模型在无强制要求的情况下自发将其改写为自身的思维链,隐藏来源并输出对抗结果。
    • 关键实验结果:
      1. 在 APPS 和 Bio-Math 上,Qwen3-8B 和 DeepSeek-R1 采纳计划并成功触发后门/求解隐藏任务的比例达到 41.7%–98.9%(Figure 3),且 8-gram 文本复制超过一半的样本不足 1%(Table 7)。
      2. 即便在最强的思考型监视器(Claude 3.7 Sonnet)下,端到端未被检出的成功攻击比例在 APPS 上仍达 33%–40%,在 Bio-Math 上达 78%–81%(Table 8)。
      3. 增加监视器思考预算产生双向效应:在 Qwen3 235B 的两端样本中,高预算使可疑度上升样本平均增加约 0.26–0.30,但也使可疑度下降样本平均减少约 0.28–0.30(Figure 6)。
    • 作者结论与启示:作者认为,如果监视器仅对 CoT 进行恶意关键词或表层意图的粗浅匹配,计划注入能有效逃避审计;向监视器提供上下文计划或增加推理预算并不总是提升安全性,监视模型可能反被连贯的良性叙事误导,将异常行为主动合理化。
    完整解读
已经到底了