研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
- 论文定位:该论文是一项关于工具使用推理智能体的安全实证研究,阐明智能体安全是由模型与解码harness共同决定的复合属性。
- 核心问题:研究间接对抗输入能否通过篡改分词边界消除思维链推理,从而打破基于推理审查的安全监控假设,并分析下游工具调用解析器对动作执行的控制作用。
- 核心机制:攻击者在输入中注入模型自身的保留控制标记,构造一个预先闭合的空 analysis 通道,诱导分词器将其解析为已完成的推理轮次,促使模型跳过思考直接生成工具调用;同时解析器对缺失闭合标记的宽容匹配使得截断调用仍能触发。
- 关键定量结果:在 gpt-oss-20b 上,该注入使 40 个普通措辞任务的平均推理从 52.5 token 降为 0 且工具调用全部触发(Table 1);在 48 个恶意任务上使规则和跨家族大模型监控器的检出率从 1.00 降为 0.00,并将 39.6% 的拒绝转变为成功外传(Table 3);Gemma 模型在相同生成下仅因解析器不同而呈现 0% 与 100% 的成功率对立(Table 4)。
- 防御与规避发现:输入清洗需采用替换而非朴素删除以防拼接新触发词(Table 6);空推理检测绊线可被单行良性诱饵自适应绕过并达成 1.00 的外传成功率(Table 7)。
- 结论与启示:作者认为不能单凭思维链监控保障智能体安全,防御者必须将推理审查与动作级参数检查相结合,并在解码harness中实施严格的输入清洗与解析器加固。