研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
- arXiv
- 2609.27542
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen/Qwen3-4B-Thinking-2507、openai/gpt-oss-20b、google/gemma-4-26B-A4B-it 等 4 个
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
另有 25 篇论文还没打上分类标签,暂不在筛选结果里。
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
提出 SchemeArena 因子化评测智能体的谋划倾向
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
提出 DoM 探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
提出 DERIVAUDIT,审计长期 Agent 记忆是否由交互历史支持
DERIVAUDIT 审计长期智能体的持久记忆是否由写入时可获得的交互历史支持,而不是只看以后能否被召回。
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。
界定单迹监控对 2-safety 超性质的可检测前沿与监督缺口
论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。
证明 LLM 仅凭先前监控反馈即可编辑激活规避潜空间监控
这篇论文研究了语言模型如何仅利用多轮上下文中的二元反馈信息规避内部潜空间监控器。