摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 攻击arXiv 2609.27542
研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
- arXiv
- 2609.27542
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
- 攻击arXiv 2609.36576
AdaLCPI:让 Agent 从长上下文碎片中重建间接提示注入
提出 AdaLCPI,把间接提示注入拆成片段嵌入工具返回并自适应优化
- arXiv
- 2609.36576
- 发表
- 层
- 应用层
- 场景
- AI Agent
已经到底了