攻击arXiv 2609.36576
AdaLCPI:让 Agent 从长上下文碎片中重建间接提示注入
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
- arXiv
- 2609.36576
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-4.1、GPT-5.1、GPT-5.6-Luna 等 7 个
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出日志基底提示注入,操纵 SOC 分析员的分类、摘要与处置建议
摘要在 gpt-4o-mini 上,人格劫持与上下文操纵可改写 SOC 分析输出,直接覆盖在分类上无效。
用简历中的不可见指令做间接提示注入,操纵招聘推荐
摘要作者称推理在简单注入下会帮攻击圆谎,在不合逻辑的复杂注入下又会把欺骗漏出来。