攻击arXiv 2609.36576
AdaLCPI:让 Agent 从长上下文碎片中重建间接提示注入
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
- arXiv
- 2609.36576
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-4.1、GPT-5.1、GPT-5.6-Luna 等 7 个
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
构造可通过计费审计的 token 虚报,使服务商系统性超收
不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。
用简历中的不可见指令做间接提示注入,操纵招聘推荐
摘要作者称推理在简单注入下会帮攻击圆谎,在不合逻辑的复杂注入下又会把欺骗漏出来。
提出 TFA 与 SVA,抑制 ensemble 后门指纹验证
TFA 与 SVA 是针对后门式 LLM 指纹的 ensemble 抑制攻击,不改模型参数。所有者用 SFT 写入秘密对,只通过 API 验证版权。攻击者未授权取得模型,不知道触发和指纹,却要把每个模型的验证变成失败,同时让 ensemble 至少不差于性能最高的单模型。