攻击arXiv 2609.33910
论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
- arXiv
- 2609.33910
- 发表
- 层
- 应用层
- 被测模型
- GPT-4.1、Gemini-3.1-Flash-Lite、Qwen3-14B 等 6 个
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出自适应攻击框架,击穿越狱与提示注入防御
提出 RL-Hammer,从零训练攻击模型经工具输出实施提示注入
RL-Hammer 是一个无需热启动数据、基于 GRPO 算法从零训练的黑盒提示注入对抗攻击框架。现有针对大语言模型智能体的提示注入防御(如 Instruction Hierarchy 与 SecAlign)主要在静态或弱攻击下测试,在面对自动化强力攻击时的真实防御能力缺乏充分检验。方法的核心机制包括。