ContextLeak:通过恶意工具窃取 LLM Agent 运行时上下文
提出 ContextLeak,用强化学习优化恶意工具描述,诱导 Agent 外泄运行时上下文
- arXiv
- 2608.27800
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Qwen-3-8B、GPT-OSS-20B、Gemma-4-E4B-it 等 11 个
提出 ContextLeak,用强化学习优化恶意工具描述,诱导 Agent 外泄运行时上下文
提出 ElasticBack,在单个 Agent 技能中植入条件后门
ElasticBack 是放在 LLM agent 单个 skill 里的条件后门攻击。。
提出 LoginTrap,以网页弹窗诱导 Web Agent 提交敏感信息
摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。
提出 SkillClone,仅凭良性任务交互重构闭源 Agent 技能
论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。
构建 OpenART 竞技场,以 EMHA 演化持久环境评测智能体安全
训练自博弈红队智能体 GPT-Red,规模化生成提示注入与越狱攻击
提出 SigLeak,从黑盒 Agent 执行轨迹推断专有技能
摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
构建 Trojan Hippo Bench,评测 Agent 持久记忆投毒与外泄
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出 SeedSnitch 与 PromptPirate,恢复种子后窃取扩散提示词
提出 Prometheus,从展示图反推文生图模型的在售提示词
Prometheus 是针对文生图市场 showcase 的训练无关提示词窃取:攻击者看不到在售文本,只用本地开源 proxy 恢复 subject 和 modifier,并希望换 subject 后风格仍在。