攻击arXiv 2608.27800
ContextLeak:通过恶意工具窃取 LLM Agent 运行时上下文
提出 ContextLeak,用强化学习优化恶意工具描述,诱导 Agent 外泄运行时上下文
- arXiv
- 2608.27800
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Qwen-3-8B、GPT-OSS-20B、Gemma-4-E4B-it 等 11 个
提出 ContextLeak,用强化学习优化恶意工具描述,诱导 Agent 外泄运行时上下文
提出 EVOMAL,诱导自演化编码 Agent 在创建技能时自我投毒并蠕虫传播
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
提出 CDH 攻击,让技能型 Agent 绕路放大资源消耗
CDH 是针对渐进披露技能智能体的发布者侧、纯文本攻击:一个静态协调器把本可正确完成的任务,拐进有界但更耗资源的技能绕路,再交还原任务。