攻击arXiv 2608.27800
ContextLeak:通过恶意工具窃取 LLM Agent 运行时上下文
提出 ContextLeak,用强化学习优化恶意工具描述,诱导 Agent 外泄运行时上下文
- arXiv
- 2608.27800
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Qwen-3-8B、GPT-OSS-20B、Gemma-4-E4B-it 等 11 个
提出 ContextLeak,用强化学习优化恶意工具描述,诱导 Agent 外泄运行时上下文
提出 EVOMAL,诱导自演化编码 Agent 在创建技能时自我投毒并蠕虫传播
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。