攻击arXiv 2609.04533
Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
- arXiv
- 2609.04533
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 11 个
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。