攻击arXiv 2609.04533
Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
- arXiv
- 2609.04533
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 11 个
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
综述视觉内容全生命周期中的所有者侧对抗防护方法
Adversarial attacks for good 是一篇视觉内容所有者侧保护的综述:把长期作为攻击来研究的扰动和结构化信号,反过来交给数据所有者、创作者、平台或审计方使用。
提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露
QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。
形式化视频透视头显中系统截图与人眼视野的错配
提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留
IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。