PLA:针对文生图模型的黑盒提示词学习攻击
PLA: Prompt Learning Attack against Text-to-Image Generative Models
AI 导读
研究者提出提示词学习攻击框架 PLA,用于在无法获取模型架构与参数的黑盒条件下绕过文生图模型的安全机制。此前方法多依赖词替换搜索对抗提示词,受限于搜索空间,效果不如基于梯度的训练;PLA 利用多模态相似度设计面向黑盒 T2I 模型的梯度训练来学习对抗提示词。实验显示,该方法能有效攻击包括提示词过滤器和事后安全检查器在内的黑盒 T2I 安全机制,成功率高于现有方法。论文发表于 ICCV2025,作者提示文中可能包含模型生成的有害内容。