研究者用微调大语言模型越狱带安全护栏的文生图模型
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
AI 导读
研究者提出一种用微调大语言模型越狱带安全护栏的文生图模型的方法,微调后的 AttackLLM 可高效生成对抗提示词,无需像其他基于查询的越狱攻击那样反复查询目标模型。作者在三个不安全提示词数据集上、针对五种安全护栏进行评测,称该方法能有效绕过护栏,效果优于现有的 no-box 攻击,并可辅助其他基于查询的攻击。该工作已被 EACL 2026 Findings 接收。