跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.07009· Boyuan Chen, Yehia Dawoud, Hailemariam Mersha, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique·本站收录 · 原文发表 日期未标

研究受控拆解图像到文本越狱中图像属性的作用

Which Image Property Carries the Jailbreak? A Controlled Dissection of Image-to-Text Jailbreaks

AI 导读

研究者在 313 条 StrongREJECT 提示切片上,用五个多模态模型(附录另测 InternVL3.5-8B)考察四类已发表攻击家族中的图像侧因素,并保持有害指令不变。结果显示,单独的有害查询无论是否配无关良性图像,在多数模型上攻击成功率都很低,而攻击图像会显著提高成功率。逐 tile 熵和 JPEG 体积无法可靠区分攻击 tile 与体积匹配的良性干扰图,限制了仅靠密度筛查的做法;此前的 tile 数量阶梯实验受载荷可见性混淆,修正后的区域数量测试未发现可检测效应。在 Qwen3-VL-8B 上,移除查询相关性的 E4 操作使攻击成功率下降约 0.12,支持将部分效果归因于相关性操作,但图文一致性仍未测量。五项测试通过全局统计校正,仅 E4 支持归因到单一测量描述符,结论仍以评分标准判定为前提。

阅读原文arxiv.org