跳到正文

字节跳动

今天还没有收录新动态
10月3日周六
  1. 论文追踪 · 收录 · 原文 论文50

    MAMJ:面向视觉语言模型的元自适应多模态越狱攻击

    研究者提出元自适应多模态越狱方法 MAMJ,同时优化攻击策略提示词(ASP)和攻击者模型权重,而非只调整图文内容。该方法先用基于 LLM 的批评模型迭代改进 ASP,再用分组聚合的攻击成功率(ASR)作为奖励更新攻击者权重。在 MM-SafetyBench 上,MAMJ 对 GPT-4o、Gemini-3-Pro-Preview 和 Seed 2.0 的 ASR 分别为 81.0%、78.9% 和 82.3%,比最强的样本级基线最高高出 24.1 个百分点。学到的攻击者无需重新训练即可迁移到未见过的受害模型,并在代表性防御下仍然有效。论文已被 EMNLP 2026 主会接收,代码已公开。

已经到底了