跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 1 条 · 本页 1 条 · 共 1 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究103细分与主体5来源:论文追踪论文追踪1 条材料论文:MAMJ:面向视觉语言模型的元自适应多模态越狱攻击论文2026-08-27MAMJ:面向视觉语言模型的元自适应多模态越狱攻击方向:字节跳动字节跳动1方向:Google DeepMindGoogleDeepMind1方向:越狱与攻击越狱与攻击1方向:OpenAIOpenAI1方向:红队红队1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 1 条
  • 论文论文追踪

    MAMJ:面向视觉语言模型的元自适应多模态越狱攻击

    研究者提出元自适应多模态越狱方法 MAMJ,同时优化攻击策略提示词(ASP)和攻击者模型权重,而非只调整图文内容。该方法先用基于 LLM 的批评模型迭代改进 ASP,再用分组聚合的攻击成功率(ASR)作为奖励更新攻击者权重。在 MM-SafetyBench 上,MAMJ 对 GPT-4o、Gemini-3-Pro-Preview 和 Seed 2.0 的 ASR 分别为 81.0%、78.9% 和 82.3%,比最强的样本级基线最高高出 24.1 个百分点。学到的攻击者无需重新训练即可迁移到未见过的受害模型,并在代表性防御下仍然有效。论文已被 EMNLP 2026 主会接收,代码已公开。