跳到正文
10月10日 · 周六

越狱与攻击 · 论文

找到 27 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv 2609.38253

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出 CollageAttack,用空间文本碎片重组越狱文生图模型

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个

    摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    深度解读完整解读
  2. 攻击arXiv 2609.07216

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    被测模型
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  3. 攻击arXiv 2609.01168

    CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型

    提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤

    发表
    攻击者
    黑盒
    被测模型
    Stable Diffusion v1.4、SDXL、DALL·E 3 等 4 个
    摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。

    CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。

    深度解读完整解读
  4. 攻击arXiv 2607.21619

    ASO:用GRPO优化视觉风格放大MLLM越狱攻击

    提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击

    发表
    攻击者
    灰盒
    被测模型
    GPT-4.1-mini、Gemini-2.5-Flash、Qwen3-VL 等 6 个

    摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。

    深度解读完整解读
  5. 攻击arXiv 2605.07399

    研究者提出 GPO-V,用全局概率优化越狱扩散视觉语言模型

    提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型

    发表
    攻击者
    白盒、黑盒
    被测模型
    LLaDA-V、LaViDA
    摘要作者用视觉扰动改 dVLM 的全局生成概率,以绕过两类拒绝。

    GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。

    深度解读完整解读
  6. 攻击arXiv 2603.20198

    研究者提出 MM-Plan 多模态越狱框架

    提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标

    发表
    攻击者
    黑盒
    被测模型
    Llama-3.2-11B、InternVL3-8B、Qwen3-VL-8B 等 8 个
    摘要作者称全局规划能攻破对单轮攻击更稳的前沿 MLLM。

    MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。

    深度解读完整解读