跳到正文
10月10日 · 周六

全部论文

找到 12 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 196 篇还没打标签,不在筛选结果里。

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.01168

    CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型

    提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤

    发表
    攻击者
    黑盒
    被测模型
    Stable Diffusion v1.4、SDXL、DALL·E 3 等 4 个
    摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。

    CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。

    深度解读完整解读
  2. 攻击arXiv 2605.21541

    研究者提出 FRA-Attack 频域正则化方法,提升对闭源 MLLM 的迁移攻击效果

    提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击

    发表
    攻击者
    黑盒
    被测模型
    GPT-5.2、GPT-5.4、Claude-Opus-4.6 等 15 个
    摘要FRA-Attack 以频域对齐和梯度低通做可迁移定向攻击,闭源面板上作者称整体更强,Gemma 除外。

    FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。

    深度解读完整解读
  3. 攻击arXiv 2605.07399

    研究者提出 GPO-V,用全局概率优化越狱扩散视觉语言模型

    提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型

    发表
    攻击者
    白盒、黑盒
    被测模型
    LLaDA-V、LaViDA
    摘要作者用视觉扰动改 dVLM 的全局生成概率,以绕过两类拒绝。

    GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。

    深度解读完整解读
  4. 攻击arXiv 2603.20198

    研究者提出 MM-Plan 多模态越狱框架

    提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标

    发表
    攻击者
    黑盒
    被测模型
    Llama-3.2-11B、InternVL3-8B、Qwen3-VL-8B 等 8 个
    摘要作者称全局规划能攻破对单轮攻击更稳的前沿 MLLM。

    MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。

    深度解读完整解读
  5. 攻击arXiv 2503.06223

    RedDiffuser:用强化扩散生成视觉输入审计 VLM 多模态安全失效

    提出 RedDiff,用强化扩散生成图像审计 VLM 情境安全失效

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B、Gemini-1.5-flash、LLaMA-3.2-11B-Vision-Instruct
    摘要用强化扩散生成视觉上下文,审计有害文本情境下的 VLM 安全失效。

    RedDiffuser 是黑盒审计框架:有害内容不是显式攻击指令,而是固定的部分有毒文本,再配上扩散模型生成的图像,看 VLM 的开放续写会不会变得不安全。

    深度解读完整解读
已经到底了