跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选8
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 310 篇还没打标签,不在筛选结果里。

另有 310 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  2. 防御arXiv 2608.12876

    SPARED:用对抗编辑数据训练基于推理的 AI 生成图像检测器

    提出 SPARED,用对抗编辑数据训练基于推理的 AI 生成图像检测器

    发表
    攻击者
    黑盒、白盒
    被测模型
    Qwen3.5-9B
    摘要SPARED 用防捷径的编辑对抗环训练 9B 推理检测器。

    SPARED 是一套用于可解释 AI 生成图像检测的攻防强化学习流程,报告模型是 Qwen3.5-9B 上的第三轮防御器。

    深度解读完整解读
  3. 攻击arXiv 2605.21541

    研究者提出 FRA-Attack 频域正则化方法,提升对闭源 MLLM 的迁移攻击效果

    提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击

    发表
    攻击者
    黑盒
    被测模型
    GPT-5.2、GPT-5.4、Claude-Opus-4.6 等 15 个
    摘要FRA-Attack 以频域对齐和梯度低通做可迁移定向攻击,闭源面板上作者称整体更强,Gemma 除外。

    FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。

    深度解读完整解读
已经到底了