跳到正文
10月10日 · 周六

全部论文

找到 55 篇

另有 303 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09941

    OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型

    提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向

    发表
    被测模型
    LLaVA-1.5-7B、Qwen3-VL-8B、LLaVA-1.5-13B 等 5 个
    摘要一次投影去掉劫持方向。

    OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。

    深度解读完整解读
  2. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  3. 防御arXiv 2610.09469

    Secure-CUA:约束计算机使用智能体中不可信内容的影响

    提出 Secure-CUA,用动作事务约束计算机使用智能体的不可信影响

    发表
    场景
    web agent
    被测模型
    Claude Opus 5、Gemini 3.8 Flash、GPT-5.6-Sol
    摘要Secure-CUA 用每步事务约束不可信影响,良性 TSR 接近 Vanilla-CUA。

    Secure-CUA 要限制图形界面里不可信内容对 CUA 决策和 GUI 执行的影响,同时保留合法任务所需的不可信信息。

    深度解读完整解读
  4. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  5. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  6. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    被测模型
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  7. 攻击arXiv 2610.05453

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    提出 PLW,用微调把先前对话敏感触发编码进后续生成图像

    发表
    被测模型
    OmniGen2、BAGEL-7B

    摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。

    深度解读完整解读
  8. 防御arXiv 2610.05401

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    提出审计感知遗忘框架 AVCE,从文本与视觉通路擦除扩散模型概念

    发表
    攻击者
    白盒、黑盒
    被测模型
    Stable Diffusion XL (SDXL)、Stable Diffusion v1.5 (SD v1.5)、Flux 1.0
    摘要AVCE 在审计锚点上改两条注意力通路。

    AVCE 是面向扩散模型的概念擦除方法,要让擦除经得起绕过文本条件的潜空间审计,而不只是挡住对抗提示词。

    深度解读完整解读
  9. 防御arXiv 2610.04616

    PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径

    提出 Perturbot 扰动训练,打破 VLA 的模态捷径

    发表
    被测模型
    π0.5
    摘要Perturbot 改训练数据以削弱三类模态捷径,GroundFscore 用来看成功是否来自任务证据。

    Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。

    深度解读完整解读
  10. 防御arXiv 2610.03980

    FADE:面向视频扩散模型的帧感知多概念擦除框架

    提出 FADE,对文生视频模型做帧感知多概念擦除

    发表
    被测模型
    Wan2.1-T2V-1.3B、Wan2.1-T2V-14B、CogVideoX-2B 等 4 个
    摘要FADE 用闭式编辑、帧感知适配器和软路由,在单骨干上擦除多概念并压低逐帧残差。

    FADE 是面向文生视频扩散 Transformer 的多概念遗忘方法,用来抑制指定物体、画风、裸体、暴力、仇恨和名人身份,并尽量保持其他生成。作者要处理两件事。与帧无关的抑制会让概念在少数帧重现,片段均值会掩盖这一失败。

    深度解读完整解读
  11. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测 ReAct 工具调用对多模态模型拒答有害请求的削弱

    发表
    场景
    AI Agent
    被测模型
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  12. 防御arXiv 2610.02967

    用偏好奖励与评分标准奖励组合后训练前沿文生图模型

    组合偏好奖励与评分标准奖励后训练文生图模型以抑制奖励作弊

    发表
    被测模型
    FLUX.2-dev、Ideogram-4
    摘要组合奖励后训练 FLUX.2-dev 与 Ideogram-4,并报告高于基座的胜率与 Elo。

    作者给出一套开放域文生图后训练配方:把人类偏好奖励和 prompt 条件的 rubric 奖励合在一起,而不是换一个新优化器。问题是单一奖励盖不住用户意图。偏好模型能看整体观感,但对“是否实现每个要求”这类稀疏属性不敏感。

    深度解读完整解读
  13. 防御arXiv 2610.01800

    LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法

    提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型

    发表
    摘要LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。

    LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。

    深度解读完整解读
  14. 其他arXiv 2610.00812

    视频生成模型的后训练与对齐综述

    综述视频生成的后训练与对齐,并汇总基准与开放挑战

    发表
    摘要综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。

    这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。

    深度解读完整解读