跳到正文
10月10日 · 周六

全部论文

找到 8 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.06452

    研究者提出多模态安全评测应衡量可控性而非仅做分类

    主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像

    发表
    被测模型
    LlavaGuard-v1.2-7B-OV、Qwen3.5-9B
    摘要四轴画像把读出与选择性控制分开。

    作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。

    深度解读完整解读
  2. 其他arXiv 2610.04792

    多模态一定更好吗?缺失模态鲁棒性的几何视角与 Geodesic Unlearning 方法

    提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性

    发表
    被测模型
    RoBERTa、ResNet50、Qwen2.5-3B 等 6 个
    摘要GU 用测地线子空间编辑应对部署时缺模态下降,并尽量保住全模态精度。

    这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。

    深度解读完整解读
  3. 其他arXiv 2610.03389

    Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算

    提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算

    发表
    被测模型
    Qwen2.5-VL-3B-Instruct、Qwen2.5-VL-7B-Instruct、LLaVA-v1.6-Vicuna-7B-HF 等 4 个
    摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。

    P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。

    深度解读完整解读
  4. 其他arXiv 2610.00812

    视频生成模型的后训练与对齐综述

    综述视频生成的后训练与对齐,并汇总基准与开放挑战

    发表
    摘要综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。

    这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。

    深度解读完整解读
  5. 其他arXiv 2608.04314

    面向良性用途的对抗攻击:视觉内容全生命周期主动防护综述

    综述视觉内容全生命周期中的所有者侧对抗防护方法

    发表
    摘要综述把五类对抗式保护收成一个生命周期,并用三条轴比较其主张。

    Adversarial attacks for good 是一篇视觉内容所有者侧保护的综述:把长期作为攻击来研究的扰动和结构化信号,反过来交给数据所有者、创作者、平台或审计方使用。

    深度解读完整解读
已经到底了