跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 232 篇还没打标签,不在筛选结果里。

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  2. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  3. 攻击arXiv 2610.05453

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    提出 PLW,用微调把先前对话敏感触发编码进后续生成图像

    发表
    被测模型
    OmniGen2、BAGEL-7B

    摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。

    深度解读完整解读
  4. 攻击arXiv 2609.07048

    FreqDoor:面向视觉语言模型的频域后门攻击

    提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门

    发表
    被测模型
    BLIP-2 (opt-2.7b)、InstructBLIP (flan-t5-xl)、LLaVA (interleave-qwen)
    摘要FreqDoor 用频域振幅混合给三款 VLM 植入仅视觉的训练时后门。

    FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。

    深度解读完整解读
  5. 攻击arXiv 2606.09499

    研究者提出针对世界模型的机器人学习管线投毒攻击

    提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略

    发表
    被测模型
    Cosmos-Predict 2.5、Cosmos-Predict 2.5 AC、Dino WM 等 4 个
    摘要只改视频帧经世界模型投毒。

    只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。

    深度解读完整解读
已经到底了