跳到正文
10月10日 · 周六

全部论文

找到 16 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09941

    OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型

    提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向

    发表
    被测模型
    LLaVA-1.5-7B、Qwen3-VL-8B、LLaVA-1.5-13B 等 5 个
    摘要一次投影去掉劫持方向。

    OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。

    深度解读完整解读
  2. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响

    发表
    被测模型
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读
  3. 攻击arXiv 2609.12448

    GraphProfiler 用个人知识图谱推断敏感属性并溯源到具体帖子

    提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源

    发表
    摘要GraphProfiler 用源链接个人知识图谱做属性推断,准确率接近文本基线,并把证据定位到少量源帖。

    GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。

    深度解读完整解读
  4. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测多模态提示注入对 Agent 框架的影响

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  5. 攻击arXiv 2609.07048

    FreqDoor:面向视觉语言模型的频域后门攻击

    提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门

    发表
    被测模型
    BLIP-2 (opt-2.7b)、InstructBLIP (flan-t5-xl)、LLaVA (interleave-qwen)
    摘要FreqDoor 用频域振幅混合给三款 VLM 植入仅视觉的训练时后门。

    FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。

    深度解读完整解读
  6. 防御arXiv 2609.06346

    面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复

    提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本

    发表
    摘要用净化、梯度筛选恢复和鲁棒原型路由,把动态扩展持续学习接到任务级后门防御上。

    面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。

    深度解读完整解读
  7. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链

    发表
    场景
    web agent
    被测模型
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 7 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
  8. 攻击arXiv 2606.12716

    PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

    提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令

    发表
    被测模型
    Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
    摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。

    深度解读完整解读
  9. 攻击arXiv 2606.09499

    研究者提出针对世界模型的机器人学习管线投毒攻击

    提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略

    发表
    被测模型
    Cosmos-Predict 2.5、Cosmos-Predict 2.5 AC、Dino WM 等 4 个
    摘要只改视频帧经世界模型投毒。

    只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。

    深度解读完整解读
  10. 评测与基准arXiv 2511.18921

    BackdoorVLM:面向视觉语言模型后门攻击与防御的基准

    提出 BackdoorVLM 基准,评测视觉语言模型微调中的后门攻击与防御

    发表
    被测模型
    LLaVA-1.5-7B、Qwen2.5-VL-7B
    摘要BackdoorVLM 统一评测 VLM 后门与防御:含文本触发在低投毒率下更易激活,现有防御跨类型不稳定。

    BackdoorVLM 是作者提出的 VLM 后门攻击与防御评测基准,作者称它是首个此类综合基准。

    深度解读完整解读
  11. 攻击arXiv 2507.10457

    论文提出 LPCI:针对 Agent 逻辑层与持久记忆的提示控制注入攻击

    提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发

    发表
    场景
    AI Agent
    被测模型
    ChatGPT、Claude、LLaMA3 等 8 个
    摘要作者定义 LPCI。

    作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。

    深度解读完整解读
已经到底了