OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
- arXiv
- 2610.09941
- 发表
- 场景
- 模型与 API
- 被测模型
- LLaVA-1.5-7B、Qwen3-VL-8B、LLaVA-1.5-13B 等 5 个
摘要一次投影去掉劫持方向。
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token
NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门
FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。
提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本
面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
构造可通过计费审计的 token 虚报,使服务商系统性超收
不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出 BackdoorVLM 基准,评测视觉语言模型微调中的后门攻击与防御
BackdoorVLM 是作者提出的 VLM 后门攻击与防御评测基准,作者称它是首个此类综合基准。