OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
- arXiv
- 2610.09941
- 发表
- 场景
- 模型与 API
- 被测模型
- LLaVA-1.5-7B、Qwen3-VL-8B、LLaVA-1.5-13B 等 5 个
摘要一次投影去掉劫持方向。
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
提出 Kubernetes 运维智能体的七层纵深防御框架与参考架构
把 Kubernetes 上的运维智能体当作不可信租户,在假定提示注入已完全控制其工具选择的前提下,用基础设施重建数据面与控制面的边界。要解决的是:智能体读日志、注解、工单或 MCP 工具描述时,这些内容可以变成它带着自身凭据执行的命令。模型对齐和分类器只降低概率。
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门
FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。
提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本
面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出针对 Agent Harness 的上下文特权提升攻击
提出 AgentKernel,用四支柱强制中介 Agent 的输入、工具与记忆
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。