防御arXiv 2610.01184
ReCast:在固定媒体接口下保护多模态推理的隐私框架
提出 RECAST 框架,本地改写图表与语音以保护远程数值推理隐私
- arXiv
- 2610.01184
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Qwen3.5-Omni-Plus、Qwen3-VL-8B-Instruct、Qwen3-ASR-1.7B 等 11 个
- 组件视觉
提出 RECAST 框架,本地改写图表与语音以保护远程数值推理隐私
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用
Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本
面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门