防御arXiv 2610.01184
ReCast:在固定媒体接口下保护多模态推理的隐私框架
提出 RECAST 框架,本地改写图表与语音以保护远程数值推理隐私
- arXiv
- 2610.01184
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Qwen3.5-Omni-Plus、Qwen3-VL-8B-Instruct、Qwen3-ASR-1.7B 等 11 个
- 组件视觉
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
提出 RECAST 框架,本地改写图表与语音以保护远程数值推理隐私
提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用
Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱