防御arXiv 2610.01184
ReCast:在固定媒体接口下保护多模态推理的隐私框架
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
- arXiv
- 2610.01184
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 组件视觉
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出 PALS,用潜空间平滑防御全双工语音对话的对抗扰动
用 MMPIBench 评测多模态提示注入对 Agent 框架的影响
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出 AMS,用激活分离与方向相似度检测安全训练改动
AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示