其他arXiv 2610.06452
研究者提出多模态安全评测应衡量可控性而非仅做分类
主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像
- arXiv
- 2610.06452
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- LlavaGuard-v1.2-7B-OV、Qwen3.5-9B
- 组件视觉
摘要四轴画像把读出与选择性控制分开。
作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。
主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像
作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。
提出任务感知的跨域蒸馏与剪枝方法以压缩音频深度伪造检测器
提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性
这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
形式化视频透视头显中系统截图与人眼视野的错配
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
综述视觉内容全生命周期中的所有者侧对抗防护方法
Adversarial attacks for good 是一篇视觉内容所有者侧保护的综述:把长期作为攻击来研究的扰动和结构化信号,反过来交给数据所有者、创作者、平台或审计方使用。