其他arXiv 2610.06452
研究者提出多模态安全评测应衡量可控性而非仅做分类
主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像
- arXiv
- 2610.06452
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- LlavaGuard-v1.2-7B-OV、Qwen3.5-9B
- 组件视觉
摘要四轴画像把读出与选择性控制分开。
作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。
主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像
作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。
提出任务感知的跨域蒸馏与剪枝方法以压缩音频深度伪造检测器
提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性
这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
提出 WebFovea,加固视觉网页智能体的解析、执行、反馈与观察往返
这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
形式化视频透视头显中系统截图与人眼视野的错配
综述自主渗透智能体的继承攻击、架构攻击及护栏缺口
这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。