审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
- arXiv
- 2610.09517
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
- 组件视觉
摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
分析潜空间图像水印对像素扰动的内在鲁棒性上限
摘要作者称当前潜空间水印在低 FPR 下受扩张映射与分布偏移的限制。
揭示安全路由评测在分布偏移下的虚假下限与选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出 RewardExplainer,用反事实偏好反馈学习奖励模型解释
RewardExplainer针对只输出标量的判别式奖励模型,训练一个可复用的自然语言机制解释器,并把解释接到偏差发现与 RM 微调上。
分析零训练 LLM+OVOD 流水线中 CAAP 与 SNAP 分离的来源
分析稀疏重叠下 LLM judge 与人类一致性的验证误差并规划重叠分配
这篇工作研究标注重叠很稀时,怎样验证 LLM judge 是否足以替代人类,并规划重叠该留多少、怎么分配。。部署前的标准做法是在校准集上比较 judge 与人类的一致性。
归纳开放式医学长答案检索核验的失败分类
这篇工作诊断开放式医学事实核验的 retrieve-then-verify 管线断在哪里,而不是提出新的核验器。
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。
因果审计视觉工具调用,分离观察贡献与动作诱发捷径
对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。