审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
论文对冻结 CLIP 安全分展开开环审计,发现其接触前偏离主要源于场景模板与视角,且恒定置信度仍能保留闭环增益。
- 73%FormulaOne无对比共模方向保留提示词边际偏离的比例(Table 5)
- -0.447FormulaOne以ViT-B/32在第一人称视角下的接触前偏离(Table 1)
- 0.883ViT-B/32文本空间中安全与危险字幕组间平均余弦相似度(Table 9)
评估冻结视觉语言模型在强化学习中提供的安全分数究竟反映了对危险的感知,还是仅测量了字幕库对应的场景模板与视角。
涵盖冻结VLM训练信号、CLIP表征特性与字幕库、不完美信号优化保证及约束强化学习评测四大领域的研究。
构建被动观察的开环事件研究协议,通过几何匹配、视角控制、文本几何解构与字幕重写隔离评分的度量机制。
涵盖开环几何匹配、跨视角渲染、字幕几何消融与闭环置信度对照,表明信号源于场景偏离而非障碍物感知。
作者指出了单视角规律不具普适性、评分模型数量有限及闭环覆盖窄等局限,后续可拓展多模型与多环境验证。
论文审计了冻结VLM安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。