审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
用 CLIP 相似度当安全 RL 的危险信号?审计发现它主要在量画面像不像提示词里的场景
论文对冻结 CLIP 安全分展开开环审计,发现其接触前偏离主要源于场景模板与视角,且恒定置信度仍能保留闭环增益。
- 冻结视觉语言模型常被用作安全强化学习的奖励或置信度信号,但策略回报与碰撞率无法区分该评分是感知到了危险,还是仅响应了与失败相关的场景特征。
- 采用不影响策略轨迹的开环审计协议,结合几何匹配、视角变换、文本空间几何分析与字幕重写,并在闭环训练中引入恒定置信度与轨迹回放对照组。
- 接触前偏离在危险物较远时更明显,无对比共模方向保留了73%的效应;在MetaDrive-Hard中固定置信度灾难率降至0.176,与部署组无检出差异。
- 第一人称视角的有效性仅见于FormulaOne,在其他环境不通用且未能建立预测规则;仅测试了三个评分器,且闭环实验仅覆盖单一环境与算法。
- 模型
- CLIP ViT-B/32CLIP ViT-L/14Qwen2-VL-7BPPO-LagrangianPID-LagrangianCPO
- 基准
- FormulaOneMetaDrive-HardCarButton1PointGoal1
- 指标
- 接触前偏离(pre-contact deviation)灾难率(catastrophe rate)违规率(violation rate)余弦相似度(cosine similarity)
爱荷华州立大学的 Samuel Tetteh 与 Cody Fleming 对冻结 CLIP ViT-B/32 的提示词边际安全分数做了受控审计,发现该分数在接触前约 20 步下降,但这一信号主要反映画面与提示词共同描述的场景是否相似,而非危险本身。研究用三个不含 VLM 的 FormulaOne 策略、180 个回合和 130 次孤立接触起始,将分数与策略解耦,并匹配危险几何、更换提示词、编码器和相机视角。结果显示,危险较远时偏差为 −1.37 个标准差,危险较近时为 −0.34 且区间包含零;仅沿提示词共同方向打分的无对比分数保留了 73% 的效应;否定安全提示词仍保留偏差,而无关场景提示词会反转方向。四个相机视角中只有第一人称视角出现显著偏差,且没有哪个视角在跨环境时始终有效。闭环实验中,把置信度固定为常数仍能降低灾难率,说明策略收益不能证明分数感知了危险。
推荐理由审计用被动观察者设计把 CLIP 安全分数与策略训练解耦,为判断视觉语言模型安全信号是否真的感知危险提供了可复用的检验方法。
深度解读
这篇论文试图解决什么问题?
评估冻结视觉语言模型在强化学习中提供的安全分数究竟反映了对危险的感知,还是仅测量了字幕库对应的场景模板与视角。
核心问题是冻结视觉语言模型构建的安全评分是否真正具备危险感知能力。
- 安全强化学习的信号依赖:在安全强化学习与自动驾驶中,研究者常将冻结视觉语言模型(VLM)输出的图文相似度转化为成本、奖励惩罚或置信度权重,以此减少人工设计反馈的依赖。
- 端到端指标的因果混淆:现有方法通常以训练策略的回报与碰撞率来评估信号有效性;但作者指出,即使评分仅响应其他与碰撞相关的场景特征,闭环策略指标同样可能改善,因此策略增益无法说明模型真正检测到了危险。
- 场景模板与危险感知的竞争假说:危险检测假说预期评分在危险物接近或正前方时偏离最强,且依赖描述碰撞的字幕;而场景模板假说预期评分反映画面脱离字幕库共享的“赛道赛车”预设场景,且与视角和通用方向相关。
- 开环审计与对照体系:作者提出了将安全评分与受训策略解耦的开环审计方案,通过几何匹配、视角变换、字幕几何消融与恒定置信度闭环对照,直接检验安全评分的度量实质。
有哪些相关研究?
涵盖冻结VLM训练信号、CLIP表征特性与字幕库、不完美信号优化保证及约束强化学习评测四大领域的研究。
论文在相关工作中梳理了四个领域的既有研究:
冻结视觉语言模型作为训练信号
- 用于奖励与安全约束:Rocamonde et al. (2024) 利用单句 CLIP 相似度训练人形机器人,Sontakke et al. (2023) 与 Fan et al. (2022) 将视频语言模型用于奖励致密化;Huang et al. (2025) 以及 Tetteh & Fleming (2026) 将 CLIP 相似度引入安全强化学习与对偶变量。作者指出,这些工作通过最终策略的回报或碰撞率评判信号,无法区分真正的感知与偶发相关性。
- 自然语言约束解析:Yang et al. (2021) 针对约束强化学习解释文本约束。作者指出其解释器依据环境成本训练,而本文研究的信号属于冻结模型,未针对观察映射做过适配。
字幕库机制与 CLIP 编码特性
- 概念匹配与分布外检测:Ming et al. (2022) 在零样本分布外检测中将图像与概念库比对,测定画面与已知概念的最大匹配度。作者指出本文安全评分的实际行为符合该领域规律。
- CLIP 词袋与多视角局限:Mert Yuksekgonul et al. (2023) 提出 CLIP 表现类似词袋模型;Alhamoud et al. (2025) 指出其对否定不敏感;Tong et al. (2024) 发现其将视觉相异图像映射至邻近嵌入;El Banani et al. (2024) 揭示其多视角一致性较差。
信号优化与感知误差保证
- 代理指标退化与控制论保证:Gao et al. (2023) 刻画了优化不完美代理信号导致的性能退化;Dean et al. (2020) 在控制论鲁棒屏障函数中对感知误差进行显式保证。作者指出,本文被审计的提示词边际评分无法提供此类控制论证书所需的状态估计或误差界。
对比基线与评测环境
- 实验基线与基准平台:论文在 FormulaOne、MetaDrive 以及 Safety-Gymnasium(CarButton1、PointGoal1)环境中开展评测;对比基线包括无 VLM 的受约束强化学习基线(PPO-Lagrangian、PID-Lagrangian、CPO)、无文本嵌入基线(k-NN、马氏距离、PCA 残差、随机网络蒸馏 RND)、随机向量方向以及图像底层统计量(像素方差、边缘密度)。
定位差异:作者强调本文在优化介入之前分离评估代理评分的测量机制,直接检验安全评分究竟携带何种状态信息。
论文如何解决这个问题?
构建被动观察的开环事件研究协议,通过几何匹配、视角控制、文本几何解构与字幕重写隔离评分的度量机制。
作者提出无干扰开环审计协议,使冻结模型作为被动观察者评估未见过该分数的策略轨迹,隔离评分机制与策略响应。
评分器构建与形式化定义
- 输入预处理与精度设定:模拟器渲染分辨率为 256×256,CLIP 经由双三次插值调整为 224×224;采用 fp32 精度,因为论文指出 fp16 会将相似度截断至约 17 个离散值。
- 边际分数定义:提示词边际分数定义为 m = s+ − s−,表示图像嵌入与安全字幕组平均余弦相似度减去危险字幕组平均余弦相似度。
- 置信度输出计算:部署的置信度转换公式为 κ = |2σ(a(m − c)) − 1|,其中缩放参数设为 a = 100 且中心阈值设为 c = 0。
开环事件研究与几何匹配协议
- 接触发生点界定:将经历至少 20 步无接触历史后环境成本从 0 转为正值的起始转换点定义为接触发生点。
- 滞后步数窗口分析:分析接触前 -40 步至接触后 +10 步的信号轨迹,重点汇总接触前 -15、-10、-5 步的偏离值;每个接触点与同回合内无接触伪点对比,并在回合内标准化。
- 非参数几何匹配设计:构建几何网格单元,匹配最近危险物的绝对距离、方位角、前方 ±45° 锥体内的前方距离以及最小碰撞时间,以此控制障碍物几何接近度对信号的影响。
字幕语义与文本空间几何控制
- 全排列组合检验:对 8 条字幕的所有 70 种对半平衡划分进行穷举计算,检验部署划分在偏离幅度上的分位数排名。
- 共模方向与文本几何:定义不设正负分组的全体字幕均值方向评分;在文本嵌入空间中测定安全与危险字幕组的组内、组间及质心余弦相似度。
- 三组文本重写对比:设计否定改写(断言安全字幕的反面)、荒谬改写(保持赛车主语但谓词荒谬)以及离题改写(替换为无赛车无轨道的完全无关主题),检验模型响应的是命题真假还是场景主题。
多视角渲染与生成式模型对照
- 固定物理状态多视角渲染:保持模拟器底层状态、动作序列与接触事件完全一致,通过第一人称视点、后随跟随视点、近处俯视视点与远处俯视视点生成画面。
- 生成式模型概率提取:引入 Qwen2-VL-7B,通过单字 yes/no 提问模板提取最终位置 next-token logits 的 log-sum-exp 计算类别概率,并计算两组概率均值之差。
论文做了哪些实验?
涵盖开环几何匹配、跨视角渲染、字幕几何消融与闭环置信度对照,表明信号源于场景偏离而非障碍物感知。
实验设置
- 被测模型:视觉评分器包括 CLIP ViT-B/32、CLIP ViT-L/14 与 Qwen2-VL-7B;策略模型包括 PPO-Lagrangian、PID-Lagrangian 与 CPO(共 10 个策略)。
- 数据集与基准:涵盖 FormulaOne(180 回合,130 个孤立接触点)、MetaDrive-Hard(600 回合,416 个孤立接触点)以及 Safety-Gymnasium 的 CarButton1(506 个接触点)和 PointGoal1(156 个接触点)。
- 对比基线:无 VLM 基线、无文本特征基线(k-NN、马氏距离、PCA 残差、RND)、随机嵌入方向、图像底层统计量(像素方差、边缘密度)、恒定置信度与跨回合置信度回放。
- 评测指标:以回合内标准差标准化的接触前偏离(Δ)、灾难率(catastrophe rate)、违规率(violation rate)、成本回报与奖励回报。
- 评审与统计检验:开环下采用基于回合聚类的自举置信区间(episode-cluster bootstrap),闭环下采用基于种子的双侧置换检验。
- 样本量与重复次数:闭环实验中每种子评估 200 个确定性回合(无 VLM 组与部署组各 10 种子,恒定组与回放组各 15 种子)。
主结果
表格较宽,可左右滑动
评分器 字幕配置 安全组偏离 危险组偏离 边际偏离 重抽样排除零比例 CLIP ViT-B/32 8条字幕库 -0.527* -0.233 -0.845* 27.5/100% CLIP ViT-L/14 8条字幕库 +0.141 +0.842* -0.711* 100/100% CLIP ViT-B/32 2条组标签 -0.176 +0.394* -0.690* 未报告 Qwen2-VL-7B 2条组标签 -0.410* +0.229 -0.350* 51/86.5% Qwen2-VL-7B 8条字幕库 -0.592* +0.293* -0.524* 72/99% (注:据 Table 2,* 表示 95% 置信区间排除零,最后一列为 200 次伪点重抽样中危险组与边际区间排除零的占比)
- 危险组得分上升依赖文本分离度:作者称,ViT-B/32 在 8 条字幕下危险组得分并未上升,只有在更换为分离度更高的 2 条组标签或换用 ViT-L/14 时危险组得分区间才排除零。
- 边际下降在所有配置中均存在:作者指出,无论对比式还是生成式评分器,提示词边际分数在接触前均出现负向偏离。
- 生成式评分器的稳定性差异:作者报告,Qwen2-VL-7B 危险组区间排除零的重抽样比例在两种字幕配置下分别为 51% 和 72%,低于 ViT-L/14 的 100%。
几何分层与非参数匹配分析
- 测试内容:在 3 个记录了几何信息的策略上,按危险物最近距离三分位及正前方 ±45° 锥体内是否存在障碍进行分层检验。
- 实验结果:最近危险物处于最远三分位(d > 0.93)时偏离为 -1.369 [-1.785, -0.958],最近三分位(d < 0.62)时仅为 -0.342 [-1.065, +0.334] 且包含 0(Table 6);前方无危险物时偏离为 -1.797 [-2.402, -1.204],前方有危险物时为 -0.786 [-1.238, -0.341](Table 6);5 种几何匹配下偏离在 -0.131 至 -0.153 之间(Table 4)。
- 作者解读:作者指出,偏离幅度在障碍物较远且前方无物时反而更强,与危险检测假说完全相反,说明信号源于场景偏离而非障碍物临近。
跨环境多视角与因果呈现测试
- 测试内容:在 FormulaOne、CarButton1 与 PointGoal1 中通过 4 个视角渲染相同物理轨迹,并在 PointGoal1 中将危险物半高从 0.01 提高到 0.30 进行因果呈现测试。
- 实验结果:FormulaOne 仅第一人称视角显现偏离(-0.447),CarButton1 在 4 视角中的 3 个显现偏离,PointGoal1 仅俯视视角显现偏离(近俯视 -0.580,第一人称 -0.001)(Table 1);抬高危险物高度后,第一人称相比俯视的优势变化仅为 -0.084 [-0.387, +0.228](第 5.3 节)。
- 作者解读:作者称,没有单一视角在跨环境中始终具备信息量,且因果提升危险物可见性并未改变视角优势,说明有用信号高度依赖观察映射。
闭环策略表现与恒定置信度对照
- 测试内容:在 MetaDrive-Hard 中使用 PPO-Lagrangian 训练策略,对比无 VLM 基线、实时 CLIP 部署组、固定置信度组(κ = 0.850)与跨回合置信度回放组(yoked)。
- 实验结果:固定置信度组灾难率为 0.176,相比无 VLM 基线的 0.281 降低了 0.106(p = 0.036);部署组灾难率为 0.192,固定组与部署组差异仅为 0.016 且无检出差异(p = 0.71)(Table 7)。
- 作者解读:作者指出,固定置信度组的降幅低于最小可检测效应(0.133);安全增益无需逐帧视觉置信度即可出现,说明策略指标改善不能作为评分器感知到危险的证据。
其他消融与分析
- 字幕共模方向:仅使用 8 条字幕的均值方向打分保留了部署边际偏离的 73%(Table 5)。
- 字幕划分穷举:在全部 70 种平衡划分中部署划分排第 3 位(p = 0.043),均值划分偏离为 -0.113(Table 5)。
- 否定与离题字幕:否定安全字幕偏离为 -0.507,荒谬字幕为 -0.363,离题字幕反转为 +0.441(Table 10)。
- 无文本嵌入基线:k-NN 偏离为 +0.227,马氏距离为 +0.029,PCA 残差为 -0.066,RND 误差为 +0.027(附录 E.6)。
- 图像统计量:平均像素方差偏离为 -0.532,平均边缘密度偏离为 -0.668,与边际分数的差异未检出统计差异(附录 E.6)。
- MetaDrive 运动轨迹消除:移除 60 步历史运动轨迹后,带偏离变化为 +0.082 [-0.029, +0.193](第 5.3 节)。
负面结果与例外
- 在 CPO 算法训练的两个策略中(27 个回合),第一人称接触前偏离未检出统计偏离,置信区间跨越零(第 5.2 节)。
- 在 MetaDrive 的顶视渲染中,测试的 51 个滞后步中均未检出接触前偏离(第 5.3 节)。
- 在 ViT-L/14 的近处俯视视角中,κ 出现区间排除零的符号反转,而边际分数区间包含零(第 5.2 节)。
有什么可以进一步探索的点?
作者指出了单视角规律不具普适性、评分模型数量有限及闭环覆盖窄等局限,后续可拓展多模型与多环境验证。
作者指出的局限与后续方向
- 第一人称视角的有效性特定于单环境:作者指出第一人称偏离仅在 FormulaOne 中出现而在其他两个环境未复现,且论文未能给出预测何种渲染具有信息量的理论模型(第 7 节与附录 G)。
- 测试的评分模型数量较少:作者指出仅对比了两个对比式模型和一个生成式模型(Qwen2-VL-7B),不足以广泛刻画生成式 VLM 家族的通用特性(第 7 节与附录 G)。
- ViT-L/14 近处俯视反转现象未得解释:作者指出更大规模的 ViT-L/14 编码器在近处俯视视角下出现的符号反转现象仍缺乏机理解释(第 7 节与附录 G)。
- 字幕改写与分层基于单视角与单次抽样:作者指出字幕重写与划分测试仅在 ViT-B/32 的第一人称视角下进行,且参考点基准每回合仅单次抽样(附录 G)。
- 相机变换受制于单一渲染引擎:作者指出四相机测试均在三个 MuJoCo 任务中开展,视角变化与渲染风格及危险外观存在混淆(附录 G)。
- 闭环验证覆盖范围较窄:作者指出闭环实验仅覆盖单一环境(MetaDrive-Hard)、单一强化学习算法(PPO-Lagrangian)和单一伪对照族(第 7 节与附录 G)。
实验覆盖范围
- 被测评分器与策略模型:视觉评分器包括 CLIP ViT-B/32、CLIP ViT-L/14 与 Qwen2-VL-7B 共 3 个;强化学习算法测试了 PPO-Lagrangian、PID-Lagrangian 与 CPO 共 3 类。
- 覆盖评测任务环境:实验覆盖 FormulaOne、MetaDrive-Hard 以及 Safety-Gymnasium 的 CarButton1 和 PointGoal1 共 4 个任务环境。
- 相机视角设置:FormulaOne、CarButton1 与 PointGoal1 均在第一人称、后随、近处俯视与远处俯视 4 个视角下完成对照渲染;MetaDrive 仅测试了默认的顶视渲染。
- 闭环对照规模:闭环实验包含 4 个分支(10 或 15 个种子),每个种子在 200 个确定性回合上评估。
- 论文未报告的信息:论文未测试 ViT-L/14 与两条标签组合的表现,未报告 ViT-B/32 两标签行的 200 次重抽样结果,且未对几何分层各组间的数值差异进行形式化统计检验。
总结一下论文的主要内容
论文审计了冻结VLM安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
- 核心研究问题:现有安全强化学习常将冻结 CLIP 计算的图文相似度作为成本或置信度信号,并以策略碰撞率下降作为有效性依据;本文探究该安全评分究竟是感知到了具体危险,还是仅响应了与失败相关的场景特征。
- 开环审计与多维控制设计:作者设计了与策略解耦的被动观察开环协议,结合非参数几何匹配、四相机多视角渲染、字幕全排列与改写、文本嵌入空间几何测定,并在闭环训练中设置固定置信度与轨迹回放对照组。
- 几何反转与共模方向主导:在 FormulaOne 中,最近危险物处于最远三分位时的接触前偏离达 -1.369,而处于最近三分位时仅为 -0.342 且区间包含 0(Table 6);仅依赖 8 条字幕共有方向的无对比评分保留了部署边际偏离的 73%(Table 5),否定安全字幕同样呈现出 -0.507 的负向偏离(Table 10)。
- 文本分离度决定危险组变化趋势:在 ViT-B/32 编码器中,由于安全与危险字幕组间平均余弦相似度达 0.883(Table 9),两组得分在接触前共同下降;更换为分离度更高的 2 条组标签或 ViT-L/14 后,危险组得分区间才排除零(Table 2)。
- 闭环增益脱离逐帧视觉感知:在 MetaDrive-Hard 闭环实验中,将置信度固定为常数 0.850 时灾难率降低至 0.176,与部署实时评分的 0.192 相比无检出差异(p = 0.71,Table 7)。
- 作者结论与启示:作者指出安全评分反映的是画面脱离字幕库描述的“赛道赛车”场景模板而非具体危险物感知;策略改进并不等同于具备危险感知能力,未来的 VLM 安全信号必须作为测量工具而非语义真实基准来进行严格验证。