FearCaut-Qwen:激活引导改变视觉语言模型的风险判定标准
FearCaut-Qwen: Affective Steering in a Vision-Language Model Shifts the Decision Criterion for Hazard Assessment
恐惧转向使Qwen2.5-VL、SeisMLLM-1K的Red recall从0.270升至0.757,作者称靠移准则。
- 灾后建筑评估中的VLM常不愿宣布隐患。作者复现的管线在SeisMLLM-1K上只对27.0%的真实不安全建筑给出Red且无假Red,并认为决策准则过保守。
- FearCaut-Qwen在去污染的FindingEmo场景上定位恐惧方向,留出数据上用敲除和转向验证后冻结,再注入两阶段评估的前向激活,并用信号检测论分开d′与c。
- 恐惧α=+0.5使Qwen2.5-VL在SeisMLLM-1K上Red recall从0.270升至0.757,c从+1.354到−0.161,d′降至1.028。随机与快乐方向未复现,主效应在感知阶段。
- 作者指出仅一个骨干、一个情感语料和一个建筑基准,测试集65例且Red偏多,结构对照只有五次且不在α=0.5。悲伤没有可用的分布式强度,效价与唤醒也未按设计分开。
- 被测模型
- Qwen/Qwen2.5-VL-7B-Instruct
- 基准
- SeisMLLM-1KFindingEmo
- 指标
- Red recalld′cmacro-F1accuracybalanced accuracy
研究以信号检测论把视觉语言模型在灾害损伤评估中的决策行为拆分为感知能力与判定标准,并尝试用情绪相关的激活引导修正其过度保守的判定策略。作者在基于 Qwen2.5-VL-7B-Instruct 的两阶段 SeisMLLM 流程上测试:该流程在 SeisMLLM-1K 测试集上只标记出 27.0% 真正不安全的建筑,判定标准 c=+1.354,且从不误报红色,而证据质量并不差(d'=1.521)。作者先在情绪丰富的自然场景中定位出一个与情绪因果相关的回路,用稀疏神经元敲除和分布式引导在留出的情绪数据上验证,再把该方向注入建筑任务。注入恐惧方向后红色召回率升至 75.7%(p<0.001),减去同一方向则完全抑制红色预测,而范数匹配的随机方向和匹配的快乐方向均无显著效果。
深度解读
这篇论文试图解决什么问题?
VLM不愿把建筑判Unsafe,作者认为是准则过保守,而不是看不出损伤。
VLM在灾后建筑评估中不愿宣布隐患,作者认为症结是决策准则过保守,而不是分不清损伤。
- 场景:震后检查等任务已用VLM按ATC-20-1把多视角照片变成安全告示。作者认为漏报隐患的代价高于一次多余检查。
- 已有报告:作者引SeisMLLM安全评估准确率66.13%,但本文复现只对27.0%的真实不安全建筑给出Red,且从不误报Red。引言另引零样本隐患召回:Claude-3 Opus 0.288、GPT-o3 0.326,以及已部署智能体漏检28%真实隐患。
- 假设:作者怀疑模型能分开不安全与非不安全,只是宣布隐患前要求的证据过多;并问恐惧相关表征能否被因果操控,从而改变该倾向。
- 提出的方法:FearCaut-Qwen在Qwen2.5-VL-7B-Instruct中定位恐惧/威胁回路,推理时做激活转向,再用信号检测论把行为拆成辨别力d′和准则c。作者称分类指标单独使用时,无法区分更会看损伤和更愿意报Red。
有哪些相关研究?
作者把缺口放在:已验证的情感回路能否改变无关工程任务的决策准则。
作者将文献分成人类情绪如何进入安全判断,以及模型内部表征如何被定位和转向;差别被放在跨任务的准则迁移上。
情绪与安全判断
- 恐惧与风险寻求:Lerner与Keltner报告恐惧使人更谨慎、更规避风险,愤怒和快乐则提高控制感并更寻求风险。Wake等的元分析把恐惧与更少的风险决策、更高的风险估计联系在一起。
- 两类机制:Tipples以及Ngai与Jin用漂移扩散模型把恐惧拆成证据加工速率和决策谨慎。作者称这对应本文对辨别力与准则的分离。
- 作者称并不普遍:作者转述Dong等,高功效实验中偶然情绪未显著改变风险偏好,因而需要在模型上检验。Chong等在工地隐患实验中报告负性情绪会改变评估表现。
可解释性与转向
- 特征与因果:Olah等把计算拆成特征和回路,Elhage等把干预写成对残差流的加法,Geva等把前馈坐标读成键值记忆。Meng等编辑事实关联,Templeton等提取稀疏特征。作者转述Neo等:删去物体相关视觉token后,物体识别准确率下降超过70%。
- 推理时加方向:Li等、Rimsky等和Konen等在前向中加入对比方向,不改权重而改变高层行为。VLM上已有SteerVLM、AutoSteer、视觉–语言–动作转向,以及Wang等对头和神经元的归因。作者称这些工作指导了本文的转向设置。
- 模型里的情绪:Tigges等报告情感占据单一线性方向;Lee等、Zhao等报告去掉选定神经元会选择性损害情绪预测;Tak等、Wang等定位并调制情绪回路。Broekens等报告无专门情感训练时也可出现效价、唤醒和评价加工。
数据与实验对照
- 语料:建筑侧为公开SeisMLLM-1K。情绪侧选FindingEmo;作者提到AffectNet、RAF-DB、EmoSet多围绕面孔或单物体,而目标任务是全场景感知。
- 对照:未转向的两阶段复现、范数匹配的随机方向、同样构造的快乐方向,以及同K、同层、同激活幅度和打乱标签的稀疏对照。
作者称既有转向多在被控任务内部取控制信号;本文要检验的是,另一任务上验证并冻结的恐惧方向,能否改变无关的工程安全判定,以及变化来自准则还是辨别力。
论文如何解决这个问题?
FearCaut-Qwen先在去污染场景上冻结恐惧方向,再注入两阶段建筑评估。
FearCaut-Qwen先在不含结构损伤的自然场景里定位恐惧/威胁回路,留出验证后冻结,再注入复现的两阶段建筑评估;信号检测论用来区分准则移动和辨别力变化。
决策形式化
- 类别:Red/Unsafe为信号,Green或Yellow为噪声。命中是真实Red被判Red,虚报是非Red被判Red。
- 定义:辨别力与准则为 d′=Φ−1(H)−Φ−1(F) 与 c=−1/2[Φ−1(H)+Φ−1(F)]。d′是两类内部证据分布的分离,c是相对中点的反应边界;c大于0表示更保守。
- 边界处理:率取0或1时,对命中和虚报对称做Hautus校正。|Δd′|不超过0.10且|Δc|大于0.10,才记为准则移动且辨别力未变;否则写明主导分量。
两阶段管线
- 骨干:Qwen/Qwen2.5-VL-7B-Instruct,28层,隐藏宽度3584,SwiGLU中间宽度18944。不微调,主实验贪心解码。
- 感知:同一案例的图像进入一个提示词,视觉token预算4096,每图64至1280。已发表指令上追加输出模式和两个train-fit单图示例,种子37固定。新token上限1024。输出六字段剖面。
- 推理:对train-fit做BM25、BGE-en-v1.5与类别一致分检索,权重0.60、0.30、0.10,取3例;测试案例不入库。规则库为23条ATC-20-1指导的重构。一条确定性参考规则与标签的一致率为train-fit 86.9%、验证85.1%、测试81.5%,只辅助检索和回路分析。
- 判定:主决策是三条完整告示字符串的序列对数似然,经softmax取argmax。自由生成以256 token预算记录,不作主判定。仅推理转向时,Stage-1文本、剖面、检索结果和上下文逐字节固定。
情绪源
- 抽样:24个Plutchik叶映成快乐、悲伤、恐惧/威胁、中性。13029条索引按种子37每类抽900,下载2457张。
- 去污染:61词关键词、open-CLIP ViT-B-32禁止概念概率0.25、感知哈希。不用Qwen过滤。20张感知重复、671张未过语义筛,留下1766张,与目标图像无匹配。排除率:恐惧/威胁45%、悲伤41%、快乐7%、中性17%。
- 划分:平衡为1404张。发现集每类211,选择验证与留出测试各每类70。排名和方向只来自发现集,K与强度只在选择验证集上定。
- 标注未按设计分开:恐惧/威胁效价−1.82、唤醒3.41,悲伤−2.16、3.75。唤醒的Welch t=−2.74,p=0.006,d=−0.20。作者称后续两类差异不能归因于刺激集的唤醒差。
回路与转向
- 层带:最后一条提示词token上做探测;层0为机会水平。验证集取高分八层中的最长连续段,得到22–24层。
- 稀疏神经元:门控后、下投影前的坐标。四个选择器经Borda合并,K在32、64、128、256、512中按验证集平衡准确率冻结:恐惧256、快乐128、悲伤256。
- 方向:层22–24上目标类减中性类的残差均值。α以该方向范数为单位。作者给出残差范数约244至391、方向范数33至59。256个恐惧神经元里只有51个在22–24层,其余分布到17–27层。
- 可用性:目标特异性指数大于1、目标召回下降至少0.05,且大于匹配对照,才算稀疏必要性。平衡准确率须不低于基线的85%且不低于0.519,目标类预测不超过80%。恐惧冻结α=±0.5,快乐α=+0.5;悲伤无可用分布式强度。接触测试集前冻结电路记录。
对照与检验
- 对照:同K随机神经元、层计数匹配的随机神经元、同层激活幅度±10%匹配、打乱标签后重跑选择;分布式对照为范数相同的各向同性随机方向。特异性审计每类20次。
- 目标实验:65例上比较基线、恐惧α=±0.5、随机方向、稀疏s=2与s=0、层匹配对照,以及快乐α=+0.5。提示词、检索、规则、候选串和解码跨条件相同。
- 统计:配对案例bootstrap 10000次,事件聚类bootstrap 1000次,McNemar精确检验,24项macro-F1比较做Benjamini–Hochberg(FDR 0.05)。种子37。另用200个train-fit案例、固定已发表剖面,比较恐惧稀疏集与不安全决策集、损伤严重度集的重叠。
论文做了哪些实验?
恐惧α=+0.5把Red recall从0.270提到0.757,Δc=−1.515,随机与快乐方向未复现。
实验设置
- 模型与判定:被测模型只有Qwen/Qwen2.5-VL-7B-Instruct,不微调,主实验贪心解码。BGE-en-v1.5做检索嵌入,open-CLIP ViT-B-32做去污染。没有外部裁判;告示由同一模型对三条候选的对数概率决定。
- 数据:SeisMLLM-1K公开测试集n=65(Green 17、Yellow 11、Red 37)。公开训练集再划出验证后为train-fit 1039、验证202。情绪留出集n=280。
- 条件:主基线是few-shot两阶段复现。转向为恐惧α=±0.5、快乐α=+0.5、范数匹配随机方向、稀疏s=2与s=0、层匹配对照,以及仅感知、仅推理。
- 指标:准确率、macro-F1、平衡准确率、Red recall、Red假阴性率、d′、c,以及Brier和期望校准误差。SDT以Red对非Red计算。
- 重复:配对案例bootstrap 10000次。八次独立基线在65例上预测相同。情绪探测区间为留出集2000次bootstrap。第3.14节写了1000次事件聚类bootstrap,结果节未给出数值。
主结果
Table 1的few-shot基线:准确率0.400(95% CI [0.277, 0.523]),macro-F1 0.382,Red recall 0.270,Red精确率1.000,d′=1.521,c=+1.354。oracle剖面的准确率0.692、Red recall 0.622、d′=2.416,c仍为+0.907。零样本Red recall为0.000,c=+2.168。第4.4节写恐惧正向转向后Red recall为0.757,摘要写作75.7%。
据Table 3(n=65配对;基线预测35/20/10,真实17/11/37):
| 条件 | ΔRed recall | p | Δd′ | Δc | 预测G/Y/R | | 恐惧α=+0.5 | +0.486 | <0.001 | −0.493 | −1.515 | 13/14/38 | | 恐惧α=−0.5 | −0.270 | <0.001 | −1.628 | +0.814 | 50/15/0 | | 随机方向α=+0.5 | +0.054 | 0.457 | −0.599 | −0.450 | 30/21/14 | | 稀疏放大s=2 | +0.027 | 0.873 | −0.409 | −0.281 | 37/16/12 | | 稀疏敲除s=0 | +0.027 | 0.809 | −0.409 | −0.281 | 34/19/12 | | 层匹配对照 | −0.027 | 0.829 | −0.081 | +0.040 | 42/14/9 |
- 作者的机制解读:第4.5节给出正向转向后的绝对位置:c从+1.354到−0.161,d′从1.521到1.028,|Δc|/|Δd′|=3.1。作者称这是准则杠杆,没有提高对损伤的分离。24个macro-F1比较里只有1个通过Benjamini–Hochberg校正;作者称macro-F1增加0.174部分来自测试集Red占37/65、把过保守准则移向更常报Red。
- 与外部门槛:Figure 9文中报告,只扫基线的候选概率,Red recall可从0.27到1.00,macro-F1在发出32个Red时达到0.453。扫到同样38个Red时,外部门槛macro-F1为0.376、d′=0.529、c=−0.178;内部恐惧方向为0.556、d′=1.027、c=−0.161。作者称两条路线的准则接近,但阈值化损失更多辨别力。
- 对照与改判:作者称随机方向的Red recall置信区间含0,扰动幅度本身不能可靠复现该效应;摘要将该p写作0.46,Table 3为0.457。第4.4节恐惧ΔRed recall的区间为[+0.306, +0.667],Table 3四舍五入为[+0.31, +0.67]。正向转向改写40/65个告示,38个朝更严重,含15个Green到Red、14个Yellow到Red、9个Green到Yellow,另有2个反向。作者称这也会把真实非Red改成Red。
阶段分解
- 测了什么:恐惧α=+0.5分别只加在Stage 1,或只加在逐字节固定的Stage-2上下文上,65例核对哈希。
- 结果:Table 4中,仅感知ΔRed recall=+0.459(95% CI [+0.278, +0.634],p<0.001),占全流程94.4%,Δd′=−0.480,Δc=−1.428,Δmacro-F1=+0.116(p=0.083)。仅推理ΔRed recall=+0.027(p=0.743),占5.6%,Δd′=+0.077,Δc=−0.038。
- 作者解读:作者称阈值移动发生在把图像写成工程剖面时,而不是固定证据之后的规则推理。正向使危害严重度秩均值从5.02到6.57,负向也从5.31到6.60,决策方向却相反;47例双侧可解析案例中,严重度变化与序数决策变化的相关为+0.308。建造类型一致为27/65。
特异性、源域因果与回路重叠
- 跨情绪:α=+0.5的快乐方向使Red recall变化+0.027(p=0.84),macro-F1变化+0.006(p=0.94)。稀疏家族中恐惧、快乐、悲伤的Red recall变化为+0.027、+0.000、−0.027。作者称没有可用的悲伤分布式强度,故不能把恐惧与一般负效价完全分开。
- 源域:留出集n=280,未干预平衡准确率0.657、macro-F1 0.641。Table 2:恐惧全敲除的目标召回下降0.129,其他类平均变化−0.005,TSI=27.0;快乐下降0.086、TSI 18.0,悲伤下降0.057、TSI 3.0。留出图像上,恐惧α=+0.5使预测为恐惧的比例增加0.457,α=−0.5减少0.079,随机方向增加0.086。验证集上α=+1.0与+2.0把平衡准确率从0.611降到0.339和0.368,被可用性规则拒绝。
- 零分布与重叠:四类源域对照各20次,敲除效应+0.129超出各自95%经验区间;每次经验p=0.048,80次合并均值+0.0045、p=0.012。α=1.0的五次结构随机方向:零均值+0.038、最大+0.108,观察到的目标效应+0.622,p=0.167。恐惧与不安全决策重叠1个神经元,期望1.15(p=0.686);与损伤严重度重叠0(p=1.000);两套结构集重叠4个,为机会的3.47倍(p=0.029)。作者称稀疏恐惧单元不携带迁移,迁移由残差流方向携带。
其他消融与分析
- 层0平衡准确率0.250,层22为0.714(95% CI [0.660, 0.767]);得分最高层召回:中性0.700、快乐0.800、悲伤0.729、恐惧/威胁0.629。效价R²在层22为0.729,唤醒在层26为0.297。
- 选择器两两Jaccard为0.000至0.030;恐惧bootstrap Jaccard为0.588±0.033,123/256个神经元出现在至少80%的重抽样中;五折一致为0.203。验证集对K不敏感:恐惧0.654至0.675。
- 基线各类精确率/召回/F1:Green 0.343/0.706/0.462,Yellow 0.200/0.364/0.258,Red 1.000/0.270/0.426。成功解析的33例准确率0.394,其余32例0.406。
- 多类Brier从oracle的0.416到few-shot的0.926,期望校准误差从0.132到0.334。
- 所报告条件的Stage-1触顶率为1.5%至4.6%,基线1.5%。快乐α=−1.0和悲伤α=±1.0使75%至89%的Stage-1输出触及token上限,作者排除出机制解释;正向悲伤方向在验证集饱和到0.986至1.000。
- 负向转向在Red recall降到0.000的同时Δd′=−1.628。作者称相近幅度的随机扰动可以损害表征,却不必同等移动决策边界。
有什么可以进一步探索的点?
作者指出结果限于一个骨干、一个情感语料和一个建筑基准。
作者指出的局限与后续方向
- 范围(第5.3节):只用一个骨干、一个情感语料和一个建筑基准。作者称这只确立该系统中存在可控准则,尚未声称普遍,并鼓励换第二个骨干、第二个全场景情感语料,以及飓风、火灾、洪水等已有VLM管线的非地震隐患,再测本次没能检验的情感轴。
- 其他潜在因素(第5.3节):作者认为同一套定位–验证–冻结–迁移流程也可用于紧迫、权威、乐观、疲劳或人口统计刻板印象,这些因素原则上可能在不改变证据质量时移动工程决策准则。
- 功效(第5.3节):公开测试集65例且Red偏多。配对和事件聚类bootstrap能减小但不能去掉不确定性;24个macro-F1比较只有1个通过多重校正。作者因此把论点放在较大的双向准则变化和阶段定位上,并称macro-F1增益部分是机械的。
- 对照不匀(第5.3节):源域特异性来自四组20次零分布;结构零分布只有五次,且评估在α=1.0而不是α=0.5。作者还指出训练与测试的地震事件重叠来自所保留的公开划分,并希望有更大、事件不相交的基准。
- 机制路径(第5.3节):阶段结果、稀疏与分布式的分离以及集合重叠约束了解释,但重叠是关联的,没有追踪因果路径。作者把激活修补、头级归因、同层比较,以及用稀疏词典分解转向方向,列为下一步。
- 悲伤对照未完成(第3.6.1、4.7节):作者称恐惧与悲伤在留存标注上并未按高唤醒对低唤醒分开,后文差异不能归因于唤醒;又因悲伤没有通过可用性规则的分布式强度,不能完成两个负效价类的匹配分布式比较。
实验覆盖范围
- 被测VLM为Qwen/Qwen2.5-VL-7B-Instruct;建筑结果来自公开SeisMLLM-1K测试集65例,情绪确认来自FindingEmo留出集280张(第3.2、3.4、3.6、4.1节)。
- 源类包含快乐、悲伤、恐惧/威胁和中性;冻结后迁到建筑任务的分布式强度是恐惧α=±0.5和快乐α=+0.5(第3.12、4.3节)。
- 目标侧比较了双向恐惧方向、范数匹配随机方向、稀疏放大与敲除、层匹配对照,以及仅感知和仅推理(Table 3、Table 4)。
- 源域四类对照各独立抽样20次;另有α=1.0的五次结构随机方向(第4.7节)。告示由同一模型的强制候选对数概率判定,论文未报告独立裁判,也未报告与人工判分的一致性。
- 第3.14节写了1000次按地震事件的聚类bootstrap,结果节未给出该分析的数值。八次独立基线在全部65例上预测相同(第3.13节)。
总结一下论文的主要内容
冻结的恐惧方向在推理时左移Unsafe准则,Red recall升至0.757,辨别力下降。
FearCaut-Qwen在推理时调整Qwen2.5-VL-7B宣布建筑Unsafe的意愿,而不更新权重。
- 要解决的问题:复现的两阶段管线在SeisMLLM-1K公开测试集65例上,Red recall为0.270,Red精确率为1.000,d′=1.521,c=+1.354。作者认为证据已经能分开不安全与非不安全,边界却放得过远。
- 做法:在去污染的FindingEmo全场景图像上估计恐惧方向,用稀疏敲除和分布式转向在留出情绪数据上确认,冻结后再注入建筑任务的前向激活。SDT把每次行为变化拆成d′和c。主判定是三条告示候选的对数概率,而不是自由文本。
- 主要结果:恐惧α=+0.5使Red recall升至0.757(p<0.001),c移到−0.161(Δc=−1.515),d′降到1.028(Δd′=−0.493)。减去同一方向后Red recall为0.000。范数匹配随机方向的Red recall变化为+0.054(p=0.457),快乐方向为+0.027(p=0.84)。仅感知恢复94.4%,仅推理在逐字节固定的证据上为5.6%。对基线概率做外部门槛、同样发出38个Red时,d′为0.529,内部转向为1.027。
- 作者的结论:宣布不安全的意愿和分辨损伤的能力是两件不同的事,前者可以在推理时设定。只读准确率会把准则移动当成能力,因为不平衡测试集上更常报Red就会抬高macro-F1,同时辨别力可以下降。准则该放在哪里,作者认为要对照漏报与多余关闭的代价、人工复核能力和预期患病率,并从实际部署基线来评估。