FearCaut-Qwen:激活引导改变视觉语言模型的风险判定标准
用恐惧激活转向检验视觉语言模型的隐患判定准则
- arXiv
- 2610.11986
- 发表
- 层
- 模型层
- 场景
- LLM 应用
- 被测模型
- Qwen/Qwen2.5-VL-7B-Instruct
- 组件视觉
用恐惧激活转向检验视觉语言模型的隐患判定准则
提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路
TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解
Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。
提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道
作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
检验视觉 SAE 的可解释性,对照人类判断比较 AIS 与标准指标
这篇工作把 NLP 的 AIS 改到视觉 SAE,用来检查 LRH 的结构代理是否等于人类可解释性。。
用激活交换分析音频语言模型的事件时间绑定
这项工作用机制干预检查三个开源 LALM 如何把时间位置绑到声音事件。
用 SAE 分析神经音频编解码器如何编码年龄、性别与口音
作者用 SAE steering 探测 NAC 表示如何编码说话人属性,目标是可解释性,不是属性转换。
提出 FLIP 末层推理时探针,检验视觉语言模型干预效应的来源
FLIP 是开源 VLM 上的推理时末层探针,用来检验干预效应是否结构化、与任务相连,而不是用来转向模型。。
提出 ResLRP,抑制视觉 Transformer 残差抵消引起的归因不稳定
Berend 等人针对 ViT 上 LRP 热图嘈杂、不忠实的问题,把原因放在残差加法而不是注意力规则:前向抵消留下很小的 zout,标准 LRP 用它作分母,放大成不稳定的正负相关性。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
检验个体身份训练的视觉表示是否线性编码生物概念
这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。
提出 Capsule Lens,用胶囊近似并追踪表示空间的概念几何
Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。
提出 VisER,用内部视觉证据检测 LVLM 物体幻觉
VisER 是面向 LVLM 开放式图像描述的免训练物体级幻觉检测分数,用来处理内部支持的来源混淆。