FearCaut-Qwen:激活引导改变视觉语言模型的风险判定标准
用恐惧激活转向检验视觉语言模型的隐患判定准则
- arXiv
- 2610.11986
- 发表
- 层
- 模型层
- 场景
- LLM 应用
- 被测模型
- Qwen/Qwen2.5-VL-7B-Instruct
- 组件视觉
用恐惧激活转向检验视觉语言模型的隐患判定准则
提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路
TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
分析潜空间图像水印对像素扰动的内在鲁棒性上限
摘要作者称当前潜空间水印在低 FPR 下受扩张映射与分布偏移的限制。
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出 KANSteer,用非线性激活引导拟合文生图有序概念轨迹
KANSteer 研究文生图扩散模型里,有序视觉概念能否沿单一激活方向被遍历,并改用一维曲线做 steering。
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解
Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。
提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道
作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
提出 D-Scope,用视觉质心检索 SAE 解码方向并转向扩散生成
D-Scope把扩散 Transformer 中 SAE 特征的高激活图像块,接到文本查询驱动的单方向生成干预上。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
检验视觉 SAE 的可解释性,对照人类判断比较 AIS 与标准指标
这篇工作把 NLP 的 AIS 改到视觉 SAE,用来检查 LRH 的结构代理是否等于人类可解释性。。
用激活交换分析音频语言模型的事件时间绑定
这项工作用机制干预检查三个开源 LALM 如何把时间位置绑到声音事件。
用 SAE 分析神经音频编解码器如何编码年龄、性别与口音
作者用 SAE steering 探测 NAC 表示如何编码说话人属性,目标是可解释性,不是属性转换。
提出 FLIP 末层推理时探针,检验视觉语言模型干预效应的来源
FLIP 是开源 VLM 上的推理时末层探针,用来检验干预效应是否结构化、与任务相连,而不是用来转向模型。。
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
提出 ResLRP,抑制视觉 Transformer 残差抵消引起的归因不稳定
Berend 等人针对 ViT 上 LRP 热图嘈杂、不忠实的问题,把原因放在残差加法而不是注意力规则:前向抵消留下很小的 zout,标准 LRP 用它作分母,放大成不稳定的正负相关性。
用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值
作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。