审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
- arXiv
- 2610.09517
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 测试
- CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B 等 6 个
- 组件视觉
摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
用 J-lens 检测屈从多数的智能体是否仍表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道
作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
检查正确答案对应的思维链是否构成合法推导
iGSM 上的程序可检查实验:正确答案并不保证思维链是合法推导。。作者针对一个被用于监测和解读的假设:发出的轨迹忠实于、或至少可靠相关于模型如何得到答案。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出 FLIP 末层推理时探针,检验视觉语言模型干预效应的来源
FLIP 是开源 VLM 上的推理时末层探针,用来检验干预效应是否结构化、与任务相连,而不是用来转向模型。。
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
提出 Capsule Lens,用胶囊近似并追踪表示空间的概念几何
Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。
检验个体身份训练的视觉表示是否线性编码生物概念
这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。
用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值
作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。
提出 ResLRP,抑制视觉 Transformer 残差抵消引起的归因不稳定
Berend 等人针对 ViT 上 LRP 热图嘈杂、不忠实的问题,把原因放在残差加法而不是注意力规则:前向抵消留下很小的 zout,标准 LRP 用它作分母,放大成不稳定的正负相关性。
用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地
这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。
提出 VisER,用内部视觉证据检测 LVLM 物体幻觉
VisER 是面向 LVLM 开放式图像描述的免训练物体级幻觉检测分数,用来处理内部支持的来源混淆。
把口头评测感知分成能力与安全框架并检验对服从的预测
作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。