跳到正文
10月8日 · 周四

可解释性 · 论文

找到 5 篇
筛选

系统组件

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 12 篇还没打标签,不在筛选结果里。

另有 12 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv:2609.14759 ·

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个模型层
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    完整解读
  2. 可解释性arXiv:2607.12166 ·

    研究:SAE 相关性恢复的特征最高 77% 因果无效

    用消融与转向干预审计稀疏自编码器特征的因果有效性

    测试
    toy model (32->8, s=0.95, decayed)、toy model (nhidden=20)、GPT-2-small (gpt2-small-res-jb/blocks.8.hook_resid_pre)模型层
    摘要论文揭示SAE特征存在几何匹配与因果有效性脱节现象,提出读写解离机制与实践准则。
    • 定位与核心问题:论文针对机制可解释性中仅凭余弦相似度等相关性指标评估SAE特征恢复的不足,提出端到端因果干预验证框架。
    • 核心方法与工具:构建可控合成瓶颈模型,对匹配特征执行消融(读)与带符号转向(写)干预,度量激活发生率与特异性比值,并开源审计工具 sae-causal-audit。
    • 因果惰性与解离发现:在退化TopK SAE中77%(多线程)或17%(确定性流水线)的余弦达标特征从不激活;在良好SAE中亦有9%特征因果惰性,且余弦可达0.9998。
    • 对跖对读写分离机制:5组对跖对特征证实了读写解离现象,其消融特异性为0但转向特异性达143至310,表现为无法监控但可被有效转向。
    • 真实模型验证与碰撞:在GPT-2-small残差流SAE审计中发现14%(1/7)特征因果惰性,且单个原子同时成为多达8个无关概念的最近邻匹配。
    • 实践启示:作者建议在安全部署中不可将未经因果验证的原始SAE特征直接用于自动化决策,监控与转向任务须分别进行读验证与写验证。
    完整解读
  3. 可解释性arXiv:2608.21766 ·

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    测试
    Qwen3-8B、Qwen3-32B、Olmo3-7B 等 14 个模型层
    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且SFT阶段起关键稳定作用。
    • 研究定位:论文对大语言模型的评估意识进行了涵盖内部隐层表征、外部言语化表达、因果激活导向及训练阶段演化的系统性实证研究。
    • 核心问题与方法:针对评估意识可能导致基准测试失效的风险,论文利用16对微小差异的对比提示在残差流中提取线性探针,结合GPT-5.4评测言语化输出,并通过对比激活相加实施因果干预。
    • 内部表征普遍可分:6个开源模型(7B至49B)在峰值层的线性探针AUROC均超过0.70,表明模型隐层状态普遍保留了评估与部署语境的区别。
    • 言语化极少且呈弱耦合:未干预下所有模型超过93.90%的生成无评估意识言语化(Score 0),且单条提示词的探针得分与裁判打分的Spearman秩相关绝对值均低于0.19,互信息低于0.04 nats。
    • 因果干预与后训练稳定机制:沿探针方向注入负向导向可使言语化得分提升0.2至1.5分;Olmo3在SFT后探针方向余弦相似度达到0.998以上并在此后阶段保持稳定。
    • 启示与结论:作者认为评估意识是模型的实证能力,内部表征与外部言语化存在解耦,单纯依赖言语化或单一指标无法全面反映模型对受测状态的响应,评测需兼顾多重维度。
    完整解读
  4. 可解释性arXiv:2609.14754 ·

    研究者总结因果可解释性中的六类测量失效与校准协议

    提出因果可解释性仪器校准规程,识别决策位点测量失效

    测试
    OLMo-3-7B-Instruct、Qwen2.5-7B、Llama-3.1-8B 等 6 个模型层
    摘要论文系统梳理并实证揭示了大模型可解释性测量的六种伪影陷阱,提出了四项严格的校准与验证规程。
    • 论文定位:本文是一份针对大语言模型因果可解释性研究的方法学检验与校准指南。
    • 试图解决的问题:大模型因果可解释性测量(如投影、余弦、修补和归因)常常在产生合理读数的同时隐藏假象,导致研究者将仪器失真误读为真实的机理发现。
    • 方法核心要点:作者确立了四项可解释性操作规范,包括使用正对照阶梯校准仪器辨别力、引入正交任务单元排除输出饱和假象、在消耗算力前依据组内方差预先评估检验功效,以及依据决策承诺深度对齐跨层与跨模型对比。
    • 关键实证结果:
      1. 在 OLMo-3-7B-Instruct、Qwen2.5-7B、Llama-3.1-8B 和 GPT-OSS-20B 四款架构上,决策位点有效维度均收缩至 8.6 到 14.7 之间,仅占打乱列基准的 4.1% 至 8.4%(Table 1)。
      2. 在后归一化架构 OLMo-3 上,朴素线性归因求和测得的重构率达到 3.05,而在精确折叠 RMSNorm 增益后校准为 0.9999(Section 3.4)。
      3. Llama-3.1 在读出层(Layer 16)测得的不对称度 A 为 +0.82,在对齐至决策形成前的连贯层(Layer 12)后修正为 -0.28(Figure 3)。
    • 作者结论与启示:作者认为可解释性研究中的数值不能直接等同于因果机制,研究人员在采信测量结论之前必须建立仪器自检流程,通过公开修订记录与可追溯账本避免伪影被误写入科学结论。
    完整解读
  5. 可解释性arXiv:2609.25366 ·

    研究:思维链对答案的约束随模型相对任务难度而变化

    提出基于续写的因果测试协议,测量思维链因果承重性随任务难度的变化

    测试
    Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 等 4 个模型层
    摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。
    • 定位与核心问题:论文通过因果干预评估大语言模型思维链的因果承重性,探讨中间推理步骤在何种情况下真正约束最终答案,从而厘清基于思维链进行安全监控的有效前提。
    • 方法设计:提出基于续写的因果测试协议,在模型正确的多步推理前缀中扰动单步并截断,强制模型续写,依据答案与推导过程将行为划分为静默旁路、自我修正与错误传播三类,并结合隐状态探针与激活引导检验其机制。
    • 任务难度主导承重性:在 Gemma-2-9B-IT 上,错误传播率从 GSM8K 的 3.9% 升至 BBH 的 40.9%,且在 MMLU 29 个子科目间呈现 7 倍跨度(7.5% 至 53.7%);在特定分桶和进入顺序的序贯模型中,难度项占已解释离差的98.8%,不等于全部变异解释率,扰动类型仅占 0.8%。
    • 跨模型规律与后训练影响:Llama-3.1-8B-Instruct 以更低的基线准确率复现了难度梯度(总体错误传播率达 57.2%);而强化学习蒸馏模型 DeepSeek-R1-Distill-Qwen-7B 表现出更低的错误传播率(GSM8K 为 5.1%、BBH 为 16.8%),作者将此与后训练的自我验证习惯联系起来;模型、筛选和解码条件不同,不能作为后训练因果效应的干净比较。
    • 表征可读但加性控制受限:隐状态线性与 MLP 探针能够预测行为模态(Gemma 错误传播检测准确率达 86.2%),但在 11,556 次单向加性激活引导实验中均未诱发行为翻转,仅 8 向量基引导对错误传播呈现 24.6% 的部分翻转。
    • 安全启示:作者指出思维链承重性随任务难度变化为安全监控带来结构性困扰:简单任务中模型旁路推理使监控缺乏信号,困难任务中错误快速级联使干预窗口变窄;未来的监控与防护策略必须基于任务难度校准对思维链的信赖程度。
    完整解读
已经到底了