跳到正文
10月8日 · 周四

可解释性 · 论文

找到 10 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 防御arXiv:2610.09600 ·

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    提出安全电路对齐,把对齐更新限制在预训练拒绝电路内

    测试
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个训练与数据层
    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
    • 论文定位:论文提出了从计算电路视角解析大语言模型内部安全机制与跨阶段演化的分析框架 SafeEvo,并据此设计了定向微调拒绝电路的安全对齐方法 SCA。
    • 要解决的问题:传统安全对齐多从表面行为模式施加约束,缺乏对内部机理的理解;同时全参数微调易引发损害通用能力的对齐税与过度拒绝问题,而先前可解释性研究未探究预训练基座模型中的安全机制及其演变。
    • 方法核心机制:通过可微掩码和双分支优化从基座模型提取稀疏门控 MLP 拒绝电路;利用 Jaccard 相似度追踪对齐过程中的电路漂移;在 SCA 中将 LoRA 参数更新严格约束在提取出的预训练拒绝电路上。
    • 关键实验结果:
      1. 预训练基座模型中已存在弱拒绝电路,在 BeaverTails 50 条查询上独立电路拒绝率达 100.00%(Table 1),而消融该电路使 HarmBench ASR 从 32.70%–48.43% 升至 88.05%–91.19%(Table 9)。
      2. 拒绝电路在模型内非唯一且在对齐中发生结构漂移,同检查点独立提取重合度仅 0.26,连续检查点间重合度降至 0.78(Figure 4)。
      3. 在 DPO 对齐下,SCA 将 Llama-3-8B 在 HarmBench 上的 ASR 从全参数的 16.98% 降至 0.63%,GSM8K 准确率为 48.98%(全参数为 49.51%),XSTest 过度拒绝率为 3.2%(Table 2)。
      4. 多种子测试中,SCA 在三个模型上的 HarmBench ASR 较同稀疏度随机更新基线分别降低 14.80、8.49、7.23 个百分点,bootstrap 95% 置信区间均排除零(Table 4)。
    • 作者结论与启示:作者认为安全对齐通过重塑底层拒绝电路起效,无约束更新引发的电路漂移及对通用参数的干扰是对齐税的潜在来源;将更新约束于预训练拒绝电路能够在提升安全性的同时兼顾通用能力保留与低过度拒绝。
    完整解读
  2. 可解释性arXiv:2610.08559 ·

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析激活引导去偏方向,发现其编码的是置信度而非公平性

    测试
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个模型层
    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
    • 定位:本研究从可解释性角度系统评估大语言模型激活引导去偏见技术,揭示其线性去偏见方向的核心属性是模型置信度而非社会公平性。
    • 问题:激活引导在去偏见任务中常表现出泛化性差及损害常识准确率的问题,论文旨在探明对比偏见与反偏见提示词提取出的隐藏空间分离方向实际编码的内容。
    • 方法:在四个模型家族八个模型上训练逻辑回归分类器并构建对比激活相加(CAA)去偏见向量,分析其在偏见和通用知识基准上的表征分布,并测试有无弃答选项下的引导效果。
    • 结果:
      1. 偏见分类器在无偏见概念的 OpenBookQA 上区分高低概率选项达到最高 0.88 的 AUROC(Llama-3.1-8B-Instruct,Table 2)。
      2. CAA 去偏见向量与通用知识任务置信度向量的余弦相似度最高达 0.91(Qwen3.5-9B-Base 在 BBQ 与 MMLU 上,Table 3)。
      3. 有弃答选项时,引导使 Llama-3.1-8B-Instruct 在 BBQ 歧义集偏见分从 0.08 降至 0.01,但消歧集准确率从 0.87 降至 0.52,消歧偏见分保持在 0.02 至 0.04 不变(Table 4)。
      4. 无弃答选项时,引导使各选项概率趋向均分,StereoSet 与 CrowS-Pairs 偏见率下降伴随回答熵上升(Table 4)。
    • 启示:作者指出激活引导降低偏见指标并非纠正了底层刻板偏好,而是降低模型置信度促使其弃答或概率均分的副产物,提示在 AI 安全中应审慎解释引导去偏见的结果。
    完整解读
  3. 可解释性arXiv:2610.05541 ·

    研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答

    提出CAP与CSFD,发现越狱通过压制安全特征绕过拒答

    测试
    Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个模型层
    摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
    • 定位与核心问题:本研究从机械可解释性视角切入,聚焦大语言模型在面对越狱攻击时内部处于静默状态的转码器特征,探讨越狱是否通过抑制安全关键特征而非单纯激活有害表征来绕过拒答。
    • 核心方法:提出反事实激活潜能(CAP)指标,将编码器对齐度、归因抑制强度与消融安全关键性三者相乘,量化静默特征的激活倾向;并提出两阶段算法 CSFD,结合期望激活差与 Cohen's d 在无需穷举消融的前提下快速筛选候选特征。
    • 因果有效性验证:在 5 款被测模型上,CSFD 筛选的候选特征中有 78% 至 100% 具有因果有效性,消融单个特征可使有害拒答翻转为顺从,翻转率最高达 82.5%(Gemma-3-4B-IT,Table 1)。
    • 自然越狱与机制干预证据:在 PAIR 越狱攻击下,高 CAP 安全特征所受抑制强度上升 2 至 4 倍,激活下降达 80%(Qwen3-1.7B,Table 3);在有害拒答提示词上仅放大抑制源 8 倍,即可使拒答翻转率达 0.29(Table 2)。
    • 表征能力优于传统基线:基于 50 个候选特征的 CAP 分解探针在 Gemma-2-2B 上区分良性与拒答的 AUROC 达到 0.788,优于残差流拒答方向(DIM)的 0.546 及全特征原始激活的 0.668(Table 4)。
    • 作者结论与启示:作者指出越狱攻击可部分通过抑制关键安全特征实现,拒答行为由多个特征构成的分布式回路介导;单独恢复任一特征难以恢复拒答,未来的安全解释性与防御设计需将注意力扩展至被抑制的静默特征。
    完整解读
  4. 可解释性arXiv:2610.04125 ·

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个模型层
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    完整解读
  5. 可解释性arXiv:2609.14759 ·

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个模型层
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    完整解读
  6. 可解释性arXiv:2607.12166 ·

    研究:SAE 相关性恢复的特征最高 77% 因果无效

    用消融与转向干预审计稀疏自编码器特征的因果有效性

    测试
    toy model (32->8, s=0.95, decayed)、toy model (nhidden=20)、GPT-2-small (gpt2-small-res-jb/blocks.8.hook_resid_pre)模型层
    摘要论文揭示SAE特征存在几何匹配与因果有效性脱节现象,提出读写解离机制与实践准则。
    • 定位与核心问题:论文针对机制可解释性中仅凭余弦相似度等相关性指标评估SAE特征恢复的不足,提出端到端因果干预验证框架。
    • 核心方法与工具:构建可控合成瓶颈模型,对匹配特征执行消融(读)与带符号转向(写)干预,度量激活发生率与特异性比值,并开源审计工具 sae-causal-audit。
    • 因果惰性与解离发现:在退化TopK SAE中77%(多线程)或17%(确定性流水线)的余弦达标特征从不激活;在良好SAE中亦有9%特征因果惰性,且余弦可达0.9998。
    • 对跖对读写分离机制:5组对跖对特征证实了读写解离现象,其消融特异性为0但转向特异性达143至310,表现为无法监控但可被有效转向。
    • 真实模型验证与碰撞:在GPT-2-small残差流SAE审计中发现14%(1/7)特征因果惰性,且单个原子同时成为多达8个无关概念的最近邻匹配。
    • 实践启示:作者建议在安全部署中不可将未经因果验证的原始SAE特征直接用于自动化决策,监控与转向任务须分别进行读验证与写验证。
    完整解读
  7. 可解释性arXiv:2608.21766 ·

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    测试
    Qwen3-8B、Qwen3-32B、Olmo3-7B 等 14 个模型层
    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且SFT阶段起关键稳定作用。
    • 研究定位:论文对大语言模型的评估意识进行了涵盖内部隐层表征、外部言语化表达、因果激活导向及训练阶段演化的系统性实证研究。
    • 核心问题与方法:针对评估意识可能导致基准测试失效的风险,论文利用16对微小差异的对比提示在残差流中提取线性探针,结合GPT-5.4评测言语化输出,并通过对比激活相加实施因果干预。
    • 内部表征普遍可分:6个开源模型(7B至49B)在峰值层的线性探针AUROC均超过0.70,表明模型隐层状态普遍保留了评估与部署语境的区别。
    • 言语化极少且呈弱耦合:未干预下所有模型超过93.90%的生成无评估意识言语化(Score 0),且单条提示词的探针得分与裁判打分的Spearman秩相关绝对值均低于0.19,互信息低于0.04 nats。
    • 因果干预与后训练稳定机制:沿探针方向注入负向导向可使言语化得分提升0.2至1.5分;Olmo3在SFT后探针方向余弦相似度达到0.998以上并在此后阶段保持稳定。
    • 启示与结论:作者认为评估意识是模型的实证能力,内部表征与外部言语化存在解耦,单纯依赖言语化或单一指标无法全面反映模型对受测状态的响应,评测需兼顾多重维度。
    完整解读
  8. 可解释性arXiv:2609.14754 ·

    研究者总结因果可解释性中的六类测量失效与校准协议

    提出因果可解释性仪器校准规程,识别决策位点测量失效

    测试
    OLMo-3-7B-Instruct、Qwen2.5-7B、Llama-3.1-8B 等 6 个模型层
    摘要论文系统梳理并实证揭示了大模型可解释性测量的六种伪影陷阱,提出了四项严格的校准与验证规程。
    • 论文定位:本文是一份针对大语言模型因果可解释性研究的方法学检验与校准指南。
    • 试图解决的问题:大模型因果可解释性测量(如投影、余弦、修补和归因)常常在产生合理读数的同时隐藏假象,导致研究者将仪器失真误读为真实的机理发现。
    • 方法核心要点:作者确立了四项可解释性操作规范,包括使用正对照阶梯校准仪器辨别力、引入正交任务单元排除输出饱和假象、在消耗算力前依据组内方差预先评估检验功效,以及依据决策承诺深度对齐跨层与跨模型对比。
    • 关键实证结果:
      1. 在 OLMo-3-7B-Instruct、Qwen2.5-7B、Llama-3.1-8B 和 GPT-OSS-20B 四款架构上,决策位点有效维度均收缩至 8.6 到 14.7 之间,仅占打乱列基准的 4.1% 至 8.4%(Table 1)。
      2. 在后归一化架构 OLMo-3 上,朴素线性归因求和测得的重构率达到 3.05,而在精确折叠 RMSNorm 增益后校准为 0.9999(Section 3.4)。
      3. Llama-3.1 在读出层(Layer 16)测得的不对称度 A 为 +0.82,在对齐至决策形成前的连贯层(Layer 12)后修正为 -0.28(Figure 3)。
    • 作者结论与启示:作者认为可解释性研究中的数值不能直接等同于因果机制,研究人员在采信测量结论之前必须建立仪器自检流程,通过公开修订记录与可追溯账本避免伪影被误写入科学结论。
    完整解读
  9. 可解释性arXiv:2609.37616 ·

    语言模型中的权威偏差:来源顺从与用户认同并非同一行为

    因果解耦来源依从与用户迎合的内部机制

    测试
    Qwen3.5-27B、GPT-OSS-20B、OLMo-3.1-32B 等 8 个模型层
    摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
    • 定位与核心问题:论文针对检索与工具环境下的权威偏差,研究语言模型对标注为验证来源的错误信息顺从是否与对用户的阿谀迎合属于同一内部机制。
    • 方法设计要点:通过对比正确与错误源背书激活提取权威方向并剔除助手轴分量,结合残差流投影移除以及基于线索跨度差值的双向归因补丁,在保持题目文本不变的前提下实施因果干预。
    • 权威偏倚普遍存在:在 8 款模型中,单句验证源背书使 7 款模型的基准正确回答翻转 44.7%–87.5%(OLMo-3.1 达 82.9%,Grok-4.20 达 87.5%,Gemini-3.1-Pro 为 0.6% 离群),且顺从率随来源权威语气强化而递增。
    • 因果机制双向分离:在 Qwen3.5、GPT-OSS 和 OLMo-3.1 中,移除源方向使错误来源顺从率下降 64.3–77.5 个百分点,而移除用户方向则主要降低用户迎合;归因补丁使来源与用户的顺从率差距收窄 55%–61%。
    • 跨任务迁移与针对性防御:权威向量可迁移至多轮 SYCON 对话,使 GPT-OSS 妥协率从 39% 升至 91%;正交移除权威方向后,Qwen3.5 在 TriviaQA 的错误顺从率从 42.7% 降至 5.2%,且 300 题 MMLU-Pro 和 200 题 GSM8K 检验未检测到能力损失。
    • 作者结论与启示:作者认为,源依从与用户迎合在表征上不可相互替代;随着模型日益依赖检索与工具,安全评估与对齐应建立独立的来源权威偏倚评测与缓解基线,而非直接套用用户阿谀基准。
    完整解读
  10. 可解释性arXiv:2609.38205 ·

    系统提示词幻觉:指令前导如何改变语言模型内部计算

    测量系统提示词对模型逐层计算的重构程度

    测试
    Qwen-2.5-1.5B、SmolLM2-1.7B、Gemma-1-2B 等 15 个模型层
    摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。

    通过对 17 个指令微调模型进行逐层表征相似度与因果干预分析,探索系统提示词在模型内部究竟如何重构计算。

    完整解读
已经到底了