跳到正文
10月9日 · 周五

可解释性 · 论文

找到 116 篇

另有 75 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析 LLM 去偏激活方向,发现其编码置信度而非公平性

    发表
    测试
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  2. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  3. 防御arXiv 2610.03502

    研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留

    提出机理编辑形式化认证,证明连续输入区域上的技能移除与保留

    发表
    测试
    Toy MLP (separated)、Toy MLP (entangled)、Deep MLP (3-12-8-2) 等 6 个

    摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。

    深度解读完整解读
  4. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验监控器低读数能否作为代码奖励作弊已受控的证据

    发表
    测试
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  5. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 10 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
  6. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  7. 可解释性arXiv 2607.12166

    研究:SAE 相关性恢复的特征最高 77% 因果无效

    用消融与转向干预审计稀疏自编码器特征的因果有效性

    发表
    测试
    toy model (32->8, s=0.95, decayed)、toy model (nhidden=20)、GPT-2-small (gpt2-small-res-jb/blocks.8.hook_resid_pre)

    摘要论文揭示 SAE 特征存在几何匹配与因果有效性脱节现象,提出读写解离机制与实践准则。

    深度解读完整解读
  8. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Qwen3-8B、Qwen3-32B、Olmo3-7B 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读
  9. 可解释性arXiv 2607.24645

    研究提出 FEGA 框架分析 SAE 特征干预的 logit 变化几何

    提出 FEGA 框架,分析 SAE 特征消融后的 logit 效应几何

    发表
    测试
    Gemma-2-2B、ReLU SAE、TopK SAE 等 4 个
    摘要FEGA 说明可解释且有因果作用的 SAE 特征,仍常常缺少稳定的单一转向方向。

    Feature-Effect Geometry Analysis(FEGA) 把 SAE 特征的下游干预效应当成 logit 空间中的云来分类,用来区分可复用方向、低维结构和弥散效应。

    深度解读完整解读
  10. 研究:思维链推理步骤的可读性不等于可解释性

    用 advantage 衡量思维链步骤重要性,检验文本能否解码

    发表
    测试
    Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 6 个
    摘要advantage 能标出影响答案的步骤,但正确回答的文本更难解码。

    作者用强化学习中的 advantage 比较 CoT 步骤“看起来重要”和“实际改变答案概率”是否一致。

    深度解读完整解读
  11. 可解释性arXiv 2609.10060

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变

    发表
    测试
    Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Gemma 3-4B-IT
    摘要相对表示上的∆B 在多数微调设置中与三个基准的输出层偏见变化共变。

    Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。

    深度解读完整解读
  12. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  13. 可解释性arXiv 2610.01864

    从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念

    提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道

    发表
    测试
    MuQ、MusicFM
    摘要用移调对齐的多 SAE 恢复和弦、调与旋律轨道,并用少量锚点做下游音乐理解。

    作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。

    深度解读完整解读
  14. 可解释性arXiv 2610.02098

    研究揭示机制可解释性中的目标层恢复缺口

    比较等规模电路的忠实度与行为准则,揭示目标层恢复缺口

    发表
    测试
    GPT-2 small、four-layer attention-only width-512 code model、InterpBench compiled transformers
    摘要同等规模下 faithfulness 会错排行为更好的电路。

    作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。

    深度解读完整解读
  15. 可解释性arXiv 2610.01821

    研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示

    提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构

    发表
    测试
    GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B 等 9 个
    摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。

    NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。

    深度解读完整解读