跳到正文
10月8日 · 周四

可解释性 · 论文

找到 55 篇

另有 105 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    提出安全电路对齐,把对齐更新限制在预训练拒绝电路内

    发表
    测试
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  2. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析激活引导去偏方向,发现其编码的是置信度而非公平性

    发表
    测试
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Qwen3.5-9B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  3. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  4. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-14B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  5. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Qwen3-8B、Qwen3-32B、Gemma4-31B 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读
  6. 可解释性arXiv 2607.24645

    研究提出 FEGA 框架分析 SAE 特征干预的 logit 变化几何

    提出 FEGA 框架,分析 SAE 特征消融后的 logit 效应几何

    发表
    测试
    Gemma-2-2B、ReLU SAE、TopK SAE 等 4 个
    摘要FEGA 说明可解释且有因果作用的 SAE 特征,仍常常缺少稳定的单一转向方向。

    Feature-Effect Geometry Analysis(FEGA) 把 SAE 特征的下游干预效应当成 logit 空间中的云来分类,用来区分可复用方向、低维结构和弥散效应。

    深度解读完整解读
  7. 可解释性arXiv 2609.10060

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变

    发表
    测试
    Llama 3.1-8B-Instruct、Gemma 3-4B-IT、Mistral-7B-Instruct-v0.3
    摘要相对表示上的∆B 在多数微调设置中与三个基准的输出层偏见变化共变。

    Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。

    深度解读完整解读
  8. 可解释性arXiv 2610.01821

    研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示

    提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构

    发表
    测试
    Llama-3.1-8B-Instruct、Qwen3-4B、Qwen3-8B 等 9 个
    摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。

    NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。

    深度解读完整解读
  9. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    测试
    CLIP ViT-L/14、DINOv3 ViT-L/16、ResNet-18 等 8 个
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  10. 可解释性arXiv 2609.37616

    语言模型中的权威偏差:来源顺从与用户认同并非同一行为

    因果解耦来源依从与用户迎合的内部机制

    发表
    测试
    Qwen3.5-27B、Gemma-4-26B-A4B、Gemini-3.1-Pro 等 8 个

    摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。

    深度解读完整解读
  11. 可解释性arXiv 2609.25518

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    提出 Matryoshka Attribution,把模型输出归因到表示与权重

    发表
    测试
    Qwen2.5-0.5B、gemma-2-2b、Llama-3.1-8B 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    深度解读完整解读
  12. 可解释性arXiv 2609.29362

    SAE 潜空间中词性作为涌现类别:LLM 形态句法信息呈分布式编码

    检验词性在 SAE 潜空间是单特征还是紧凑组编码

    发表
    测试
    LLaMA-3-8B、EleutherAI/sae-llama-3-8b-32x
    摘要词性可从 SAE 恢复,由大小随类别变化的 latent 组承载,留出后仍激活但不专属。

    Bondielli、Passaro、Auriemma 和 Lenci 用词性检验 SAE latent 如何组织形态句法信息。。

    深度解读完整解读
  13. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Llama-3.1-8B、Qwen2.5-7B、Falcon-Mamba-7B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  14. 可解释性arXiv 2609.08410

    语言、越狱与简洁性:LLM 属性引导向量的免训练组合研究

    检验语言、越狱与简洁性 steering 向量的免训练加法组合及其与残差流正交性的关系

    发表
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-14B-Instruct 等 4 个
    摘要合适层上的加法组合可以同时控制语言与行为,近似正交与之相符。

    作者研究四个指令微调模型中,语言、越狱和简洁性 steering 向量能否无训练地相加。

    深度解读完整解读
  15. 可解释性arXiv 2609.18612

    研究揭示 Transformer 中影响超常的削弱型神经元

    用权重余弦给 GLU 神经元做读写功能分类并检验消融影响

    发表
    测试
    Gemma-2-2B、Gemma-2-9B、Llama-2-7b 等 9 个
    摘要GLU 神经元的读写余弦呈现先加强后削弱的层模式,晚期少量 weakening 神经元对输出影响大。

    这篇分析工作用输入权重与输出权重的余弦,给 GLU 神经元的读写功能分类,并检查这些类的层分布、激活频率和对下一 token 分布的影响。

    深度解读完整解读