跳到正文
10月9日 · 周五

全部论文

找到 20 篇

另有 656 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    GPT-OSS-20B、OLMo-3-7B-Instruct、OLMo-3-7B base 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  2. 可解释性arXiv 2607.12166

    研究:SAE 相关性恢复的特征最高 77% 因果无效

    用消融与转向干预审计稀疏自编码器特征的因果有效性

    发表
    测试
    GPT-2-small (gpt2-small-res-jb/blocks.8.hook_resid_pre)、toy model (32->8, s=0.95, decayed)、toy model (nhidden=20)

    摘要论文揭示 SAE 特征存在几何匹配与因果有效性脱节现象,提出读写解离机制与实践准则。

    深度解读完整解读
  3. 可解释性arXiv 2610.02098

    研究揭示机制可解释性中的目标层恢复缺口

    比较等规模电路的忠实度与行为准则,揭示目标层恢复缺口

    发表
    测试
    GPT-2 small、four-layer attention-only width-512 code model、InterpBench compiled transformers
    摘要同等规模下 faithfulness 会错排行为更好的电路。

    作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。

    深度解读完整解读
  4. 可解释性arXiv 2610.01821

    研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示

    提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构

    发表
    测试
    GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B 等 9 个
    摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。

    NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。

    深度解读完整解读
  5. 可解释性arXiv 2609.25518

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    提出 Matryoshka Attribution,把模型输出归因到表示与权重

    发表
    测试
    gpt2-small、Qwen2.5-0.5B、gemma-2-2b 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    深度解读完整解读
  6. 可解释性arXiv 2609.28809

    Stream Recursion Model(SRM):面向可扩展机制可解释性的新架构

    提出 SRM 多流递归架构,以可学习流间注意力支持机制分析

    发表
    测试
    GPT-2、SRM-base、SRM-med 等 5 个
    摘要SRM 用可学习的流间注意力扩展 HRM,语言损失可接近 GPT-2。

    Stream Recursion Model(SRM) 修改 HRM 的多流结构,使流数增加时语言建模仍能扩展,并让路由和流分工可以直接看。

    深度解读完整解读
  7. 可解释性arXiv 2609.30954

    FTB Graph:多语言模型首 token 广播器与语言身份头电路的结构分析

    用激活修补定位并验证多语模型首 token 语言身份电路

    发表
    测试
    GPT-2、BLOOM-560M、Pythia-1B 等 6 个
    摘要首 token 语言路由在预训练中形成。

    六个不超过 2.8B 的多语模型上,第一个生成 token 的语言身份被抽成经过精确修补验证的注意力电路。。

    深度解读完整解读
  8. 可解释性arXiv 2609.32355

    语言模型定向特征学习:检测用激活值,干预用梯度

    比较激活值与梯度定向特征的检测和干预效果

    发表
    测试
    GPT-2、Pythia-70M、Llama-3.1-8B
    摘要定向特征的检测与干预依赖信号和估计器,二者并不对齐。

    作者比较假设驱动的定向特征学习:为预先指定概念构造单一特征,并同时看检测与因果干预。CAA 与 GRADIEND 原先同时改变信号和估计器。本文将 activation value、activation gradient、parameter gradient 与 contrastive mean、IEND 交叉,补齐 ACTIEND、AGIEND、CAGA、CGA,并以预训练 SAE 为非定向参照。

    深度解读完整解读
  9. 可解释性arXiv 2609.35890

    研究:表征简洁与电路规模在阈值依赖下出现分离

    检验对抗训练带来的表征简洁是否对应更小因果电路

    发表
    测试
    GPT-2 Small(124M,openai-community/gpt2)、ft-clean、ft-e100-a05 等 10 个
    摘要对抗训练使 GPT-2 Small 的 SAE 表征更可分解,但更小的忠实电路只出现在高保真区间。

    这篇工作用对抗持续训练当仪器,检验表征简洁是否等于电路简洁。问题是:SAE 更可分解、归因动用的特征更少,是否意味着在固定保真度下恢复同一行为所需的因果子图更小。

    深度解读完整解读
  10. 可解释性arXiv 2609.23587

    大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性

    分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响

    发表
    测试
    GPT-4o、QwQ-32B、DeepSeek-R1-Distill-Qwen-32B 等 4 个
    摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。

    作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。

    深度解读完整解读
  11. 可解释性arXiv 2609.00755

    S^3martCirc:自监督智能电路发现框架

    提出 S³martCirc 联合发现电路并划分节点角色

    发表
    测试
    GPT-2、Llama 3.2 1B、Qwen 3 1.7B
    摘要S³martCirc 联合发现电路并分两类角色。

    S³martCirc 把电路成员和节点功能放进同一次优化。。要处理的情况是:先选注意力头或前馈神经元,再人工指定 name mover 一类任务专用角色。

    深度解读完整解读
  12. 可解释性arXiv 2609.03148

    LLM 如何处理上下文知识冲突:ContextConflict 数据集与机制可解释性分析

    构建 CONTEXT CONFLICT 解释模型如何表征并化解语境知识冲突

    发表
    测试
    gpt-5、gpt-oss-120b、gpt-oss-20b 等 7 个
    摘要CONTEXT CONFLICT 显示模型能内部察觉冲突,却偏向靠前证据。

    CONTEXT CONFLICT 把问题从“参数知识对外部语境”转到“语境内部多来源证据互相冲突”,并同时给出数据、机制分析和一种无训练转向。

    深度解读完整解读
  13. 可解释性arXiv 2609.15533

    论文指可解释替换网络忠实性易被微小扰动翻转,提出形式化验证框架

    提出 IRN 忠实性的可达性验证框架并收紧认证界

    发表
    测试
    GPT-2、Gemma 2 2B、Gemma 3 1B 等 5 个
    摘要IRN 在改写下特征翻转。

    这篇工作把“IRN 是否在对抗邻域里复现模型计算”从干净集上的重构损失,改写成可认证的ℓ∞忠实差距,并在五个开源模型族上同时报告攻击上界和验证上界。。

    深度解读完整解读
  14. 可解释性arXiv 2609.22850

    同一结果,不同读出:LLM 中可引导效价方向究竟代表什么

    检验可引导的 good-bad 方向是否读出与历史无关的效价

    发表
    测试
    GPT-oss-20B、Qwen3-4B-Instruct-2507、Qwen3-8B 等 5 个
    摘要zV 跨编码迁移且 RL 后更耦合价值,但同一结果的读出仍取决于预告历史,不能当成与历史无关的效价。

    这篇工作用构念效度约束一个 welfare 相关的解读:迷宫中的 good–bad 方向 zV 是否读出已实现结果的效价。。

    深度解读完整解读
  15. 可解释性arXiv 2609.37857

    研究诊断 TopK SAE 可靠性:活跃预算 k 会削弱稀有特征敏感性

    诊断并修复 TopK SAE 稀有特征在释义下的敏感性失效

    发表
    测试
    GPT-2 small、Qwen2.5-1.5B-Instruct、Gemma-2-9B
    摘要TopK 的 k 挤占选择边界使稀有特征变脆。

    这篇工作诊断并修复 TopK SAE 在保义释义下的特征可靠性,对象是 GPT-2 small 为主、并检查 Qwen2.5-1.5B-Instruct 与 Gemma-2-9B 的字典特征。

    深度解读完整解读
  16. 可解释性arXiv 2609.35117

    工具调用改变大语言模型的拒答机制

    比较对话与工具中介通道的拒答内部机制

    发表
    测试
    gpt-oss-20b、Qwen3-8B、Qwen3-32B 等 8 个
    摘要有害性跨通道仍可读,工具通道用更高阈值且更易被 GCG 与消融打破。

    作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。

    深度解读完整解读
已经到底了