跳到正文
10月9日 · 周五

可解释性 · 论文

找到 11 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 80 篇还没打标签,不在筛选结果里。

另有 80 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验监控器低读数能否作为代码奖励作弊已受控的证据

    发表
    测试
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  2. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  3. 可解释性arXiv 2609.25518

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    提出 Matryoshka Attribution,把模型输出归因到表示与权重

    发表
    测试
    gpt2-small、Qwen2.5-0.5B、gemma-2-2b 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    深度解读完整解读
  4. 防御arXiv 2609.32720

    BiasReducer:面向奖励模型的自适应偏见缓解方法

    B IAS R EDUCER 只改奖励头,按数据集选择属性编辑。

    发表
    测试
    Skywork-Reward-V2-Qwen3-1.7B、GRM-Llama3.2-3B-rewardmodel-ft、RM-Mistral-7B 等 7 个
    摘要BIASREDUCER 按数据集选择奖励头编辑,五模型三基准平均提升并迁移到下游训练。

    BIASREDUCER 是一种只改线性奖励头的奖励模型编辑框架,用来降低模型对预定义表面属性的依赖,并按新数据集决定改哪些属性。

    深度解读完整解读
  5. 可解释性arXiv 2609.35544

    减少谄媚能否增强拒答?机制可解释性带来的 AI 安全启示

    用 SAE 与 CFI 压低谄媚,检验直接拒答与施压下拒答是否增强

    发表
    测试
    Qwen3.5-2B-Base、Qwen3.5-9B-Base、Qwen3.5-35B-A3B-Base
    摘要CFI 能持久降低谄媚,但不保证直接拒答变强。

    用 SAE 选出的谄媚特征做补偿性训练注入,检验“少谄媚”是否带来“更强拒答”。。

    深度解读完整解读
  6. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  7. 可解释性arXiv 2609.07037

    Steering Vector Dissection:将激活引导向量拆解为独立语义特征

    提出 Steering Vector Dissection,用 SAE 拆解转向向量

    发表
    测试
    Qwen2.5-7B-Instruct、Llama3.1-8B-Instruct
    摘要用 SAE 把 DiffMean 拆成可区分基向量,并靠去掉拒绝方向改变不安全转向的效果。

    Steering Vector Dissection把激活差构成的复合转向向量拆成语义上更一致、效果可区分的基向量,并用来从不安全 DiffMean 里去掉拒绝方向。

    深度解读完整解读
  8. 可解释性arXiv 2609.19366

    研究揭示细粒度危害信号在 LLM 安全中的作用

    抽取正交类别残差并用激活转向检验其有害性与拒答作用

    发表
    测试
    Gemma-2-9B-IT、Llama-3-8B-Instruct、Qwen2.5-7B-Instruct
    摘要类别残差可携带有害性并诱发拒答,也常加强下游的一般有害对齐。

    作者分离出与一般有害方向正交的类别残差,用来检查细粒度有害信号是否参与 LLM 的安全行为。

    深度解读完整解读
  9. 可解释性arXiv 2609.38081

    Hessian Null Space Continuation:在单个神经网络解附近发现大量表征多样性

    提出 HNC,在单个解附近遍历保函数权重并比较内部表示

    发表
    测试
    64-unit tanh RNN、ViT-S/16、RNN policy (Plume Tracking) 等 5 个
    摘要HNC 在保持函数的局部权重区域里找到表示、动力学或行为不同的解。

    Hessian Null Space Continuation(HNC)用局部曲率,在单个已训练网络周围遍历近似保持输入输出的连通低损失区域,并可用可微目标做引导。作者要回答的是:这个区域里是否真有不同的内部机制,而不只是同一表示的小改动。做法是交替执行零空间内的平坦步与函数匹配损失上的梯度恢复。

    深度解读完整解读
已经到底了