跳到正文
10月9日 · 周五

可解释性 · 论文

找到 7 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 75 篇还没打标签,不在筛选结果里。

另有 75 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路

    发表
    测试
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  2. 防御arXiv 2609.31122

    LocUS:面向定向激活引导的注意力头选择与子空间投影

    提出 LocUS,用词汇子空间选择注意力头并约束激活转向

    发表
    测试
    Mistral-7B-v0.1、Mistral-7B-Instruct-v0.3、Llama-3.1-8B 等 7 个
    摘要LocUS 用词汇子空间约束 DoM 转向的位置和方向。

    LocUS 是不更新权重的推理时转向方法,把差分均值更新限制在少数注意力头及其属性对齐子空间。

    深度解读完整解读
  3. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  4. 可解释性arXiv 2609.07037

    Steering Vector Dissection:将激活引导向量拆解为独立语义特征

    提出 Steering Vector Dissection,用 SAE 拆解转向向量

    发表
    测试
    Qwen2.5-7B-Instruct、Llama3.1-8B-Instruct
    摘要用 SAE 把 DiffMean 拆成可区分基向量,并靠去掉拒绝方向改变不安全转向的效果。

    Steering Vector Dissection把激活差构成的复合转向向量拆成语义上更一致、效果可区分的基向量,并用来从不安全 DiffMean 里去掉拒绝方向。

    深度解读完整解读
  5. 防御arXiv 2609.34970

    研究揭示 LLM 涌现失准的机制并提出参数空间缓解框架

    提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去

    发表
    测试
    Qwen2.5-3B-IT、Qwen2.5-7B-IT、Qwen2.5-14B-IT 等 8 个
    摘要窄域 LoRA 会留下可测的有害子空间。

    See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。

    深度解读完整解读
  6. 防御arXiv 2609.38645

    用探针引导微调对齐模型且不损失可监控性

    用持续更新的探针做微调,降低有害性并保持线性可监测性

    发表
    测试
    Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Llama 3 8B Instruct 等 4 个
    摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。

    Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。

    深度解读完整解读
已经到底了