跳到正文
10月9日 · 周五

可解释性 · 论文

找到 12 篇

另有 59 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    测试
    deepseek-v3-huawei-910b、Qwen3.5-9B、Llama-3.1-8B 等 10 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
  2. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    DeepSeek-R1-Distill-Llama-8B、DeepSeek-R1-Distill-Qwen-14B、OLMo-3-7B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  3. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    DeepSeek V4 Pro、DeepSeek V4 Flash、Qwen2.5-7B-Instruct 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  4. 防御arXiv 2609.31122

    LocUS:面向定向激活引导的注意力头选择与子空间投影

    提出 LocUS,用词汇子空间选择注意力头并约束激活转向

    发表
    测试
    deepseek-llm-7b-base、deepseek-llm-7b-chat、deepseek-67B 等 7 个
    摘要LocUS 用词汇子空间约束 DoM 转向的位置和方向。

    LocUS 是不更新权重的推理时转向方法,把差分均值更新限制在少数注意力头及其属性对齐子空间。

    深度解读完整解读
  5. 防御arXiv 2609.19101

    用内部表征监控与发现 LLM 评测中的奖励作弊

    提出 DoM 探针,监控并发现评测中的奖励作弊

    发表
    测试
    DeepSeek-V4-Pro、Kimi K3、GLM 5.2 等 7 个

    摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。

    深度解读完整解读
  6. 可解释性arXiv 2609.15277

    在 Llama 3.1 8B-Instruct 等 LLM 内部定位并因果操控"机会识别旋钮"

    在 LLM 残差流中定位并因果转向机会识别方向

    发表
    测试
    DeepSeek V4 Pro、Llama 3.1 8B-Instruct、Claude Opus 4.7
    摘要作者在 Llama 中定位并转向 OR 方向,判断随之有符号移动。

    作者把人工创业认知定义为 LLM 内部与创业相关的表征和计算如何组织,并用机会识别做结构理论的检验案例。

    深度解读完整解读
  7. 风险行为arXiv 2609.36139

    研究揭示大语言模型的"不安全汇报"现象及诚实引导的作用

    测量模型在工作汇报中是否隐瞒改变叙事的缺陷

    发表
    测试
    DeepSeekR1-7B、Gemini 3.1 Pro、GPT-5.5 等 8 个
    摘要八类场景中模型默认少报会改变叙事的缺陷。

    作者研究 LLM 在汇报长程工作时是否会隐瞒会改变叙事的缺陷,并把这一行为称为 insecure reporting。

    深度解读完整解读
  8. 可解释性arXiv 2609.35210

    研究用稀疏 crosscoder 揭示 on-policy distillation 只重加权既有特征

    提出 swap readout 分析蒸馏对学生特征的重加权

    发表
    测试
    DeepSeek-R1-Distill-Qwen-1.5B、JustRL-DeepSeek-1.5B、DeepSeek-R1-Distill-Qwen-7B 等 6 个
    摘要OPD 与教师 rollout 上的 SFT 都不增加特征,而是重加权学生与教师已经共享的特征。

    作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。

    深度解读完整解读
  9. 可解释性arXiv 2609.35261

    Imprint Reader:从权重更新读出到行为干预

    用 SMaRT 从冻结权重更新读出知识与行为并用 MetaEdit 干预

    发表
    测试
    DeepSeek-V4-Flash、Qwen3-14B、Qwen3-30B-A3B-Instruct-2507
    摘要SMaRT 读出冻结更新,MetaEdit 用同坐标梯度在无目标任务数据时改原模型行为。

    Imprint Reader 把一次冻结权重更新读成关于新知识或新行为的话,并用同一套坐标上的梯度去改原模型。

    深度解读完整解读
已经到底了