跳到正文
10月9日 · 周五

全部论文

找到 6 篇

另有 643 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    DeepSeek-R1-Distill-Llama-8B、DeepSeek-R1-Distill-Qwen-14B、OLMo-3-7B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  2. 可解释性arXiv 2609.23587

    大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性

    分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响

    发表
    测试
    DeepSeek-R1-Distill-Qwen-32B、DeepSeek-R1-Distill-Llama-8B、QwQ-32B 等 4 个
    摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。

    作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。

    深度解读完整解读
  3. 可解释性arXiv 2609.15277

    在 Llama 3.1 8B-Instruct 等 LLM 内部定位并因果操控"机会识别旋钮"

    在 LLM 残差流中定位并因果转向机会识别方向

    发表
    测试
    DeepSeek V4 Pro、Llama 3.1 8B-Instruct、Claude Opus 4.7
    摘要作者在 Llama 中定位并转向 OR 方向,判断随之有符号移动。

    作者把人工创业认知定义为 LLM 内部与创业相关的表征和计算如何组织,并用机会识别做结构理论的检验案例。

    深度解读完整解读
  4. 可解释性arXiv 2609.35210

    研究用稀疏 crosscoder 揭示 on-policy distillation 只重加权既有特征

    提出 swap readout 分析蒸馏对学生特征的重加权

    发表
    测试
    DeepSeek-R1-Distill-Qwen-1.5B、JustRL-DeepSeek-1.5B、DeepSeek-R1-Distill-Qwen-7B 等 6 个
    摘要OPD 与教师 rollout 上的 SFT 都不增加特征,而是重加权学生与教师已经共享的特征。

    作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。

    深度解读完整解读
  5. 可解释性arXiv 2609.35261

    Imprint Reader:从权重更新读出到行为干预

    用 SMaRT 从冻结权重更新读出知识与行为并用 MetaEdit 干预

    发表
    测试
    DeepSeek-V4-Flash、Qwen3-14B、Qwen3-30B-A3B-Instruct-2507
    摘要SMaRT 读出冻结更新,MetaEdit 用同坐标梯度在无目标任务数据时改原模型行为。

    Imprint Reader 把一次冻结权重更新读成关于新知识或新行为的话,并用同一套坐标上的梯度去改原模型。

    深度解读完整解读
已经到底了