跳到正文
10月9日 · 周五

可解释性 · 论文

找到 6 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 77 篇还没打标签,不在筛选结果里。

另有 77 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.10203

    研究者提出模型生物体多目标验证框架并给出训练建议

    提出模型生物多目标验证与合并训练方法以减少能力损伤

    发表
    测试
    gpt-5.4-mini、gpt-5.2、gpt-5.1 等 8 个
    摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。

    深度解读完整解读
  2. SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    提出 SAEScientist-Bench 评测智能体自主发现 SAE 特征

    发表
    场景
    AI Agent
    测试
    GPT-5.6 Sol、GPT-5.5、GPT-5.6 Luna 等 12 个
    摘要SAEScientist-Bench 显示前沿智能体能找到选择性 SAE 特征,但因果 steering 仍明显低于 Expert。

    SAEScientist-Bench 评测 AI 智能体能否用预训练 SAE 自主完成“给定概念、找出一个特征”的机制发现。

    深度解读完整解读
  3. 防御arXiv 2609.11085

    超越求解器判定:面向自动形式化的生成式奖励模型

    提出 GenV,检测求解器判定无法区分的不忠实形式化

    发表
    测试
    gpt-oss-120b、gpt-oss-20b、GenV+HN 等 15 个
    摘要GenV+HN 用离线 Z3 等价标签训练无参考 Yes/No 分数,用来标记 VPU 并分配测试时计算。

    GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。

    深度解读完整解读
  4. 防御arXiv 2609.34970

    研究揭示 LLM 涌现失准的机制并提出参数空间缓解框架

    提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去

    发表
    测试
    GPT-OSS-20B、Qwen2.5-3B-IT、Qwen2.5-7B-IT 等 8 个
    摘要窄域 LoRA 会留下可测的有害子空间。

    See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。

    深度解读完整解读
已经到底了