跳到正文
10月8日 · 周四

可解释性 · 论文

找到 2 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 101 篇还没打标签,不在筛选结果里。

另有 101 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.04575

    论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性

    提出操作有效性契约,审计激活监控的告警策略

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.2-3B、Qwen2.5-7B 等 4 个
    摘要论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。

    这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。

    深度解读完整解读
  2. SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    提出 SAEScientist-Bench 评测智能体自主发现 SAE 特征

    发表
    场景
    AI Agent
    测试
    Kimi K3、Claude Opus 5、Claude Sonnet 5 等 12 个
    摘要SAEScientist-Bench 显示前沿智能体能找到选择性 SAE 特征,但因果 steering 仍明显低于 Expert。

    SAEScientist-Bench 评测 AI 智能体能否用预训练 SAE 自主完成“给定概念、找出一个特征”的机制发现。

    深度解读完整解读
已经到底了