跳到正文
10月9日 · 周五

可解释性 · 论文

找到 3 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 62 篇还没打标签,不在筛选结果里。

另有 62 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.04575

    论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性

    提出操作有效性契约,审计激活监控的告警策略

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.2-3B、Qwen2.5-7B 等 4 个
    摘要论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。

    这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。

    深度解读完整解读
  2. 评测与基准arXiv 2610.02928

    研究用变异分析检验智能体基础设施验证套件的覆盖能力

    用变异分析检验会话投影层不变式套件的缺陷覆盖

    发表
    摘要作者称通常的通过/失败证据价值不大:认证过的套件仍只杀死十个外部故障中的五个。

    作者测量一套看守智能体基础设施的不变式套件:通常拿来许可部署的「通过正确代码、失败损坏代码」,实际上能支持什么。

    深度解读完整解读
  3. SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    提出 SAEScientist-Bench 评测智能体自主发现 SAE 特征

    发表
    场景
    AI Agent
    测试
    Kimi K3、Claude Opus 5、Claude Sonnet 5 等 12 个
    摘要SAEScientist-Bench 显示前沿智能体能找到选择性 SAE 特征,但因果 steering 仍明显低于 Expert。

    SAEScientist-Bench 评测 AI 智能体能否用预训练 SAE 自主完成“给定概念、找出一个特征”的机制发现。

    深度解读完整解读
已经到底了