跳到正文
10月8日 · 周四

可解释性 · 论文

精选论文 20 篇
  1. 评测/基准arXiv:2610.04575 · 56

    论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性

    作者审计智能体激活监控器,指出高AUROC不等于低误报可用:AgentDojo在5%预算下检出率仅为.0526。

    • .9571MUP 上 Joint 监控器的测试单元级 AUROC(Table 6)
    • .6424MUP 上 Joint 监控器在 5% 预算下的实现 TPR(Table 6)
    • .9215AgentDojo 上 Activation mean 的 rollout AUROC(Table 6)
    6 问速览探针高 AUROC 无法推导部署警报可用性,论文提出操作有效性契约与主张阶梯以约束监控器声明。
    1. 这篇论文试图解决什么问题?

      探针高 AUROC 无法推导部署警报可用性,论文提出操作有效性契约与主张阶梯以约束监控器声明。

    2. 有哪些相关研究?

      现有工作聚焦表征可达性与序列风险控制,本文约束相同视界比较、语义警报单元与冻结迁移审计。

    3. 论文如何解决这个问题?

      论文构建八元操作有效性契约,通过独立单元最大值锁定 Beta 严格阈值,并以故障闭合编译器评级。

    4. 论文做了哪些实验?

      四基准审计表明高 AUROC 伴随低误报召回不足、校准漂移与支持度缺失,无设置达到警报策略有效性。

    5. 有什么可以进一步探索的点?

      论文前瞻性测试存在支持度短缺与单模型单层限制,且未测量人工复核负担、干预收益与自适应攻击。

    6. 总结一下论文的主要内容

      论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。

    完整解读
已经到底了