论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性
作者审计智能体激活监控器,指出高AUROC不等于低误报可用:AgentDojo在5%预算下检出率仅为.0526。
- .9571MUP 上 Joint 监控器的测试单元级 AUROC(Table 6)
- .6424MUP 上 Joint 监控器在 5% 预算下的实现 TPR(Table 6)
- .9215AgentDojo 上 Activation mean 的 rollout AUROC(Table 6)
探针高 AUROC 无法推导部署警报可用性,论文提出操作有效性契约与主张阶梯以约束监控器声明。
现有工作聚焦表征可达性与序列风险控制,本文约束相同视界比较、语义警报单元与冻结迁移审计。
论文构建八元操作有效性契约,通过独立单元最大值锁定 Beta 严格阈值,并以故障闭合编译器评级。
四基准审计表明高 AUROC 伴随低误报召回不足、校准漂移与支持度缺失,无设置达到警报策略有效性。
论文前瞻性测试存在支持度短缺与单模型单层限制,且未测量人工复核负担、干预收益与自适应攻击。
论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。