评测与基准arXiv 2609.03026
ObserverBench:用干预与控制任务检验机制可解释性估计
提出 ObserverBench,比较机制估计精度与动作损失
- arXiv
- 2609.03026
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- two-block Transformers、GPT-2-small、Qwen2.5-7B 等 6 个
摘要ObserverBench 在固定决策下分开报告估计精度与动作损失,三者可以不一致。
ObserverBench 评测一个内部观察器是否够格指导某项具体干预、闭环或安全策略,而不是只看平均估计精度。