跳到正文
原文
arXiv:可解释性· arXiv:2609.03026· Vijay Erramilli·· 29 天前

ObserverBench:用干预与控制任务检验机制可解释性估计

ObserverBench: Testing Mechanistic Estimates for Intervention and Control

AI 导读

研究者提出 ObserverBench,一个用于检验内部估计器(observer)是否足以支撑干预、控制或安全任务的基准框架。每个任务固定模型、信息边界、允许动作、决策规则、留出案例和损失,并分别报告估计准确率与所选动作造成的损失。在 GPT-2-small 和 Qwen2.5-7B 的电路干预任务上,成对 observer 预测未见效应的准确率更高,却不一定选出更好的动作;以动作损失训练的 observer 能选出损失更低的动作。在安全分诊中,能完美区分违规的分数在违规成本不同时仍可能分配不好固定干预预算。

阅读原文arxiv.org