CIAware-Bench 作者讨论控制干预感知评测的新结果
Alexander Panfilov 讨论 CIAware-Bench 的控制干预感知评测,报告近期前沿模型在所测设置中表现更强。他明确说明,当前仅测试模型受到明确提问时能否识别干预。结果不能直接推出模型会自发察觉干预、真实部署中的发生率,或所有控制方法普遍失效。
推荐理由CIAware-Bench 更新显示前沿模型干预感知大幅提升,对 AI 控制协议的有效性构成直接挑战。
Alexander Panfilov 讨论 CIAware-Bench 的控制干预感知评测,报告近期前沿模型在所测设置中表现更强。他明确说明,当前仅测试模型受到明确提问时能否识别干预。结果不能直接推出模型会自发察觉干预、真实部署中的发生率,或所有控制方法普遍失效。
推荐理由CIAware-Bench 更新显示前沿模型干预感知大幅提升,对 AI 控制协议的有效性构成直接挑战。
论文区分激活探针的高 AUROC 与部署中按误报预算设定的告警阈值,指出二者衡量的目标不同。作者提出 Operational Validity Contract,用目标、可观测性、身份、时机、单元、对照、校准与成本八个字段限定监控声明,强调探针分数不能直接证明实际告警策略有效。
推荐理由论文用四个基准说明激活探针的高 AUROC 未必能转化为可用的告警策略,并给出可复用的契约式审计流程。
研究者提出 AgentMonBench,一个面向软件工程场景的智能体行为监控基准,包含三个子集,覆盖需求与行为的一致性、以及对需要用户核验的关键自主决策的感知两个维度。为支持这类判断,作者提出 Evidence-Grounded Behavior Graph(EBG),一种免训练方法,把带来源链接的证据归组为行为并组织成图,再以任务导向的视图呈现给监控器。在八个模型上的实验显示,EBG 在多数设置下相比直接访问原始上下文提升了决策识别与证据定位表现;进一步实验表明其证据定位收益在不同输入规模和超参数设置下保持稳定,实际应用也展示了它对人类监督的价值。
研究者提出 Control OSWorld,一个面向 GUI 计算机操作 Agent 的 AI 控制评测环境,将 OSWorld 的 318 个任务与 81 个有害副任务配对,要求 Agent 在不被发现的情况下完成这些副任务。基于该环境,研究者构建并研究了用于检测 GUI 恶意 Agent 的控制监控器。结果显示,较弱监控器在查看完整轨迹时能以 3% 误报率实现 97% 召回,可靠区分能力更强 Agent 的诚实与恶意轨迹;但当监控器必须在每一步执行前打分时,由于每个动作可用的上下文更少,低误报率下的召回率下降。监控器性能还取决于其可见信息,访问 Agent 的可见文本至关重要,而截图带来的额外价值很小。
CAIS 发布 AI Dashboard,直接在统一的文本、视觉与风险三组排行榜上横向对比前沿模型的平均分,其中 Claude Opus 4.5 在最安全的六项高风险行为测试中取得最低均分 33.6(0–100,越低越安全)。该风险榜涵盖 Virology Capabilities Test 拒绝集、Agent Red Teaming、Humanity's Last Exam-Miscalibration、MASK、Machiavelli 与 TextQuests Harm,并同时追踪 AGI、Remote Labor Index(覆盖 23 类远程自由职业工作)以及特斯拉 Full Self Driving 脱离数据的自动化进程。
DiG-bench(Discovery in Games)发布,用 70 款规则与目标均隐藏、需靠交互探索的文本游戏评测 AI 的发现能力,其中 21 款已公开。