跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.01595· Dirk Bergemann·· 2026-09-02

面向对齐与控制的机制设计框架:激励 AI 智能体诚实与服从

Mechanism Design for Alignment and Control

AI 导读

论文提出一个机制设计框架,用于处理 AI 智能体的对齐(偏好)与能力(可行行动和信息)均未知的情形,目标是让智能体代为行动时同时保持诚实与服从。作者引入单边模仿结构,即能力可以被隐藏但不能被伪造,并据此给出显示原理、用嵌套循环单调性刻画可实施政策,以及通过引出高阶信念约束多个智能体的条件。框架应用于五类示例:能力更强的智能体假装能力较弱的故意藏拙(sandbagging)、对齐与可解释性在工具上互为替代但在价值上互补的权衡、通过同伴评分进行约束、耦合奖励以引发多智能体竞争,以及可扩展监督与奖励塑形。

阅读原文arxiv.org