CAGE:面向工具调用 Agent 的类型化返回不确定性认证授权方法
CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents
AI 导读
研究者提出 CAGE,用于在工具返回存在绑定错误与数值漂移时,判断候选动作是否仍处于授权范围内。作者证明分类通道与数值通道分别认证无法组合,各自安全的扰动可能联合使同一动作变得不安全,因此 CAGE 直接对联合邻域做认证,精确枚举离散分支并在每个分支内认证连续扰动。在合成、policy-as-code、监管与真实交易等场景中,CAGE 消除了精确逐点门控会放行的预算内误授权,同时保留一定比例可自主执行的决策。当策略可执行时由 CAGE-Exact 认证策略本身,否则由 CAGE-Lip 与 CAGE-RS 在明确且可测量的保真度假设下认证学习得到的门控。