跳到正文
10月4日周日
  1. 论文追踪 · 收录 · 原文 论文36

    CAVA:面向智能体 AI 运行时治理的规范动作验证与证明

    论文提出 CAVA(Canonical Action Verification and Attestation),一个运行时语义层,用于把本地编码钩子、SDK 工具、浏览器自动化、托管智能体轨迹、API 网关和工作流引擎等异构运行时中的智能体活动转换为规范运行时动作对象。CAVA 位于 Proof-Carrying Agent Actions(PCAA)之下,PCAA 定义部署方拥有的路线-审查-证明治理流程,CAVA 定义该流程所治理的稳定动作对象。论文形式化了规范动作身份、语义模式检测、审批绑定、回执完整性、运行时可移植投影和可选证明基底。作者通过一个 96 种子、384 变体的基准测试参考实现,覆盖语义等价、语义分离、包装器绕过、误报控制、审批绑定、回执可复现性、证明篡改检测、运行时可移植性、语义模式检测、策略退化和 Azure 部署演练。

10月1日周四
  1. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文46

    Provisional Reachability:用可撤销的每次跨越限制 Agent

    论文提出一种把 Agent 每次跨越都置于托管窗口、按概率 r 独立审计并在发现问题时撤销窗口的机制,用于限制信息泄露。作者推导出对手跨越 k 次、每次携带 c 比特时的期望泄露上界 L(r) ~ c/(er),该上界是对手选择上的上确界,因此方案可以公开,模拟结果与公式相差 7.7 个标准误。作者指出托管本身只是速率限制而非总量限制,秘密仍可能在每次运行中拼装完成;若被托管比特每期以比例 mu 衰减,持有量会收敛到 g/mu,当 mu > g/L 时 L 比特的秘密不可达,在 20,000 个窗口的模拟中 0.9mu* 时 100% 运行完成拼装、2mu* 时 0%。

已经到底了