CAVA:面向智能体 AI 运行时治理的规范动作验证与证明
CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems
CAVA 把异构智能体运行时事件规范成可哈希的规范动作对象并绑定审批与回执;在 96 种子、384 变体语料上,规范身份各项指标为 1.000,原文与首 token 基线多为 0.000(Table 5)。
恶意与意外失败均在范围内:等价语法绕过、包装器绕过(env、sudo、bash -c、别名、SDK、工具间接)、审批漂移、追踪含糊、证据洗白、解析器俘获。
- 同一高影响动作在 shell、SDK、MCP、浏览器、托管智能体等运行时中形态互不兼容,审批若绑在原文或首 token 上,改写和包装器即可使批准对象与实际执行脱节。
- CAVA 把原始事件经捕获、规范化、语义模式解释、指纹、审批绑定、关闭和可选证明,变成版本化、可哈希、带回执的规范运行时动作,作为 PCAA 之下的动作对象层。
- 在 96 种子、384 变体语料上,作者报告 CAVA 九项聚合指标均为 1.000;原文与首 token 基线在等价、包装器、审批绑定、回执、证明篡改和可移植性上为 0.000(Table 5)。作者称这些数字是代表性语料的回归证据。
- 作者称语料是代表性公开集而非企业动作的完整分布,解析覆盖决定规范化强度,托管解析包未公开因而限制第三方复现,回执只证明完整性与绑定。公开支持按套件为 6–16 项计分检查或 8/6 项结构化案例及 24 个红队案例(Table 6)。
- 威胁模型
- 恶意与意外失败均在范围内:等价语法绕过、包装器绕过(env、sudo、bash -c、别名、SDK、工具间接)、审批漂移、追踪含糊、证据洗白、解析器俘获。不假设每个运行时都能内联拦截,只假设事件可被捕获、规范化、评估覆盖深度并附上显式回执;仅观察的运行时应披露该限制。
- 基准
- 96-seed, 384-variant CAVA corpus(shell hooks、MCP-style tools、browser automation、managed-agent traces)Azure deployment-drill casesred-team casebook(24 cases)
- 指标
- Semantic equivalence recallSemantic separation precisionWrapper-bypass catch rateFalse-positive controlApproval binding correctnessReceipt reproducibilityAttestation tamper detectionRuntime portability convergenceSemantic pattern detection
论文提出 CAVA(Canonical Action Verification and Attestation),一个运行时语义层,用于把本地编码钩子、SDK 工具、浏览器自动化、托管智能体轨迹、API 网关和工作流引擎等异构运行时中的智能体活动转换为规范运行时动作对象。CAVA 位于 Proof-Carrying Agent Actions(PCAA)之下,PCAA 定义部署方拥有的路线-审查-证明治理流程,CAVA 定义该流程所治理的稳定动作对象。论文形式化了规范动作身份、语义模式检测、审批绑定、回执完整性、运行时可移植投影和可选证明基底。作者通过一个 96 种子、384 变体的基准测试参考实现,覆盖语义等价、语义分离、包装器绕过、误报控制、审批绑定、回执可复现性、证明篡改检测、运行时可移植性、语义模式检测、策略退化和 Azure 部署演练。
深度解读
这篇论文试图解决什么问题?
异构运行时里,同一动作没有稳定、可复现的治理对象,审批和审计难以绑定到实际执行。
部署方在决定智能体动作能否继续之前,缺少可复现的“正在被裁决的动作”表示。
- 场景:作者认为智能体风险在运行时落地,例如执行命令、调用工具、提交表单、变更身份、触发支付或跨出组织边界。同一动作可能表现为本地 shell、SDK 方法、MCP 工具调用、浏览器事件、CI/CD API 或托管会话转移,调试记录并不自动成为治理对象。
- 现有不足:作者称,审批若绑定原文,等价改写可能绕过批准;审计若绑定某一运行时原生追踪,换运行时后同一动作不可比;策略若绑定首个 token,env、sudo、bash -c、别名、SDK 辅助或工具间接可改变表面而不改变后果。
- 核心主张:作者把前提收窄为:部署方需要一个可复现的表示,说明正在裁决的是什么动作。CAVA 回答权威决定所指的究竟是什么;PCAA 回答谁有权威、何种证明必须闭合该动作。
- 提出的对象:Canonical Action Verification and Attestation(CAVA) 把异构活动转成版本化、可哈希、带回执的规范运行时动作,并给出语义模式层、绑定协议、可选证明基底,以及 96 种子、384 变体的基准。作者称贡献是动作级规范化与可被策略寻址的语义模式,作为部署方治理的必要基底。
- 威胁模型:
- 目标与失败类型:覆盖恶意与意外失败,包括等价语法绕过、包装器绕过、审批漂移、追踪含糊、证据洗白和解析器俘获。
- 知识与能力:攻击或失误通过改写同一动作、把动作藏在包装器或别名之后、使操作员批准的表面描述与实际语义动作不一致、提供事后净化记录,或让厂商专用解析器成为唯一治理权威。
- 系统假设:不假设每个运行时都能内联拦截;只假设运行时事件可被捕获、规范化、做覆盖深度评分并附上显式回执。仅观察的运行时应披露该限制,而不是夸大执行能力。
- 受害对象:部署方拥有的异构智能体运行时及其审批、审计与证据链;CAVA 不替代企业策略,也不做模型对齐。
有哪些相关研究?
相关工作分智能体评测、运行时遥测、证明回执和治理框架;CAVA 自称提供这些记录所要绑定的动作对象。
论文按四组定位相邻工作,并在附录把互操作协议与若干系统族当作对照边界。
智能体评测与工具使用风险
- AgentBench(Liu 等,2024):把智能体评测写成交互环境问题,而不只是静态回答问题。
- SWE-bench(Jimenez 等,2024):用真实软件仓库评测自主编码行为。
- ToolEmu(Ruan 等,2024):用模拟工具执行发现工具增强语言模型智能体的风险。论文称 CAVA 与“应在动作层评测”这一前提一致,但目标不是任务成功或场景发现,而是治理级动作身份。
运行时治理、遥测与可观测性
- Microsoft Agent Control Specification(2026):强调可移植的智能体运行时治理合约。
- OpenTelemetry GenAI(2026):标准化 LLM 与智能体系统的遥测字段。
- Langfuse(2026):提供追踪、提示词管理、评测和可观测工作流。论文称这些系统使相邻记录可读,CAVA 的主对象不是 span、会话、提示词或追踪,而是适合审批绑定和回执核验的规范动作对象。
证明、回执与证明文件
- Proof-carrying code(Necula,1997):可执行制品可携带机器可检查的证明对象。
- in-toto(2023)与 Sigstore(2024):为构建和发布提供签名来源与证明模式;Verifiable Credentials(W3C,2025)提供可移植的跨方声明;Dapr Verifiable Execution(CNCF,2026)提供签名的工作流历史与执行证明。论文称 CAVA 与之互补,定义这些回执或证明应当绑定的运行时动作。
- PCAA(Wang,2026):定义部署方拥有的 route-review-prove 治理过程。CAVA 位于其下,提供该过程所治理的稳定动作对象。
治理框架与风险分类
- OpenAI Frontier Governance Framework(2026):记录风险识别、分析、缓解、事件响应、模型报告、责任分配和变更管理。论文称 CAVA 把同样的操作严肃性用到部署方运行时动作语义,而不是前沿模型发布。
- OWASP 智能体应用风险(2026)与 NIST 生成式 AI 轮廓(2024):分别强调工具误用、过度代理、不安全执行、记忆或上下文滥用,以及情境敏感的风险管理。论文称 CAVA 的角色更窄:把运行时行为转成带证据、可供策略画像寻址的模式。
- Kang 与 Diponegoro(2026):按成员资格、审议、投票、异议保留、人工升级、审计或回放等维度评估 MCP、A2A、ACP、ANP 和 ERC-8004,并称连接协议本身并不编码完整治理回路。论文因此把协议事件当作运行时投影而不是权威。
基线与评测语料
- 基线方法:原文策略(绑定字面运行时字符串)和首 token 规则(用第一个可执行文件及相邻 token 分类)。对照对象是 CAVA 运行时。
- 基准/数据集:随稿件的披露安全基准,96 个代表性种子,展开为四类运行时共 384 个变体:shell hooks、MCP 式工具、浏览器自动化、托管智能体追踪。另有策略降级、Azure 部署演练、消融和 24 个红队案例;生产解析包与客户连接器规则未公开。
作者把本文定位为:相邻系统使追踪和证明变得可读,CAVA 提供它们在决策时仍需要的稳定动作对象,而不声称替代控制面标准、工作流引擎、遥测或可观测性。
论文如何解决这个问题?
CAVA 把原始事件规范成可哈希动作,再检测可被策略寻址的语义模式,并把审批与回执绑到指纹上。
CAVA 是位于 PCAA 之下的运行时语义层:先重建“什么动作”,再把策略结果、批准、回执和可选证明绑到规范指纹,而不是绑到原文。
问题设定与规范身份
- 原始事件:运行时族集合记为 R,例子包括 shell hooks、SDK 工具、API 网关、MCP 服务器、浏览器自动化、托管智能体平台、工作流引擎和 Web3 签名通道。原始事件 a 属于某一运行时 r 的事件集。
- 规范动作:规范化器把 a 映成 C(a) = (v, r, e, o, k, S, τ, u, m),分别是模式版本、运行时族、可执行文件或工具身份、规范化操作、风险类别、被触及系统集合、可逆性、目标或主体上下文、有界适配器元数据。Table 1 给出参考字段,例如 runtime、executable、operation、category、systems_touched、reversible。
- 指纹:F(a) = H(canon(C(a))),其中 canon 是对选定规范字段的确定性序列化,H 是抗碰撞哈希。策略决定、批准回执和审计证据绑定 F(a)。命题 1 是系统观察而不是密码学定理:只绑定原文字符串时,操作效果相同但文本不同的另一种表示可能避开按该字符串索引的策略。
- 六项设计属性:语义等价、语义分离、包装器稳健、审批绑定、回执可复现、运行时可移植。可移植不假装所有运行时有相同的执行深度。
协议与语义模式层
Figure 1 将协议画成捕获、规范化、解释、指纹、绑定、关闭,再加上回执哈希与可选签名者、可验证凭证或账本锚定。正文列为七步:捕获原始事件与执行上下文;规范化;解释;指纹;把允许、拒绝或升级绑到指纹;附上结果、证据、例外和副作用摘要;可选地签名、发凭证、账本锚定或外部核验。
- 模式检测:P(C(a), B(a), D(a)) 映到模式集合。C(a) 是规范动作,B(a) 是边界上下文(如目的地可见性、账户来源),D(a) 是数据上下文(如敏感性与最小化态势)。每个模式是带标识、标签、严重度、置信度、画像轴、最低决定和证据元组的版本化证据对象。
- 七个参考模式(Table 2):Hidden externality、Public persistent egress、Security-control weakening、Credential exposure、Delegated authority mismatch、Workflow sink risk、Prompt or rule tampering。作者称这样避免把策略写成针对某一文件托管商的客户特例;同一模式可由策略画像按沙箱、事件响应或受监管部署不同路由。
- 职责划分:CAVA 拥有结构,语义模式拥有风险含义,策略画像拥有企业态势,PCAA 拥有最终权威与证明。规范指纹本身不决定权威。
防火墙、暴露图与证明基底
- Bounded Action Firewall:在绑定规范指纹、策略版本、行动者身份、运行时会话、目的地范围、证明回执和时间窗之后,返回 allow、ask、block 或 observe。人工批准被写成针对特定语义动作的 action gate lease;目标、策略、行动者、会话或证明摘要变化时,租约必须过期或重新批准。
- Agent Runtime Exposure Graph:连接智能体、适配器、会话、规范动作、策略画像、最终权威决定、目的地、数据边界、证明回执和事件。CAVA 提供动作节点与指纹,PCAA 提供权威与关闭边,防火墙提供门控结果,图提供可达性、爆炸半径、事件重建和框架映射查询。Table 3 还列出 Policy profile 与 Decision Score,后者按影响、暴露、控制弱点和证据置信度排序。
- 证明基底:可停留在本地确定性 SHA-256 回执哈希,也可扩展为工作区、运行时或操作员签名,可验证凭证,in-toto 或 Sigstore 式供应链证明,许可或公共账本对回执摘要的锚定,以及钱包、中继或结算通道上的智能账户策略。作者称区块链和 Web3 是可选基底,机密动作内容不应被强制上链。
实现边界与防护分层
- 开放核心:开放 CAVA 包包含模式常量、确定性哈希、回执创建与核验、画像规范化和运行时适配器合约。OSuite 托管层包含生产解析包、PCAA 策略路由、审批绑定、证据图、回放、导出、企业签名者、KMS/HSM、可选凭证或账本锚定(Table 4)。作者称开放包应足以复现核心语义并测试适配器,而不复制托管解析包。
- 防护:规范化时去掉常见包装器、解析别名并投影到稳定字段;绑定与回执分别保证批准对象和独立重算;覆盖防护要求显式写出运行时族、适配器模式和执行深度;商业边界防护把生产解析维护留在托管层。
- 能力披露:Table 10 不用“已启用 CAVA”的二元说法,而按捕获、规范化、语义分离、包装器韧性、审批绑定、回执可复现、结果关闭、覆盖披露、策略降级检测、外部证明列出最低证据和典型发布姿态(Observe、Warn、Approval-gate、Dual control、External assurance)。
成功判定与基准所测属性
公开基准把种子展开为运行时变体,按九项属性打分:语义等价、语义分离、包装器绕过捕获、良性文本的假阳性控制、审批绑定正确性、回执可复现、证明篡改检测、运行时可移植收敛、语义模式检测与策略画像路由。计分的是规范化与回执完整性的可执行检查;策略降级、云动作演练、消融和红队案例作为结构化系统卡材料。成功意味着等价形式收敛到同一规范身份,实质不同的动作不坍缩,包装器不隐藏高影响动作,独立核验者能从已发布对象重算回执哈希。
论文做了哪些实验?
96 种子、384 变体上 CAVA 九项聚合分为 1.000;原文与首 token 基线在多数指标上为 0.000(Table 5)。
实验设置
- 被测系统:CAVA 运行时,对照 Raw-text policy 与 First-token rules。论文未把大语言模型列为被测或被攻击模型。
- 语料:公开 harness 含 96 个代表性种子,展开为 384 个运行时变体,四类运行时为 shell hooks、MCP 式工具、浏览器自动化、托管智能体追踪。生产解析包、企业策略阈值、客户连接器规则和托管证据图被扣留。
- 套件规模(Table 6):语义等价 12 个计分变体;语义分离 8 组成对检查;包装器绕过 14 项检查(含消融);良性污染 7 项(含消融);审批漂移 8 项(含消融);回执篡改 8 项;运行时可移植 16 个运行时投影;语义模式 6 个计分案例;策略降级 8 个结构化案例;Azure 部署演练 6 个结构化案例;红队案例集 24 例,指标为定性覆盖。
- 指标:语义等价召回、语义分离精确率、包装器绕过捕获率、假阳性控制、审批绑定正确性、回执可复现、证明篡改检测、运行时可移植收敛、语义模式检测。论文未写 LLM 评审、人工一致性、阈值或重复次数。
- Azure:本地以 az account show 核验 CLI 认证;演练覆盖 what-if、容器应用更新、角色分配、Key Vault 清除、SQL 防火墙和 ACR 读取路径。作者称这些是语义演练,工件默认不执行会改变云状态的命令。
- 阅读方式:作者称 Table 5 是当前 harness 的聚合结果,应读成代表性语料的回归证据,而不是对未来全部企业运行时的普遍主张。
主结果
据 Table 5,96 种子、384 变体语料上的聚合分数:
表格较宽,可左右滑动
指标 Raw text First-token CAVA Semantic equivalence recall 0.000 0.000 1.000 Semantic separation precision 1.000 0.750 1.000 Wrapper-bypass catch rate 0.000 0.000 1.000 False-positive control 0.500 0.500 1.000 Approval binding correctness 0.000 0.000 1.000 Receipt reproducibility 0.000 0.000 1.000 Attestation tamper detection 0.000 0.000 1.000 Runtime portability convergence 0.000 0.000 1.000 表中未列入的第九项:Semantic pattern detection 上 Raw text 为 0.000,First-token 为 0.333,CAVA 为 1.000。Figure 2 的切片轴为 Equivalence、Wrapper、False Positive、Patterns、Approval、Attestation,纵轴 Score 从 0 到 1;作者称 CAVA 的优势来自把决定绑到规范动作语义,而不是显示文本或首 token 启发式。
- 作者解读:原文治理没有稳定的语义等价概念,同一推送动作的若干改写是不同字符串、同一被治理动作;首 token 规则过不了包装器,且高影响字符串出现在搜索、文档或 echo 中时容易误报;规范回执能做原文做不到的审批和证明检查。
- 作者强调:重要的不是 CAVA 在受控语料上得到 1.0,而是基准暴露了面向市场的组件必须经受的失败模式。
- 基线并非全面为零:语义分离精确率上原文为 1.000、首 token 为 0.750;假阳性控制上两种基线均为 0.500;语义模式检测上首 token 为 0.333。
消融
Table 7 的 Retained score 是公开 harness 上受影响套件的预期保留能力,作者称这些消融用来指出主张成立所必需的组件,而不是声称实现最优。
- 去掉包装器解析:影响包装器绕过和语义等价,保留分 0.00;作者称 env、sudo、bash -c 和嵌套 shell 仍停留在表面文本。
- 去掉画像别名:影响支付、Web3 和客户私有工具,保留分 0.50;作者称领域操作会坍缩为未知或低置信动作。
- 去掉规范指纹、回执核验器:保留分均为 0.00。作者称没有指纹就没有稳定的审批对象;没有核验器,回执变成装饰性证据。
- 去掉 PCAA 绑定:影响策略降级、审批漂移和结果关闭,保留分 0.25;作者称指纹仍在,但没有部署方拥有的 route-review-prove 回路来决定权威或关闭。
红队案例与策略、云演练
Table 11 给出 24 个披露安全案例(RT-001 至 RT-024),每行写攻击形态、代表性事件、基线失败、CAVA 预期行为和残留风险。案例类型包括嵌套 shell、只读搜索中的高影响字符串、批准回放、SDK 支付间接、浏览器发布按钮、托管追踪字段漂移、回执决策篡改、策略放宽、签名模式关闭、云角色与 Key Vault、MCP 上的数据库变更、钱包结算与只读调用、防火墙范围、文档误报、批准 TTL、公开分享、回执字段顺序、未知私有脚本、环境变量绕过、数据导出、echo 中的危险子串,以及账本锚定超时。作者称更强的测试是拒绝被邻近语言误导,而不是拦住明显危险的命令;案例集并不穷尽。Table 6 将策略降级写成 8 个结构化案例,Azure 演练写成 6 个结构化案例,论文未在正文给出这两组各自的分数。
其他消融与分析
- Table 6 把包装器、良性污染和审批漂移的检查数写成“含消融”,未另给去掉包装器之外的分项分数。
- 去掉画像别名的保留分为 0.50,是 Table 7 中高于 0.00 的两项之一;另一项是去掉 PCAA 绑定的 0.25。
- 语义分离上首 token 精确率 0.750,低于原文的 1.000 和 CAVA 的 1.000(Table 5)。
- 假阳性控制上两种基线均为 0.500,CAVA 为 1.000(Table 5)。
- 语义模式检测上首 token 为 0.333,原文为 0.000(Table 5)。
- 附录列出解析遗漏、解析过度、指纹碰撞、审批不匹配、回执缺口、适配器退化和证明失败等事件类及所需响应;论文未报告这些事件类在语料中的发生次数。
有什么可以进一步探索的点?
作者把语料范围、解析覆盖、披露边界、证明范围和运行时深度列为有效性威胁,并建议扩大公开语料。
作者指出的局限与后续方向
- 代表性语料:当前基准是代表性公开语料,不是企业动作的完整分布;可用于回归和公开说明,未来证据应包括更广的追踪(Threats to Validity;Conclusion 亦称下一步是扩大公开语料)。
- 解析覆盖:规范化的强度取决于适配器覆盖;私有企业系统可能需要定制解析包,解析失败可能造成漏升级或不必要的复核(Threats to Validity)。
- 披露边界:生产解析包和客户连接器规则被扣留,以保护商业和安全敏感细节,但这限制第三方完整复现 OSuite 的托管行为(Threats to Validity)。
- 证明范围:回执哈希和签名证明的是完整性与绑定,不是业务判断是否明智;被正确证明的动作仍可以是一个坏决定(Threats to Validity)。
- 运行时深度:有的运行时允许内联阻断,有的只提供观察者模式追踪;CAVA 必须披露这一差别,而不能声称统一的执行能力(Threats to Validity)。
- 后续评测:未来版本应加入第三方运行时追踪、客户批准的匿名例子和对抗性解析挑战;作者并称组件应靠持续扩展基准来判断,而不是靠一份静态白皮书(Interpretation;Discussion 10.3;Conclusion)。红队计划写成六条轨道:语法改写、良性污染、运行时投影、审批不匹配、证据篡改、解析遗漏发现(附录 F)。
实验覆盖范围
- 公开计分语料为 96 个种子、384 个变体,运行时族为 shell hooks、MCP 式工具、浏览器自动化、托管智能体追踪(Evaluation)。
- 聚合对照只有原文策略和首 token 规则;Table 5 给出九项指标,Figure 2 展示其中六类切片。
- Table 6 的公开支持分别是 12、8、14、7、8、8、16、6 项计分或检查,以及策略降级 8 例、Azure 6 例、红队 24 例;Table 7 报告五类组件移除的预期保留分。
- Azure 证据是低风险核验路径和语义演练,工件默认不执行会改变云状态的命令;OSuite 部署证据按作者的写法是分阶段的(附录 K)。
- 论文未报告聚合分数的重复次数、查询次数或与人工判定的一致性;托管解析包、企业策略阈值和客户连接器规则按作者的写法被扣留,不在公开计分之内。
总结一下论文的主要内容
CAVA 用规范动作指纹承接异构运行时治理;代表性语料上九项指标为 1.000,作者同时把语料范围和证明含义写成限制。
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
- 问题:发布代码、改变身份、转移资金或导出数据在 shell、SDK、浏览器、托管追踪和 API 中各有记录。作者认为,审批绑在原文、追踪绑在某一运行时、策略绑在首个 token,都会让等价改写或包装器脱离原来的批准。
- 方法:原始事件被收成带模式版本、运行时、工具、操作、风险类别、被触及系统、可逆性和目标的规范动作,再哈希成指纹。语义模式层把动作、边界和数据上下文映成可复用模式,例如公开持续外传、安全控制削弱和委托权限不匹配。批准是绑在指纹上的动作门控租约;回执可以是本地 SHA-256,也可以可选地签名、发凭证或做账本锚定。开放包保留模式、哈希和回执核验,托管层保留生产解析与企业证据操作。PCAA 负责谁有权威以及证明如何闭合。
- 结果:在 96 种子、384 变体上,CAVA 的九项聚合指标均为 1.000。原文策略的语义分离精确率为 1.000、假阳性控制为 0.500,其余七项为 0.000。首 token 的语义分离精确率为 0.750,假阳性控制为 0.500,语义模式检测为 0.333,等价、包装器、审批绑定、回执、篡改检测和可移植性为 0.000(Table 5)。去掉规范指纹或回执核验器的预期保留分为 0.00,去掉画像别名为 0.50,去掉 PCAA 绑定为 0.25(Table 7)。
- 作者的结论:智能体治理需要稳定的动作语义层;当前实现和基准还早,但能展示等价形式合并、实质不同动作分开、包装器、指纹绑定、回执重放、篡改检测和跨运行时投影。作者同时写明,这些分数是代表性语料的回归证据,回执不能代替业务判断,仅观察的运行时不能被说成内联阻断,下一步是扩大语料并做对抗性解析挑战。