防御arXiv 2607.13716
CAVA:面向智能体 AI 运行时治理的规范动作验证与证明
提出 CAVA,把异构智能体运行时事件规范成可哈希动作并绑定审批与回执
- arXiv
- 2607.13716
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
摘要CAVA 用规范动作指纹承接异构运行时治理。
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 CAVA,把异构智能体运行时事件规范成可哈希动作并绑定审批与回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。