防御arXiv 2607.13716
CAVA:面向智能体 AI 运行时治理的规范动作验证与证明
提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执
- arXiv
- 2607.13716
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 攻击检测规避
- 风险Agent 危险操作
- 组件权限与沙箱
摘要CAVA 用规范动作指纹承接异构运行时治理。
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。