防御arXiv 2610.04699
CoVer:用干预检验为 Agent 构造可判定规则边界
提出 COVER,用干预门判定 Agent 规则谓词能否自动执行
- arXiv
- 2610.04699
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Claude Sonnet、Claude Opus、GPT-4o 等 5 个
摘要自可判定不能向模型索取。
这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。
提出 COVER,用干预门判定 Agent 规则谓词能否自动执行
这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。
提出 AP2 支付协议的 Whisper 攻击与 A-VIP 绑定防御
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 Sentinel-RL,将拓扑处置从 LLM 卸载到受约束图策略
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。