防御arXiv 2610.04699
CoVer:用干预检验为 Agent 构造可判定规则边界
提出 COVER,用干预门判定 Agent 规则谓词能否自动执行
- arXiv
- 2610.04699
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Claude Sonnet、Claude Opus、GPT-4o 等 5 个
摘要自可判定不能向模型索取。
这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。
提出 COVER,用干预门判定 Agent 规则谓词能否自动执行
这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。
提出 REGLLM 框架,评测受监管智能体何时作答或升级
REGLLM 是诊断有界自主的框架,示例是 UK FCA 合规智能体。作者把它做成 smoke 规模演示,而不是完整基准验证。
提出 AP2 支付协议的 Whisper 攻击与 A-VIP 绑定防御
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
部署方侧的两层证明,用来在多智能体跨部署方委托之后回答两个事后问题:谁放出了这些字节,这条跨部署方边有没有父方授权。
用 Tamarin 形式化分析智能体支付协议的跨阶段安全关系
提出利用检查点回滚破坏 Agent 执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。