CoVer:用干预检验为 Agent 构造可判定规则边界
提出 COVER,用干预门判定 Agent 规则谓词能否自动执行
- arXiv
- 2610.04699
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Claude Sonnet、Claude Opus、GPT-4o 等 5 个
摘要自可判定不能向模型索取。
这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。
提出 COVER,用干预门判定 Agent 规则谓词能否自动执行
这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。
提出 REGLLM 框架,评测受监管智能体何时作答或升级
REGLLM 是诊断有界自主的框架,示例是 UK FCA 合规智能体。作者把它做成 smoke 规模演示,而不是完整基准验证。
提出 AP2 支付协议的 Whisper 攻击与 A-VIP 绑定防御
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
部署方侧的两层证明,用来在多智能体跨部署方委托之后回答两个事后问题:谁放出了这些字节,这条跨部署方边有没有父方授权。
用 Tamarin 形式化分析智能体支付协议的跨阶段安全关系
提出利用检查点回滚破坏 Agent 执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉
SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。
提出 KidnapRAG,用投毒文档黑盒劫持 Agentic RAG 的推理链
KidnapRAG 是针对 Agentic RAG 的 black-box 语料投毒:攻击者不能访问模型、提示词、检索器或私有轨迹,只能发布可能被检索的文档,并利用公开界面上的推理与搜索查询。