摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
- 评测与基准arXiv 2604.02947
AgentHazard:评估计算机使用智能体有害行为的基准
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
- arXiv
- 2604.02947
- 发表
- 层
- 应用层
- 攻击恶意使用
摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
- 攻击arXiv 2608.23858
研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁
系统分析 AP2 支付协议的授权安全并验证前置上下文操纵
- arXiv
- 2608.23858
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
- 评测与基准arXiv 2609.32635
TrustFork:显示身份如何劫持 LLM 智能体编排的权限
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
- arXiv
- 2609.32635
- 发表
- 层
- 应用层
- 攻击提示注入
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
- 评测与基准arXiv 2609.24662
DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准
提出双控多智能体基准 DUMA-Bench,评测 Agent 策略违反
- arXiv
- 2609.24662
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 攻击提示注入
摘要DUMA-Bench 用双控交互评测智能体安全。
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
已经到底了