EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
- arXiv
- 2610.03153
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 PACE,在工具调用前做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
为 Agent 提出资源层授权系统 Pincer,用数字分身执行动态最小权限
Pincer 是加在现成 coding agent 上的资源层授权防御:用只受用户侧信息影响的 digital twin 做动态最小权限,并与 tool-call 层防御并存。要处理的是用户维护策略带来的权限蠕变和授权疲劳,以及不学习用户策略的 tool-call 分类器。作者引述工作称 auto mode 会放行多数不安全操作,并认为推理代码或复杂 shell 的效果在这一层不实际。
提出跨独立 Agent 的记忆跳跃攻击,经共享工件在助手间自传播
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
用 CoSec 评测社区 Agent 是否越界披露受保护信息
提出多智能体系统提示注入的威胁模型与四层架构防御
提出企业 MCP 零信任授权与发现扩展,在架构上拒绝提示注入下的越权调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出 IntentCap,按来源字段所有权合成并裁决 Agent 能力租约
IntentCap 是把智能体能力绑到当前任务意图、并按上下文来源划分字段所有权的权限机制。
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 SkillGuard,用可达性限制污染后的 Agent 能力
提出 PACE,用策略认证与签名决策记录拦截 DeFi 智能体违规交易
构建自演化基准 ActBench,评测协作智能体的行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
提出 MEMGHOST,用单封邮件对持久个人 Agent 做跨会话隐蔽记忆注入
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。