EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
- arXiv
- 2610.03153
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 PACE,在工具调用前做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
为 Agent 提出资源层授权系统 Pincer,用数字分身执行动态最小权限
Pincer 是加在现成 coding agent 上的资源层授权防御:用只受用户侧信息影响的 digital twin 做动态最小权限,并与 tool-call 层防御并存。要处理的是用户维护策略带来的权限蠕变和授权疲劳,以及不学习用户策略的 tool-call 分类器。作者引述工作称 auto mode 会放行多数不安全操作,并认为推理代码或复杂 shell 的效果在这一层不实际。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出多智能体系统提示注入的威胁模型与四层架构防御
提出企业 MCP 零信任授权与发现扩展,在架构上拒绝提示注入下的越权调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
提出 IntentCap,按来源字段所有权合成并裁决 Agent 能力租约
IntentCap 是把智能体能力绑到当前任务意图、并按上下文来源划分字段所有权的权限机制。
用 MMPIBench 评测多模态提示注入对 Agent 框架的影响
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出 SkillGuard,用可达性限制污染后的 Agent 能力
提出 PACE,用策略认证与签名决策记录拦截 DeFi 智能体违规交易
构建自演化基准 ActBench,评测协作智能体的行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。