评测与基准arXiv 2610.03153
EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
- arXiv
- 2610.03153
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全失败
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
复现 AgentCF 上的多智能体攻防并刻画连通性作用
作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。
提出针对 Agent 护栏的推理扩展拒绝服务攻击
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。