评测与基准arXiv 2608.30441
ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击
提出 ECLIPSE 双通道提示注入,劫持长程 Agent 的动作轨迹
- arXiv
- 2608.30441
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个
提出 ECLIPSE 双通道提示注入,劫持长程 Agent 的动作轨迹
构建 OpenART 竞技场,以 EMHA 演化持久环境评测智能体安全
提出 MEMGHOST,用单封邮件对持久个人 Agent 做跨会话隐蔽记忆注入
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出 MAStrike,用 Shapley 选联盟对多智能体做共谋红队
构建 Trojan Hippo Bench,评测 Agent 持久记忆投毒与外泄
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标
MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。
提出 DREAM 框架,评测 Agent 的跨环境长链攻击脆弱性
摘要DREAM 提出基于知识图谱与策略搜索的动态红队框架,分析了长链跨环境攻击对当前主流智能体的系统性威胁。