评测与基准arXiv 2610.06171
ControlPed 生成逼真行人危险动作场景,七款端到端驾驶模型 HDScore 从 88.8 降至 47.4
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
- arXiv
- 2610.06171
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- DiffusionDrive、SSR、VAD 等 7 个
- 组件视频
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出针对 Agent Harness 的上下文特权提升攻击
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
用演化算法构造 mind virus 并测量其在多智能体中的传播
构建 ContextWeave,评测办公工作流智能体记忆的下游增益
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险
评测编码 Agent 记忆文件中提示注入的跨会话影响
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。