ControlPed 生成逼真行人危险动作场景,七款端到端驾驶模型 HDScore 从 88.8 降至 47.4
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
- arXiv
- 2610.06171
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- DiffusionDrive、SSR、VAD 等 7 个
- 组件视频
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
重测提示注入检测器在 Agent 工具输出上的检出与任务阻断
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
构建 Agent Error Dataset,把智能体自然失败转为诊断与修复训练数据
AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。
提出 Drift-Bench++ 评测 Agent 在错位沟通和意图漂移下的对齐
Drift-Bench++ 是面向 Interactive Intent Alignment 的可执行基准:智能体要在用户说错、目标会变、耐心有限时,持续跟上当前意图。
测量面向开发者的 MCP 错误信息对工具调用 Agent 恢复的影响
MCP 错误信息里的下一步常常按人类开发者来写,而只能调用服务器工具的智能体会照着做。做不到就结束回合。作者先统计这类文本,再在 BFCL V4 上只更换错误文本,看回合状态能否回到参考调用之后。
发现暴露模型家族标签会让多智能体派系化并削弱合作
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
提出 AGENT BOUNDARY,用四向反事实任务评测工具智能体行动边界
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。
提出 SameFact,比较同一安全事实在判断与动作选择上的敏感度
摘要SameFact 显示同一安全事实的敏感度随模型、因子和引出协议共同变化。
定义工具调用 Agent 的持久计费状态,提出拒绝钱包攻击与防御
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。
测量记忆投毒防御在良性对话上的效用与 token 开销
在没有攻击的对话上,给记忆投毒防御计价,而不是再测一轮攻击是否被挡住。
评测安全 Agent 在对抗性任务污染下的解题成功与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
提出离线两阶段框架,诊断易翻转步骤并生成记忆指南以稳定智能体
作者要缩小的是 LLM 智能体平均通过、重复不稳之间的 consistency gap,即 Mean@k 减 Passˆk。
提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出检查点诊断法,区分长程安全 Agent 的失败来源
作者提出一套检查点诊断,用来判断长程安全智能体的失败发生在目标能力可测之前还是之后,并用配对干预检验上游解释。
提出 THINKINGBOX 基准评测有状态业务流程 Agent 的执行可靠性
摘要论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。
重测记忆型自改进 Agent 的运行方差与任务顺序敏感性
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
提出 IACM-RL,用信念状态与强化学习改进动态意图下的复杂工具调用