评测与基准arXiv 2610.06171
ControlPed 生成逼真行人危险动作场景,七款端到端驾驶模型 HDScore 从 88.8 降至 47.4
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
- arXiv
- 2610.06171
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- DiffusionDrive、SSR、VAD 等 7 个
- 组件视频
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
提出 VoxParity,固定转写只改音频,评测语音智能体是否按行业规则改工具调用
VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。
用 MMPIBench 评测多模态提示注入对 Agent 框架的影响
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略
只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。