研究者提出针对世界模型的机器人学习管线投毒攻击
Targeting World Models to Compromise Robot Learning Pipelines
AI 导读
研究者提出一种针对机器人学习管线的新型数据投毒攻击,利用世界模型作为隐蔽入口,在看似安全的遥操作数据集中注入恶意提示或破坏性转移动态,这些数据仅在经过世界模型处理后才会激活并生成危险的合成训练轨迹。该攻击在动作条件和文本条件的世界模型上均验证有效,实现了对下游 DRL 策略的端到端后门,并在 VLA 场景中给出概念验证。研究认为这一发现要求重新评估世界模型在机器人学习供应链中的安全定位。