跳到正文
原文
arXiv· arXiv:2609.07051· Wenkai Huang·· 25 天前精选关注度78

TrojanWorld:通过想象引导对世界模型智能体植入后门

TrojanWorld: Backdooring World-Model Agents via Imagination Steering

AI 导读

研究者提出 TrojanWorld,一种针对世界模型智能体的供应链后门框架,通过引导模型内部想象而非改动决策模块来诱发攻击者指定的行为。攻击以场景中放置的物理物体作为触发器,经智能体原生观测管线激活,无需数字篡改观测流。框架由三项机制组成:Decision-Reflective Induction 利用决策反馈将触发条件下的想象导向目标动作,Clean Behavior Anchoring 保持无触发时的预测与行为保真度,Causal Propagation 在触发器消失后沿后续轨迹延续被诱导的偏好。研究还测试了 Fine-Pruning、SHINE 和 Neural Cleanse 三种防御的适配版本,没有一种能在保持干净效用的同时完全移除攻击。

论文速读

问题
预训练 world model 被广泛分发复用,其供应链面临后门威胁,但针对交互式 world-model agent 的后门攻击研究仍空白。作者关注:攻击者能否污染 world model,借其内部想象控制 agent 行为。
方法
提出 TrojanWorld:上游训练时只改 world model、冻结决策模块,用场景中物理物体作触发器。三个目标——Decision-Reflective Induction 借决策反馈把触发条件下的想象导向指定动作,Clean Behavior Anchoring 保持无触发时的预测与行为一致,Causal Propagation 让偏好延续到触发器消失之后。
实验与结果
在 TD-MPC2、DreamerV3、R2-Dreamer 与 DMC、MetaWorld、MyoSuite、RoboDesk 上测试:触发时目标动作偏差最低 0.026,保留至少 98.8% 干净性能;触发器移除后 agent 仍可能继续执行指定动作。Fine-Pruning、SHINE、Neural Cleanse 的适配防御均未能同时移除攻击并保住干净效用。
局限与可以继续做的
评估仅在模拟器中进行,未涵盖真实相机光照变化、物体运动等因素;因训练与评估成本高,未扩展到更大规模 world model。作者提出未来在物理环境验证,并考察对更大更强 world-model agent 的可扩展性。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文把后门植入世界模型而非策略层,用物理物体触发并让恶意行为在触发物消失后延续,为具身智能体的供应链安全提供了新的攻击面参考。

阅读原文arxiv.org