跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv:2609.07051 ·

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    提出TrojanWorld,通过想象引导给世界模型智能体植入供应链后门

    测试
    TD-MPC2、DreamerV3、R2-Dreamer训练与数据层
    摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
    • 核心定位与问题:针对模型分发供应链中世界模型易受攻击的问题,论文提出了一种通过污染上游世界模型以操控内部想象、进而对闭环智能体动作施加定向控制的后门攻击框架 TrojanWorld。
    • 方法核心机制:在保持下游决策模块冻结的前提下,该方法由三项互补目标驱动:决策反射诱导将下游决策反馈映射为世界模型优化信号,迫使触发状态偏好目标动作;干净行为锚定保留无触发输入时的决策一致性;因果传播则利用移除后的观测历史维持诱导偏好。
    • 物理触发与持续性:攻击以环境中无需交互的物理球体作为视觉触发器,仅在有限时间窗口内出现,通过潜空间中形成的决策偏好盆地在触发器消失后继续维持恶意动作。
    • 关键定量结果:在 DMC、MetaWorld、MyoSuite 和 RoboDesk 基准上,攻击在 R2-Dreamer 上取得了低至 0.026 的动作偏差(Win-E),在 MyoSuite 上移除后偏差低至 0.014(Post-E);在所有被测架构中均保留了至少 98.8% 的干净性能,并在部分设置下将任务破坏率(TDR)提升至 90.00% 或 100.00%。
    • 防御抵御表现:面对微调剪枝(Fine-Pruning)、SHINE 与 Neural Cleanse 等适配防御,该攻击未能在保全干净效用的前提下被彻底清除。
    • 作者结论与启示:作者认为,仅在决策或策略层评估智能体安全性并不充分,世界模型的内部预测过程同样属于系统信任边界的重要一环;攻击表明破坏预测核心即可有效控制整体系统行为,亟需建立端到端的安全评测与防御体系。
    完整解读
已经到底了