攻击arXiv 2609.07051
TrojanWorld:通过想象引导对世界模型智能体植入后门
提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门
- arXiv
- 2609.07051
- 发表
- 场景
- 具身与机器人
- 测试
- TD-MPC2、DreamerV3、R2-Dreamer
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活
UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。
提出 SafeRLEval,评测安全强化学习策略的越界与代价偏差
Spoor、Plaat 与 Moerland 认为,安全强化学习沿用 CMDP 的 E[C]≤d,只报告平均是否安全,看不出越界频率和幅度,也分不清训练期、带探索噪声的最终策略和贪心部署策略。他们提出评测框架 SafeRLEval:越界率 V、按安全界归一化的平均代价偏差 Dnorm、只在越界回合上计算的归一化幅度 Dnorm+。用 IQM 跨任务和安全界聚合。
提出 QPT,用奖励与成本 Q 惩罚条件 Transformer 做安全离线强化学习
QPT 针对安全离线 RL:只从离线数据学习,同时处理约束满足、回报最大化和行为正则,并希望部署时更换成本阈值而无需重训。