防御arXiv 2609.39820
FailBank:用运行时反馈自进化提升 VLA 模型任务成功率
提出 FAIL BANK,用只观察的 CBF 反馈对 VLA 做受守卫 LoRA 更新
- arXiv
- 2609.39820
- 发表
- 场景
- 具身与机器人
- 测试
- π0.5、π0
- 防御模型加固
- 风险Agent 危险操作
提出 FAIL BANK,用只观察的 CBF 反馈对 VLA 做受守卫 LoRA 更新
提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活
UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。