摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
- 攻击arXiv 2609.07051
TrojanWorld:通过想象引导对世界模型智能体植入后门
提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门
- arXiv
- 2609.07051
- 发表
- 场景
- 具身与机器人
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
- 攻击arXiv 2609.22711
UBA-ORL:针对离线强化学习的遗忘激活后门攻击
提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活
- arXiv
- 2609.22711
- 发表
- 场景
- 具身与机器人
摘要UBA-ORL 用竞争的 BD/CM 样本,使离线 RL 后门在删除伪装轨迹后激活。
UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。
- 攻击arXiv 2609.14060
AgentQ:针对 LLM Agent 的量化条件后门攻击
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
- arXiv
- 2609.14060
- 发表
- 场景
- AI Agent
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
已经到底了