摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
- 攻击arXiv 2609.07051
TrojanWorld:通过想象引导对世界模型智能体植入后门
提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门
- arXiv
- 2609.07051
- 发表
- 场景
- 具身与机器人
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
- 攻击arXiv 2609.14060
AgentQ:针对 LLM Agent 的量化条件后门攻击
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
- arXiv
- 2609.14060
- 发表
- 场景
- AI Agent
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
- 防御arXiv 2609.36820
CorrGRPO:面向多奖励学习的相关性归一化 GRPO
提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO
- arXiv
- 2609.36820
- 发表
- 场景
- AI Agent
摘要CorrGRPO 用 Pearson 相关归一化多奖励 GRPO 优势,并在三个域报告改进。
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。
已经到底了