攻击arXiv 2610.10000·10月7日超越奖励压制:有界奖励热启动 Bandit 的近最优离线攻击提出热启动 Bandit 的部署前有界离线注入攻击arXiv2610.10000发表10月7日层训练与数据层场景LLM 应用被测模型UCB、Thompson Sampling、ϵ-greedy攻击投毒与后门深度解读完整解读
防御arXiv 2610.00450·10月1日ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击arXiv2610.00450发表10月1日层应用层场景网页与电脑操作被测模型Claude Sonnet 4.6、GPT-5.5、GLM-5.2 等 4 个防御指令与数据隔离攻击投毒与后门组件记忆+1+1深度解读完整解读