防御arXiv 2610.00450
ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
- arXiv
- 2610.00450
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- Claude Sonnet 4.6、GPT-5.5、GLM-5.2 等 4 个
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全失败
提出量化条件后门 AGENTQ,使智能体仅在量化后触发恶意工具调用
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
提出 TrojanWorld,用物理触发器对世界模型智能体植入想象引导后门
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。