ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
- arXiv
- 2610.00450
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- Claude Sonnet 4.6、GPT-5.5、GLM-5.2 等 4 个
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
提出 FLOWSEAL,用工具级信息流控制阻断智能体隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出意图驱动本地框架 Veilmind,净化发往远程模型的提示词
本地侧的意图驱动净化,用来降低用户提示词发往不受信任远程模型时的敏感属性暴露。
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 AgentKernel,用四支柱强制中介 Agent 的输入、工具与记忆
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出依赖引导回滚修复,恢复记忆增强 Agent 的回答与状态
提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用
这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。