防御arXiv 2610.02664
论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
- arXiv
- 2610.02664
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GLM-5.2、GPT-5.5、DeepSeek-V4-Pro 等 7 个
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练
作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。