评测与基准arXiv 2609.08258
研究实测五套 Agent 记忆系统均不执行撤销标记
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
- arXiv
- 2609.08258
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GLM-5.2、GPT-5.5、Grok-4 等 9 个
- 防御检测与过滤
- 风险Agent 危险操作
- 组件记忆
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
另有 275 篇论文还没打上分类标签,暂不在筛选结果里。
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练
作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。
提出 CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入
提出协同演化防御 CoDeL,抵御智能体工具观测中的间接提示注入