防御arXiv 2609.08258
研究实测五套 Agent 记忆系统均不执行撤销标记
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
- arXiv
- 2609.08258
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GLM-5.2、GPT-5.5、Grok-4 等 9 个
- 防御检测与过滤
- 风险Agent 危险操作
- 组件记忆
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配
Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。
提出 SeTox 检索增强框架,检测中文新词的隐性毒性
SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。
提出 DataShield,用共识子空间过滤会削弱安全的微调数据
提出 GenV,检测求解器判定无法区分的不忠实形式化
GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出 SKILLLITE,以证据引导的紧凑 LLM 在部署前审计恶意 Agent Skill
SKILLLITE是面向紧凑、可本地部署 LLM 的恶意 Agent Skill 预执行审计框架,作者单位为南洋理工大学。