防御arXiv 2608.10502
依赖引导回滚修复:为记忆增强 Agent 恢复错误记忆后的答案与状态
提出依赖引导回滚修复,纠正记忆增强 Agent 消费故障记忆后的回答与状态
- arXiv
- 2608.10502
- 发表
- 层
- 应用层
- 场景
- AI Agent
提出依赖引导回滚修复,纠正记忆增强 Agent 消费故障记忆后的回答与状态
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全