论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
- arXiv
- 2610.04504
- 发表
- 层
- 应用层
- 场景
- AI Agent
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出依赖引导回滚修复,纠正记忆增强 Agent 消费故障记忆后的回答与状态
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 VoxParity 基准,评测语音智能体是否按音频改变工具调用
VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全
作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。