防御arXiv 2610.06966
APEX:在 LLM Agent 执行边界主动防御间接提示注入
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
- arXiv
- 2610.06966
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-V4-Flash、GLM-5.2、GPT-5.6-sol 等 4 个
另有 702 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出可验证操作卡 VAC,从真实 DOM 重构智能体浏览器的确认信息
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
提出 ToolFence 能力级授权,执行前编译蓝图并确定性拦截工具调用