APEX:在 LLM Agent 执行边界主动防御间接提示注入
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
- arXiv
- 2610.06966
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-V4-Flash、GLM-5.2、GPT-5.6-sol 等 4 个
另有 514 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出依赖引导回滚修复,纠正记忆增强 Agent 消费故障记忆后的回答与状态
提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 AgentFlow,用带标签的流与路径策略约束智能体数据流
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出 UCM,用 DOM 掩码与类型受限隔离模型隔开网页智能体与不可信内容
提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 MCPS EC,仅凭 MCP 工具元数据检测间接提示注入
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 ActGuard,在执行前审计并遮盖诱发动作偏离的间接注入