APEX:在 LLM Agent 执行边界主动防御间接提示注入
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
- arXiv
- 2610.06966
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-V4-Flash、GLM-5.2、GPT-5.6-sol 等 4 个
另有 602 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出分片监督,将评判标准分配给独立调用以抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
提出 AgentFlow,用带标签的流与路径策略约束智能体数据流
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 UCM,用 DOM 掩码与类型受限隔离模型隔开网页智能体与不可信内容
提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配
Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。
提出 MCPS EC,仅凭 MCP 工具元数据检测间接提示注入
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 ActGuard,在执行前审计并遮盖诱发动作偏离的间接注入
提出可验证操作卡 VAC,从真实 DOM 重构智能体浏览器的确认信息
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。