防御arXiv 2610.03089
COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
- arXiv
- 2610.03089
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出 Pictionary,将不可信文本渲染为图像以防御提示注入