防御arXiv 2610.03089
COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
- arXiv
- 2610.03089
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出可验证操作卡 VAC,把智能体浏览器确认绑定到真实 DOM 操作
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具调用
WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。