可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认
The Verifiable Action Card: Trustworthy Human-in-the-Loop Control for Secure Autonomous Agents
AI 导读
论文提出可验证行动卡片(VAC),一种面向智能体浏览器的架构防御,把审批信息从真实待执行的浏览器动作和可信意图来源重建,并在浏览器 chrome 中带外渲染,将批准绑定到派发时重新校验的同一动作。VAC 由五部分组成:来源围栏(C1)、真实动作描述符(C2)、带外默认拒绝卡片(C3)、来源感知风险门控(C4)和执行绑定(C5)。作者在完整的开源智能体浏览器(Electron/Chromium 外壳加 Python agent,经 Chrome DevTools Protocol 驱动)中实现 VAC,并在 24 个场景的基准上评测,覆盖混淆代理表单、Lies-in-the-Loop 对话框伪造、间接提示注入、自适应动作替换、来源规避和合法任务。
论文速读
- Agentic browser 会在用户已认证会话下执行敏感操作,间接 prompt injection 与伪造确认界面威胁操作完整性。现有 HITL 确认依赖页面标签或模型生成的文本,攻击者可影响这些内容,使人类批准与真实执行不符的操作。
- 提出 Verifiable Action Card(VAC),从待执行动作的 ground-truth 参数与可信意图来源重建批准信息,在可信浏览器 chrome 中带外渲染,并把批准绑定到 dispatch 时重新校验的同一动作。包含 provenance fencing、ground-truth action descriptor、default-deny 确认、provenance-aware risk gating 和 execution binding 五个组件。
- 在完整 agentic browser 上以 24 个场景基准测试,覆盖 confused-deputy、Lies-in-the-Loop、间接注入、自适应动作替换、provenance evasion 与合法任务。跨多个 LLM,无 VAC 时攻击成功率 68%–100%,VAC 将其降至所有模型 0%,合法任务完成率 78%,false-block 率 0%。
- 人类确认者用透明 oracle 而非用户研究建模,只声称界面属性而非实测人类识别率;provenance 归因为启发式;descriptor 保真度受 executor 视野限制(TOCTOU);结果限于一个 DOM-first agent 和有界攻击集。未来方向包括人类被试研究、taint-tracking 式 provenance、扩展到视觉/computer-use agent 与非浏览器工具。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文给出可复现的浏览器端确认机制与跨模型评测,做 Agent 权限与确认界面设计的团队可参考其架构取舍。