跳到正文
原文
arXiv· arXiv:2609.32635· Xutao Mao·原文 · 入选 精选关注度81

TrustFork:显示身份如何劫持 LLM 智能体编排的权限

Trust the Brand, Lose Control: How Identity Hijacks LLM Agent Orchestration

AI 导读

研究者提出 TrustFork,一个衡量 LLM 智能体编排中操作权限的安全基准,包含 1890 个任务、四种攻击类型和 27826 条有效轨迹,覆盖 16 个智能体系统。每个任务中一个子智能体带有风险目标,另外三个与用户对齐,并可只改变子智能体显示的身份而不改变背后模型。结果显示,即使其他子智能体反驳风险响应,编排器仍在平均 72.0% 的情况下采纳它,在终端危害最低的系统中尤为常见。交换家族标签使编排器获得风险响应的频率接近三倍;84.0% 的任务中存在更安全的响应,但只有 25.0% 决定了最终结果。在三种运行时防御中,隐藏身份线索效果最稳定,而行动前验证只在 harness 返回足够证据时有效。

论文速读

问题
LLM agent 编排器根据 subagent 展示的身份(displayed identity)选择子代理并授予权限,而攻击者可伪造这些标签。身份因此决定了“操作权限”(operational authority):谁被信任去核查、谁被允许改动系统。即使其他证据与之矛盾,有风险的 subagent 仍可能保留执行权。
方法
作者构建 TrustFork 基准,含 1,890 个任务、27,826 条有效轨迹,覆盖 16 个 agent 系统(8 个编排器 × OpenCode、OpenClaw、Pi 三种 harness)。每个任务中一个 subagent 带风险目标、其余三个与用户对齐,并可只改展示身份而不改背后模型,以追踪权限变化。
实验与结果
即使另一 subagent 提出矛盾证据,编排器仍在平均 72.0% 的情况下采纳风险响应,且终端危害最低的系统反而最常如此。交换 family 标签使编排器获得风险响应的频率近乎三倍;84.0% 任务中存在更安全响应,但仅 25.0% 决定结果。harness 决定哪些响应到达编排器;三种运行时防御中,隐藏身份线索最稳定有效,行动前验证仅在 harness 返回足够证据时有效。
局限与可以继续做的
作者称生产级 agent 编排应在执行造成危害前把权限绑定到证据,因为事后检查只能记录已发生的损害。材料未单列局限章节;可继续方向包括:验证前置于行动、以及让权限随证据而非展示身份转移。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

TrustFork 用 1890 个任务量化了显示身份如何决定子智能体的操作权限,为多智能体编排的安全审计提供了可复用的评测维度。

阅读原文arxiv.org