AgentDrift:逐步标注注入劫持 LLM Agent 轨迹的基准
AgentDrift: A Step-Labeled Benchmark of Injection-Hijacked LLM Agent Trajectories
AI 导读
作者发布 AgentDrift,一个包含 12,536 条合成工具调用轨迹的基准,覆盖五个 Agent 领域,71,024 个步骤每步标注为良性、注入点、被劫持或注入失败四类之一。语料含 4,000 条良性、5,536 条受攻击、1,500 条失败攻击和 1,500 条困难负样本轨迹,受攻击轨迹遵循三种合规模式,其标签串符合给定的正则文法;失败攻击保留被 Agent 抵制的注入,困难负样本则是形似攻击的合法内容,检测器需区分尝试与成功、偏离与新异。轨迹由单一开源模型按类别特定协议生成,经封闭词表结构校验器约束、LLM 评判器筛选,并对 1,200 条轨迹人工审计,作者指出 LLM 评判器本身被困难负样本骗过。