PIMiner:无需再训练即可跨模型迁移的提示注入红队智能体系统
Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming
PIMiner在IPIArena对Gemini-2.5-Pro的ASR@10为76.2%,作者称策略可迁至未见目标。
训练为grey-box,可观察目标智能体每步输出(含注入步);测试为black-box,仅最终输出和攻击是否成功的真值指示。
- LLM智能体读取工具输出等不可信上下文时,可被嵌入的指令改变行为。作者称RL红队常需大量目标查询且难迁移,搜索式方法又不能复用既往攻击经验。
- PIMiner在训练中把攻击成败写成策略文件并更新策略库。路由器只载入Top-K策略;攻击器结合样本历史和同数据集记忆迭代;消化器按机制归并或新建策略。测试时库可直接用于未见目标。
- 在IPIArena对Gemini-2.5-Pro的ASR@10为76.2%,AgentDojo上为86.7%;Claude-Opus-4.5为4.8%与3.3%。InjecAgent上PIMiner的ASR@10为1.0。
- 第6节写本工作主要用Claude Code模型以降低推理成本,并给出训练阶段目标查询的额外API费用约$20。实验覆盖IPIArena、AgentDojo与InjecAgent;未评测外部防御。论文未报告重复次数。
- 威胁模型
- 训练为grey-box,可观察目标智能体每步输出(含注入步);测试为black-box,仅最终输出和攻击是否成功的真值指示。攻击者向不可信上下文注入文本,每样本迭代上限Nmax(默认10)。受害系统是可调用外部工具的LLM智能体。
- 被测模型
- Gemini-2.5-ProDeepSeek-V4-ProGPT-4o-miniGPT-5-nanoGPT-5GPT-5.1Claude-Haiku-4.5Claude-Sonnet-4.5Claude-Opus-4.5GPT-4.1-nano
- 基准
- IPIArenaAgentDojoInjecAgent
- 指标
- ASR@NASR@1ASR@5ASR@10
研究者提出 PIMiner,一个用于提示注入红队测试的智能体系统,训练时在多个(数据集,目标模型)组合上构建策略库,测试时策略库可直接迁移到未见过的目标 LLM,无需额外训练,每个测试样本只需约 10 次查询。在 IPIArena 上,PIMiner 对 Gemini-2.5-Pro 的攻击成功率为 76.2%,对 GPT-5.1 为 61.9%,对 Claude-Sonnet-4.5 为 42.9%;在 AgentDojo 上分别为 86.7%、53.3% 和 40.0%。作者指出,现有基于强化学习的提示注入红队方法产出的攻击模型对新目标 LLM 泛化较差,代码已公开。
深度解读
这篇论文试图解决什么问题?
PIMiner用可迁移策略库做提示注入红队,以缩小搜索式与RL式方法的差距。
搜索式提示注入红队不能积累可复用知识,RL攻击模型又常常难以迁到新的目标LLM。
- 场景:作者称LLM智能体会读网页、文档和工具输出,对手可在这些不可信上下文里嵌入指令。作者认为红队既用于上线前评估,也用于收集成功攻击,以训练护栏、改进对齐并训练后续攻击模型。
- 现有不足:作者称RL-Hammer、PISmith一类方法训练常需数万次量级的目标查询,且对新目标LLM迁移有限;GPT-Red能提高对未见防守者的泛化,但计算量接近微调前沿LLM。TAP、PAIR、Strategy-based Search逐样本从头搜索,作者称效果低于RL。
- 假设:作者认为差距来自搜索式方法不能把历史交互收成可复用的攻击知识。
- 本文:提出PIMiner。在一串(数据集,目标模型)对上从零建策略库;测试时库可直接用于未见目标LLM,不再训练。每样本对目标的查询很少,例如10次。
- 威胁模型:
- 目标:对(指令I、不可信上下文C、注入任务G)生成注入,使智能体执行G。成败由基准真值指示决定;ASR@N表示N次内至少成功一次。
- 知识:训练是grey-box,能看到每步输出,包括注入发生的那一步;测试是black-box,只有最终输出和是否成功的真值,设定沿用PISmith。
- 能力:向C写入注入文本,每样本最多Nmax轮。作者称训练时可自建接近目标的模拟环境,并举出Claw Code、Codex CLI、Gemini CLI和Claude Code作为该假设的依据。
- 受害系统:能调用外部工具并自主行动的LLM智能体。实验用IPIArena、AgentDojo和InjecAgent。
有哪些相关研究?
作者把自动红队分为RL式与搜索式,并认为后者缺少可累积复用的攻击知识。
相关工作在第2节分成自动红队与智能体设计;防御放在附录A。
RL式红队
- RL-Hammer(2025):用GRPO优化攻击LLM。作者称学到的模式或可在同一数据集、同一目标内跨样本迁移,但对新目标LLM迁移有限。
- PISmith(2026):用熵正则等稳定RL训练。§5.3称它是当时可用的最强RL基线;其数字由作者直接引自该文,不是本文重跑。
- GPT-Red(引用未标年份):在多种防守智能体上训练,以泛化到未见防守者。作者称要微调前沿规模攻击LLM,计算预算接近一次完整RL后训练。
搜索式方法与策略库
- PAIR、TAP等:对每个测试样本迭代改写注入,不训练攻击模型。作者称它们从头搜索,不把既往经验收成可复用知识,因而一般不如RL方法。
- AutoDAN-Turbo(ICLR 2025):在越狱中自探索并更新策略库。作者称越狱策略主要依赖有害目标,提示注入必须同时看良性用户任务和注入任务,不是同一问题。
- strategy-based search、DTap-Red:用预先给定的策略库引导搜索。作者称这些库不按新任务动态更新。
智能体系统设计
- 启发式与自动设计:ReAct、ToolLLM属于手工启发式;AutoHarness、agentic supernet、TextGrad属于自动优化。作者称红队单样本就要多轮目标查询,实践中贵到难以大规模试错,因此PIMiner用启发式结构,再用消融检验。
基线、防御与定位
- 基线与基准:静态手工模板;搜索式TAP、PAIR、Strategy;RL式Vanilla GRPO、RL-Hammer、PISmith。基准为IPIArena、AgentDojo,另用InjecAgent的30条测试样本。
- 防御:附录A把防御分成检测、清洗、安全策略等外部方法,以及内部对齐。作者称外部方法可能被针对检测器或清洗器的自适应攻击绕过、增加开销,或依赖明确工具接口与策略,并可能降低效用,故本文只红队内部对齐。
- 定位:作者称本文从零发现策略,并按不同用户任务、注入任务和目标模型的经验持续改库,以缩小搜索式与RL式红队的差距,且测试时不必再训练。
论文如何解决这个问题?
PIMiner用策略库、路由器、迭代攻击和消化器把攻击经验写成可迁移记忆。
整体是一个带分层记忆的搜索式红队智能体:PIMiner。训练时在一串数据集–目标模型对上攻击并改库;测试时用最终库ST对新对生成注入,默认不再改库。
问题设定
- 样本是(目标指令、可注入的不可信上下文、注入任务)。长期记忆S从只含结构文件的S0更新到ST。同一数据集可配不同目标LLM。
- 作者提到真实部署可采用test-time training,把测试经验写回S。附录E写明:本文测试阶段策略库冻结,不调用消化器。
- 设计约束写在§4.1:既要提高命中,又不能把全部历史放进上下文,因为单样本多轮会使每个token的成本按迭代放大。
三层记忆与四个组件
- 长期记忆是策略库,跨数据集–模型对。数据集内记忆是当前这一对里已结束样本的压缩经验。样本内记忆是当前样本以往注入、可见轨迹、成败和攻击器分析。
- 四个组件为策略库、策略路由器、迭代攻击模块、经验消化器(Figure 1)。路由器只把相关长期策略载入攻击器;数据集内记忆先被压成摘要。
策略库与路由
- 每条策略是一个Markdown文件,含目标LLM范围、任务范围、注入模板、上下文示例、失败条件等(Table 4)。路由器只用范围段和示例;攻击器与消化器读全文。
- 对样本选出Top-K。论文的路由式是 Ŝ=RouterK(x,M,{ψ(s)},scold):ψ为路由摘要,s_cold默认是_TEMPLATE.md;没有可用策略时攻击器从头生成。附录C给出路由器提示词。实验默认K=3。
迭代攻击
- 第j轮注入由 p=Attacker(Ŝ,E,H,x,M) 生成,j从1到Nmax。H用来针对已观察到的失败改写,而不是独立采样新变体。
- E由同一对中更早样本的轨迹经Curate拼成,默认上限20K字符。作者指出PAIR只有H。命中或用尽Nmax即停。实验默认Nmax=10。
- 同一对内滚动并行,默认池大小5:一个样本结束就补下一个,后启动的样本能看到已结束样本的E。不同对之间顺序执行。附录D给出攻击器提示词和Curate。
消化器与实现
- 一对全部结束后,消化器按机制而不是表面措辞处理命中:已覆盖则追加示例;机制相同但范围更广则加示例并放宽范围与模板;没有现成机制则新建文件。失败样本做miss-pattern分析,反复失败会下调范围并写入失败条件;一轮全未命中仍会改库。修改须引用具体攻击例。附录E给出消化协议。
- 编排用Python和Bash。路由器、攻击器、消化器是彼此隔离的Claude Code会话,由Python组装提示并解析输出。默认骨干Claude-Opus-4.7;训练用xhigh reasoning effort,测试用low。作者称训练和测试可以用不同骨干。
论文做了哪些实验?
IPIArena上Gemini-2.5-Pro的ASR@10为76.2%,Claude-Opus-4.5为4.8%。
实验设置
- 骨干与指标:默认骨干Claude-Opus-4.7;训练xhigh、测试low reasoning effort。K=3,Nmax=10。ASR@N表示N次内至少一次成功;未另加说明时N=10。论文未报告重复次数,也未写LLM评审模型,成败用基准真值指示。
- 训练序列:8对,即IPIArena与AgentDojo的训练划分,分别配GPT-5-nano、GPT-5、Claude-Haiku-4.5、Claude-Sonnet-4.5。这四个模型在训练中当过目标;Figure 2里的Gemini-2.5-Pro、DeepSeek-V4-Pro、GPT-4o-mini、GPT-5.1、Claude-Opus-4.5没有。
- 数据:IPIArena共41条,20训练、21测试;正文称覆盖tool use、coding和computer-use,Table 3的测试域为Tool 11、Browser 5、Coding 5。AgentDojo随机抽20训练、30测试,测试为banking 4、Slack 3、travel 6、workspace 17。另取InjecAgent 30条测试样本对比基线。
- 被测目标:Figure 2为Gemini-2.5-Pro、DeepSeek-V4-Pro、GPT-4o-mini、GPT-5-nano、GPT-5、GPT-5.1、Claude-Haiku-4.5、Claude-Sonnet-4.5、Claude-Opus-4.5。DeepSeek-V4-Pro去掉带图像输入的测试样本,正文未给去掉后的条数。基线对比另用GPT-4.1-nano。
- 基线:静态手工模板;搜索式TAP、PAIR、Strategy;RL式Vanilla GRPO、RL-Hammer、PISmith。作者写因RL评测开销大,基线数字直接用PISmith的结果。
主结果
下表只列正文明确写成ASR@10的数字。Figure 2还画了ASR@1和ASR@5;纯文本无法把未在正文点名的柱逐列对应到模型,那些格子不转写。
表格较宽,可左右滑动
目标模型 基准 ASR@10 出处 Gemini-2.5-Pro IPIArena 76.2% §5.2、Figure 2 Gemini-2.5-Pro AgentDojo 86.7% §5.2、Figure 2 GPT-4o-mini IPIArena 81.0% §5.2、Figure 2 DeepSeek-V4-Pro AgentDojo 93.3% §5.2、Figure 2 Claude-Sonnet-4.5 IPIArena 42.9% §5.2、Figure 2 Claude-Opus-4.5 IPIArena 4.8% §5.2、Figure 2 Claude-Opus-4.5 AgentDojo 3.3% §5.2、Figure 2 - 摘要中的ASR未标@N:IPIArena上GPT-5.1为61.9%;AgentDojo上GPT-5.1为53.3%、Claude-Sonnet-4.5为40.0%。正文未把GPT-5、GPT-5-nano、Claude-Haiku-4.5的ASR@10写成数字。
- 作者称除Claude-Opus-4.5外,多个模型族上攻击成功率高;并称GPT族内更强的模型更抗注入,排序与IPIArena先前发现大体一致。
- 作者称PIMiner在Claude-Sonnet-4.5、IPIArena上ASR@1为28.6%;并称IPIArena图1里人类攻击者平均ASR@1为1.0%。该人类数字是作者对另一篇报告的转述,且是ASR@1的平均,不是ASR@10。
与现有红队方法对比
- InjecAgent(Table 1):RL方法与PIMiner报告的是ASR@10。PIMiner在GPT-4o-mini、GPT-4.1-nano、GPT-5-nano上均为1.0,与PISmith相同;RL-Hammer在前两个为1.0、在GPT-5-nano为0.96。同表GPT-5-nano上TAP为0.08、PAIR为0.01、Strategy为0.18、GRPO为0.24。论文未写明静态和搜索式数字是否为ASR@10。训练序列不含InjecAgent。
- AgentDojo(Table 2,PISmith与PIMiner为ASR@10):GPT-4o-mini上PISmith 0.78、PIMiner 0.73;GPT-4.1-nano上0.81与0.63;GPT-5-nano上0.38与0.53。作者称前者高于PISmith、中者与之相当、后者更低,并指出PISmith要为每个目标单独训练,而GPT-4o-mini与GPT-4.1-nano对PIMiner是未见目标。GPT-5-nano在训练序列里出现过。
- 同表静态模板最高为GPT-4o-mini上Imp. Instr.的0.23,低于该行PIMiner的0.73。作者称PIMiner高于静态攻击和常规搜索式攻击。
记忆、路由器与跨攻击模型
- 记忆:库固定。在IPIArena上对四个训练未见目标(Gemini-2.5-Pro、DeepSeek-V4-Pro、GPT-4o-mini、GPT-5.1)平均ASR@10。作者称去掉策略库或数据集内记忆都会下降;二者合用相对只留样本内记忆的迭代攻击,在Claude-Haiku-4.5上高19.8%,在Claude-Sonnet-4.6上高17.8%(Figure 3)。该平均未纳入Claude-Opus-4.5,作者称其ASR低、不利于比较设计。Figure 3还标有13.1、19.4、20.6、32.9、50.6、60.5、64.1、68.4,纯文本不能把中间值逐一对到图例。
- 路由器:Figure 5a在Claude-Haiku-4.5标出237K与136K tokens,在Claude-Sonnet-4.6标出236K与92K。作者称路由器使输入长度分别减少43%与61%;ASR在前者降1.2%,在后者增7.5%。Figure 5b标有34.1、32.9与60.9、68.4。
- 跨攻击LLM:把库接入PAIR,路由器选3条策略,Nmax=10,目标GPT-4o-mini,基准IPIArena。攻击LLM为Gemini-2.5-Flash、Gemini-3.1-Flash-Lite、GPT-5.4-nano、GPT-5-mini、GPT-4.1-mini、DeepSeek-V4-Flash。作者称Gemini-2.5-Flash的ASR从0.14增至0.52(§5.5)。Figure 4另有57.1%(12/21)等标注,纯文本不能把每根柱对应到模型,其余不转写。
其他消融与分析
- 附录F:训练得到7类策略、10个策略文件(其中3类各有AgentDojo与IPIArena变体)。Figure 6中Fabricated Procedure Gate为50例、Forged Chat Turn为29例,作者称二者约占全部示例的80%;其余五类各1–8例。29例中18例对应GPT-5-nano;50例中23例对应Claude-Haiku-4.5;Authenticated-Principal Voice Forge的8例全部对应Claude-Sonnet-4.5。附录有机制说明和示例,此处不转写注入文本。
- Table 6:训练阶段攻击器约78.0M输入token、约1.60M输出token,估计约$115;目标模型混合调用估计约$20。第6节称若攻击器、路由器、消化器走Claude Code订阅,额外API约$20;并称RL训练例如10,000次目标查询,对GPT-5可能超过$100。
- K与Nmax固定为3和10,并行池默认5,Curate默认20K字符。论文未报告这些取值的对比实验。
有什么可以进一步探索的点?
第6节写主要使用Claude Code模型;论文未单列后续实验计划。
作者指出的局限与后续方向
- 骨干选择:第6节标题为Discussion and Limitations。该节写:流程兼容不同骨干LLM,但本工作主要使用Claude Code模型,以降低推理成本。
- 同节的成本句子:若攻击器、路由器和消化器用Claude Code订阅,训练阶段查询目标模型的额外API费用约$20;并与RL方法的查询量对照(例如10,000次,对GPT-5可能超过$100)。这是成本比较,不是写成待做实验的句子。
- 结论:第7节希望策略库能用于审计智能体,以及为防御生成训练数据。论文没有把这句写成后续实验计划,也没有另列Future Work条目。
实验覆盖范围
- 主结果目标为Figure 2的9个LLM;基线对比另有GPT-4.1-nano。训练目标为GPT-5-nano、GPT-5、Claude-Haiku-4.5、Claude-Sonnet-4.5(§5.1–5.3)。
- 数据为IPIArena 41条(20训练、21测试)、AgentDojo随机20训练加30测试、InjecAgent 30条测试(§5.1、Table 3)。DeepSeek-V4-Pro排除带图像输入的测试样本,正文未给排除后的条数。
- 默认骨干为Claude-Opus-4.7,K=3,Nmax=10。消融在IPIArena上对4个训练未见目标平均ASR@10,测试骨干为Claude-Haiku-4.5与Claude-Sonnet-4.6,且未纳入Claude-Opus-4.5。迁移实验的攻击LLM为6个,目标为GPT-4o-mini(§5.4–5.5)。
- 附录A说明红队对象是模型内部对齐,不评测外部检测、清洗或安全策略,并写了这些外部方法在作者看来不适用的原因。成功判定用基准真值指示,论文未写LLM评审模型。
- 论文未报告重复次数、方差或统计检验,也未报告ASR与人工判定的一致性。RL基线数字取自PISmith,不是本文重跑(§5.1)。测试阶段库冻结;正文把test-time training写成用户可采用的设定,不是本文报告的测试协议。
总结一下论文的主要内容
PIMiner把攻击经验收成策略库,作者称可迁到未见目标,并报告了多组ASR@10。
PIMiner是把提示注入红队的历史收成可读策略库的智能体系统,用来在少查询下攻击新的目标LLM。
- 问题:作者称搜索式方法每样本从头搜索,RL方法查询多且换目标后迁移有限。本文要让搜索过程能积累并复用攻击知识。
- 做法:策略库、路由器、迭代攻击器、消化器。记忆分三层:跨数据集策略、同一数据集–模型对的压缩经验、当前样本轨迹。训练为grey-box,测试为black-box,库在测试时冻结。默认K=3、Nmax=10,骨干为Claude-Opus-4.7。
- 结果:§5.2的ASR@10中,Gemini-2.5-Pro在IPIArena为76.2%、在AgentDojo为86.7%;Claude-Opus-4.5为4.8%与3.3%。InjecAgent上Table 1的三个目标,PIMiner均为1.0。AgentDojo上PIMiner对GPT-5-nano为0.53、对GPT-4.1-nano为0.63,PISmith为0.38与0.81(Table 2)。
- 作者结论:作者称策略可直接用于未见目标,也能提高其他攻击LLM上的PAIR(Gemini-2.5-Flash从0.14到0.52)。作者希望该库用于审计智能体和生成防御训练数据。