跳到正文
原文
论文追踪· arXiv:2607.25936· Zhiyi Mou, Wangze Ni, Tianfang Xiao et al.·本站收录 · 原文发表

研究提出 RolePlay 框架:利用人设条件放大 LLM 推理成本

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

RolePlay对LLM用人设放大单次推理开销,Gemini-3.5-Flash上达7.64×(Table 1)。

威胁模型严格 black-box。攻击者只能经标准界面或公开 API 修改输入,不能访问架构、权重、梯度或训练数据。

问题
自回归生成使单条提示词就能抬高 LLM 单次推理开销。作者称现有后缀与显式延长指令不自然、不随任务调整,且常只拉长推理或输出的一边。
方法
RolePlay 在 black-box 下抽取领域、子类、矛盾、偏差、知识水平与情绪,再生成任务人设并放在原问题前,靠人设一致性同时拉长隐藏推理和可见输出。
实验与结果
五模型、210 条上 Gemini-3.5-Flash 生成倍数 7.64×(Table 1);DeepSeek 最大 207.64×(Table 3)。GPT-5 Nano 上 RolePlay 2.54×,低于 ExtendAttack 的 2.73×。
局限与可以继续做的
论文未专门讨论局限。实验为 5 个模型、7 个基准共 210 条;分析器与人设构建器未具名,未报告重复次数和规则过滤器拦截率。
实验设置DeepSeek-V4-Pro、Gemini-3.5-Flash 等 · Math-500 Competition、GSM8K 等 · Generate Times、generated tokens 等
威胁模型
严格 black-box。攻击者只能经标准界面或公开 API 修改输入,不能访问架构、权重、梯度或训练数据。目标是单次交互内同时拉长隐藏推理与可见输出,并避免高困惑度串和显式延长指令,以绕过规则过滤。
被测模型
DeepSeek-V4-ProGemini-3.5-FlashQwen-3.5-PlusGPT-5 NanoLlama-3-8B-Instruct
基准
Math-500 CompetitionGSM8KSVAMPAIME 2025BigCodeBenchHumanEvalAlpaca
指标
Generate Timesgenerated tokensreasoning tokensoutput tokensInput PPLOutput EntropySurprisal Density
AI 导读研究者提出 RolePlay,一种任务感知的动态人设对齐框架,通过构造自适应人设自然诱导低效但语义连贯的生成行为,从而放大 LLM 推理成本。论文指出,LLM 的角色一致性会使其即使导致低效推理和过度生成也维持既定角色并复现相应行为,这构成此前未被关注的攻击面。跨多个 LLM 和多种任务数据集的实验显示,RolePlay 平均 token 放大最高达 7.64 倍,最大放大比为 207.64 倍,持续优于现有的推理延长方法;与依赖对抗后缀或显式延长指令的方法不同,该方法不会引入明显可检测的行为。

研究者提出 RolePlay,一种任务感知的动态人设对齐框架,通过构造自适应人设自然诱导低效但语义连贯的生成行为,从而放大 LLM 推理成本。论文指出,LLM 的角色一致性会使其即使导致低效推理和过度生成也维持既定角色并复现相应行为,这构成此前未被关注的攻击面。跨多个 LLM 和多种任务数据集的实验显示,RolePlay 平均 token 放大最高达 7.64 倍,最大放大比为 207.64 倍,持续优于现有的推理延长方法;与依赖对抗后缀或显式延长指令的方法不同,该方法不会引入明显可检测的行为。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者要在 black-box 下,用人设一致性放大单次请求的推理与输出开销。

    如何在不改任务语义、交互仍自然的前提下,按任务同时拉长隐藏推理与可见输出,放大单次 LLM 请求的计算开销。

    • 场景:作者称 LLM 已用于智能助手、代码生成和自动决策,部署后推理成本与服务可靠性成为问题。传统 DoS 靠请求量耗尽资源,可被速率限制;Inference Cost Attack 用构造过的提示词放大单次请求。
    • 现有不足:作者分为对抗后缀(Engorgio、LoopLLM)和显式延长推理(OverThinking、ExtendAttack)。作者称三点不足:词面不自然、易被规则过滤发现;多用固定触发、不看任务语义;只延长隐藏推理或可见输出之一,而总开销由两者共同决定。
    • 观察:作者称指令微调与 RLHF 使人设一致性成立,指定角色后模型会维持该角色行为,即使推理低效。Figure 1:常规 12 token、3 秒;加上 “Act as a novice student” 后 141.87 秒(47.3× latency),图中标 1589 token。
    • 方法:提出 RolePlay,按任务构造人设,以软诱导产生重复核验、补充解释等行为,同时扩大内部推理与最终输出。
    • 威胁模型:
      • 目标:单次交互内最大化推理资源消耗,同时扩大隐藏推理与可见输出;提示词须避免异常生成、高困惑度串和显式恶意延长指令,以通过规则过滤并保持自然交互。
      • 知识:作者称 strict black-box,不能访问架构、权重、梯度或训练数据。
      • 能力:只能修改输入 query,经标准用户界面或公开 API 交互。
      • 受害系统:被查询的 LLM 服务;文中以 DeepSeek-V4-Pro 为例说明交互方式。成功看单次请求的 token 与时延,而不是请求次数。
  2. 有哪些相关研究?

    作者将本文置于推理开销攻击与人设扮演之间,并称二者此前未被连起来。

    作者把相关工作分成推理开销攻击和人设一致性两条线,并称人设用于资源耗尽此前 largely unexplored。

    推理开销攻击

    • 后缀延长:Engorgio(Dong et al. 2025)搜索对抗后缀以抑制 EOS;LoopLLM(Li et al. 2026)用后缀优化诱导低熵重复生成。作者称二者常带来无意义 token、高困惑度串或重复生成,可被困惑度类检测发现(Alon and Kamfonas 2023; Jain et al. 2023)。
    • 推理延长:BadThink(Liu et al. 2026)用特定触发激活冗余推理;OverThinking(Kumar et al. 2026)与 ExtendAttack(Zhu et al. 2026)用显式指令或额外约束鼓励过长推理。作者称它们依赖预定义触发或固定策略,隐蔽性与跨任务适应性受限,且多只延长推理或输出的一个阶段。
    • 传统 DoS:引言将其描述为靠大量请求耗尽资源;作者用来对照单次请求的推理开销攻击(Li et al. 2025 仅作为该概念的引用)。

    人设一致性与角色扮演

    • 指令微调:Zhang et al.(2026)被引为说明指令微调与 RLHF 使人设扮演成为 LLM 的能力。论文只作这一描述。
    • 人设维持:Licato and Steinle(2025)被作者用来支持:LLM 可能在人设导致次优决策或逻辑不一致时仍保持人设一致行为。
    • 角色越狱:Zeng et al.(2024)与 Liu et al.(2024,AutoDAN)把角色指令用于绕过安全对齐。作者称资源耗尽方向此前 largely unexplored,并称本文建立动态人设对齐与 LLM 资源耗尽漏洞之间的首次联系。

    基线与基准

    • 基线方法:DA(沿用 ExtendAttack 的 Direct Attack,在原问题前加 “Provide step-by-step instructions”)、OverThinking、HGA(Wang et al. 2026,启发式引导优化)、ExtendAttack。对照还包括 Original。
    • 基准:Math-500 Competition、GSM8K、SVAMP、AIME 2025、BigCodeBench、HumanEval、Alpaca。各随机 30 条,共 210 条。

    作者的定位是:用任务自适应的人设软诱导,同时延长推理与输出,而不靠固定触发或直接要求更长思考。

  3. 论文如何解决这个问题?

    RolePlay 先抽六维任务元数据,再生成人设并拼到原问题之前。

    RolePlay 对每条 query 做一次分析、一次人设生成、一次目标模型查询,没有后缀优化那种迭代。三阶段分别对应作者列出的三个挑战:自然性、任务自适应、同时拉长推理与输出。

    任务元数据

    认知分析器 A 在指令 πana 下读 qi,输出经 JSON 解析的六维画像:

    mi={di,si,ci,bi,ei,τi}

    即领域、子类、核心矛盾、认知偏差陷阱、知识要求、情绪语气。

    • Task Context:di 按 MMLU 的高层领域(如 STEM、humanities);si 沿 MMLU 的科目层级。作者称这是为了让人设贴合任务,而不是通用模板。
    • Reasoning Obstacles:ci 标出主要推理障碍,用来引导反复考虑;bi 用来诱导重复核验和替代探索。作者引用认知失衡、概念转变、确认偏差和启发式作为这两维的依据。
    • Persona Cognitive States:ei 控制专长与推理风格;τi 控制持续性与推理倾向。Figure 2 可见的示例包括 Novice、Intermediat、Advanced,以及 Anxious、Bewildered、Stubborn、Paralyzed。

    qi 为空则跳过。论文未说明 A 是哪个模型。六维的进一步说明在附录 C。

    人设生成

    人设构建器 B 生成任务人设:

    pi=B(πper,mi)

    两类机制:

    1. 生成规则:人设应匹配抽出的领域、专长和情绪;聚焦核心矛盾与认知偏差;鼓励低效行为,包括重复核验、自我修正和推迟结论。
    2. one-shot:给一条从认知画像到具体角色的映射,让 B 模仿该生成模式,而不是输出通用角色描述。Figure 2 有示意,此处不复述示例原文。

    论文未说明 B 是哪个模型,也未报告采样设置。

    提示词装配

    人设放在原任务之前,作为整段自回归轨迹的行为约束,而不是只作用于某一阶段。正文式 (3) 的拼接标记为 [TASK/PROBLEM]:;Algorithm 1 写的是 [TASK / PROBLEM TO EXPLORE]。论文未解释两处写法差异。

    • 推理阶段:作者称人设会带来重复核验、自我反思和替代探索,从而增加推理 token。
    • 输出阶段:同一约束鼓励更细的解释、自我辩护和更长回答,从而增加可见输出 token。
    • 与显式延长的差别:作者称不使用固定触发短语,也不直接要求更长思考。

    记录与判定

    对同一条样本分别取 T(qi) 与 T(q̃i),抽出推理 token Ri、输出 token Oi,生成 token Gi=Ri+Oi。放大倍数是相对原始生成的倍数。不设 LLM 裁判。自然性另用 Input PPL、Output Entropy、Surprisal Density,定义在实验部分。

  4. 论文做了哪些实验?

    Table 1 中 Gemini-3.5-Flash 为 7.64×,GPT-5 Nano 为 2.54×。

    Table 1 中 RolePlay 的 Generate Times 在 Gemini-3.5-Flash 上为 7.64×,在 GPT-5 Nano 上为 2.54×,后者低于同表 ExtendAttack。

    实验设置

    • 模型:DeepSeek-V4-Pro、Gemini-3.5-Flash、Qwen-3.5-Plus、GPT-5 Nano 经 API;Llama-3-8B-Instruct 本地部署于四张 NVIDIA A6000。除非另有说明,用默认推理配置。
    • 数据:上述七个基准各随机 30 条,共 210 条。数学为 Math-500、GSM8K、SVAMP、AIME 2025;代码为 BigCodeBench、HumanEval;通用指令为 Alpaca。
    • 基线:Original、DA、OverThinking、HGA、ExtendAttack。
    • 指标:input、reasoning、output、generated tokens;Generate Times 为相对 Original 的生成 token 倍数。行为指标为 Input PPL、Output Entropy、Surprisal Density。作者称 PPL 越低越自然,后两者越高表示生成越多样、结构越复杂。
    • 判定:无 LLM 裁判,按 token 计数。论文未报告重复次数,也未说明分析器 A 与构建器 B 的模型。Table 1 未另行写明是否聚合全部 210 条。
    • 时延:作者称部分 API 不提供推理时间,客户端计时受网络延迟和服务端调度影响,正文主比较用 token;可用时延在附录 D。

    主结果

    表格较宽,可左右滑动

    模型Original 生成 tokenRolePlay 生成 tokenRolePlay 倍数
    Qwen-3.5-Plus4016.5122269.67×5.54
    GPT-5 Nano3339.708477.96×2.54
    Gemini-3.5-Flash1935.5914784.64×7.64
    DeepSeek-V4-Pro4445.0922510.30×5.06
    Llama-3-8B-Instruct699.402230.30×3.19

    据 Table 1。Llama 的 reasoning 列为 /,生成 token 等于输出 token。

    • 作者称五个模型的生成 token 都高于 Original。同表基线中,Gemini 上 HGA 为 ×4.69、ExtendAttack 为 ×3.59、OverThinking 为 ×2.19;DeepSeek 上 ExtendAttack 为 ×4.26、HGA 为 ×4.04。
    • 例外:GPT-5 Nano 上 ExtendAttack 为 ×2.73,高于 RolePlay。作者称 RolePlay 在该模型的对照里排第二。
    • Llama 无推理 token。作者称倍数受最大输出长度影响,并称 RolePlay 的人设提示更短、留下更多生成额度。同表 HGA 为 ×2.86、ExtendAttack 为 ×1.87,DA 为 ×0.84、OverThinking 为 ×0.76,后两者低于 Original。

    相对 Original,四个有推理 token 的模型上 RolePlay 的推理 token 与输出 token 都更高。推理 token 不总是各方法最高:DeepSeek 上 ExtendAttack 为 19082.15、OverThinking 为 13991.65,RolePlay 为 11979.08。Qwen 上 RolePlay 输出 token 为 16847.78,推理 token 为 5421.89,后者低于 ExtendAttack 的 8122.23。

    最大倍数与跨数据集

    • Table 3(DeepSeek):RolePlay 的 Max Times 为推理 172.781(119 到 20561)、输出 143.74(349 到 50166)、生成 207.64(106 到 22010)。同表生成 token 最大倍数:OverThinking 140.992、ExtendAttack 139.330、DA 3.160。该表未列 HGA。正文将推理最大倍数写作 172.78×。
    • Table 2:七个数据集的生成 token 倍数为 GSM8K 17.34、HumanEval 15.26、Alpaca 11.45、SVAMP 8.17、BigCodeBench 6.91、Math-500 3.55、AIME2025 2.67。作者称原生成较短的任务倍数更大;AIME2025 仍从 14044.67 增至 37546.30。论文未说明这张表的模型。
    • Figure 3:作者称分布整体移向更长生成,并给出 SVAMP、GSM8K、HumanEval 的平均放大倍数 55.48×、33.42×、24.92×。这些数字与 Table 2 的 Times 不同,论文未说明计算差异。文本转换后看不见各点的位置。

    自然性、时延与消融

    • Table 4(Llama-3):RolePlay 的 Input PPL 为 9.60,Original 为 10.59,OverThinking 为 9.79,ExtendAttack 为 13.02。RolePlay 的 Output Entropy 为 0.4752、Surprisal Density 为 0.5554,为表中最高;ExtendAttack 分别为 0.0724、0.0901,为表中最低。作者称提示词保持自然,生成不是简单重复循环。
    • 附录 D Table 6:DeepSeek-V4-Pro 查询时间从 75.74s 到 441.87s(5.84×),生成 token 从 4445.09 到 21866.23(4.92×)。Gemini-3.5-Flash 时间 4.19×、token 7.64×。Llama-3-8B-Instruct 时间 3.15×、token 3.19×。Qwen-3.5-Plus 时间从 135.90s 到 491.11s(3.61×),token 从 5894.49 到 21490.63(3.64×)。GPT-5-Nano 的 token 从 7107.34 到 8477.96(1.19×),查询时间从 94.00s 降到 87.03s(0.93×)。作者称 API 客户端时延可能受服务端调度和流式返回影响。
    • Table 5:Original Prompt 生成 token 575(倍数 1),Static Persona 2466(4.29×),Dynamic Persona 7580(13.18×);推理 token 为 120、245、445,输出为 455、2221、7135。作者称动态人设比固定人设带来更强的人设一致行为。论文未说明模型与数据集。表中动态一行写作 Dynamic Person。

    其他消融与分析

    • Table 1:Qwen 上 OverThinking 输出 token 349.00,低于 Original 的 373.76;其 Generate Times 为 ×1.05。
    • Table 1:GPT-5 Nano 上 RolePlay 输出 token 1384.62,低于 HGA 的 1800.20;DeepSeek 上 RolePlay 输出 10531.22,低于 HGA 的 11839.78。
    • Table 6 的部分 token 与 Table 1 不同:DeepSeek 的 Dynamic 为 21866.23,Table 1 的 RolePlay 为 22510.30;GPT-5-Nano 的 Direct 7107.34 与 Table 1 的 DA 相同,而不是 Original 的 3339.70。论文未解释。
    • Figure 1 未说明模型:常规 12 token、3 秒;人设指令后 141.87 秒(47.3× latency),图中标 1589 token。
    • 附录 E 未说明模型。隐藏推理标注 20561 token,与 Table 3 中 RolePlay 推理 token 的 Attack 列相同;可见回答标注 8980 token。作者称模型较早得到数量关系,之后仍反复解释同一歧义并核验。附录给出了完整示例。
  5. 有什么可以进一步探索的点?

    论文未专门讨论局限或后续方向。

    作者指出的局限与后续方向

    论文未专门讨论局限。Conclusion 只重述人设一致性这一攻击面和 RolePlay 的结果,没有列出不足或 future work。

    实验覆盖范围

    • 被测模型为 DeepSeek-V4-Pro、Gemini-3.5-Flash、Qwen-3.5-Plus、GPT-5 Nano、Llama-3-8B-Instruct,共 5 个(Section 4.1)。商业模型经 API,Llama-3-8B-Instruct 在四张 NVIDIA A6000 上本地运行。
    • 数据为 Math-500、GSM8K、SVAMP、AIME 2025、BigCodeBench、HumanEval、Alpaca,各 30 条,共 210 条。对照为 Original、DA、OverThinking、HGA、ExtendAttack。
    • 最大倍数在 Table 3,模型为 DeepSeek,未列 HGA。跨数据集数字在 Table 2 与 Figure 3,论文未说明所用模型。
    • 隐蔽性指标在 Llama-3 上报告 Input PPL、Output Entropy、Surprisal Density(Table 4)。威胁模型写到要绕过规则过滤,论文未报告规则过滤器上的拦截率。
    • 消融为 Original Prompt、Static Persona、Dynamic Persona(Table 5),论文未说明模型与数据集。论文未报告分析器 A、构建器 B 的模型,也未报告重复次数。时延在附录 D Table 6,覆盖上述 5 个模型;作者在实验设置中称 API 客户端计时受网络延迟和服务端调度影响。
  6. 总结一下论文的主要内容

    RolePlay 用人设同时拉长推理与输出,Gemini-3.5-Flash 上达 7.64×。

    RolePlay 是一种 black-box 推理开销攻击:只改用户输入,用人设让模型自己把单次回答写长。

    要处理的问题是,后缀优化和显式多想指令容易露出异常词面或固定触发,而且常常只动推理链或只动最终回答。RolePlay 先从任务里抽出领域、子类、核心矛盾、认知偏差、知识要求和情绪语气,再按规则加一条 one-shot 示例生成人设,放在原问题前面。分析器和构建器的具体模型论文没有写出。每条样本只走一遍,不做迭代优化。

    Table 1 里,相对 Original 的生成 token 倍数:Gemini-3.5-Flash 7.64×(1935.59 与 14784.64),Qwen-3.5-Plus 5.54×,DeepSeek-V4-Pro 5.06×,Llama-3-8B-Instruct 3.19×,GPT-5 Nano 2.54×。最后一项低于同表 ExtendAttack 的 2.73×。Table 3 在 DeepSeek 上给出 RolePlay 的生成 token 最大倍数 207.64。Table 4 在 Llama-3 上,RolePlay 的 Input PPL 为 9.60,Original 为 10.59。

    作者的结论是,人设一致性可以在没有显式延长指令时同时扩大推理和输出,并成为推理效率上的攻击面。

阅读原文arxiv.org