研究者提出层级遗传算法黑盒攻击,诱导推理模型过度思考
Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models
HGA在黑盒LRM上扰动逻辑结构诱发overthinking,作者称MATH的Token Gain为26.1×。
黑盒且query-based:只能提交文本并观察文本输出,不能访问梯度或权重。
- LRM被用于多步推理系统,但遇到不完整或逻辑不一致的输入时会overthinking,拉长输出并提高延迟与能耗,从而成为DoS式资源耗尽的入口。已有资源攻击多依赖白盒梯度,或只针对通用LLM。
- 分层遗传算法把题目表示成前提集合加问题,以一代内z-score后的输出长度和overthinking标记频率做复合适应度,再用问题级或前提级交叉、删增前提来进化。搜索只看文本输入输出;也可用小代理模型评估适应度后再迁移。
- 四个API推理模型上,HGA的输出长度高于BASE和MIP。作者称MATH的Token Gain为26.1×;引言写最高26倍。Qwen3-14B上进化的输入迁出后仍放大长度。附录报告三数据集ASR为100%,未写模型。
- 作者指出每次适应度评估都要查询大推理模型,进化搜索成本高,并建议并行化、代理适应度预测器和多模态扩展,以及行为监控、早停和针对不一致输入的鲁棒训练。实验写明四个目标模型和三个数学基准;多张消融表未写模型,主实验未写α与过滤后题数。
- 威胁模型
- 黑盒且query-based:只能提交文本并观察文本输出,不能访问梯度或权重。攻击者扰动前提与问题的逻辑结构,诱发LRM overthinking,以输出token长度代理能耗与延迟,形成DoS式资源耗尽。受害系统为API上的推理模型。
- 被测模型
- DeepSeek-R1 (671B)Qwen3-ThinkingGPT-o3Gemini-2.5-FlashQwen3-14B
- 基准
- GSM8KSVAMPMATHMIP (Missing Premise Dataset)HumanEvalEntailmentBankMT-Bench
- 指标
- Avg-lenMax-lenAmplification (Avg-len)ASRToken Gain
研究者提出一种黑盒框架,通过系统扰动输入问题的逻辑结构诱导大型推理模型进入过度思考状态。该方法在结构化问题分解上运行层级遗传算法,并优化一个同时最大化回答长度与反思性过度思考标记的复合适应度函数。在四个先进推理模型上,该攻击将 MATH 基准的输出长度最多放大 26.1 倍,持续优于良性基线和人工构造的缺失前提基线。研究还展示了较强迁移性,用小代理模型进化出的对抗输入对大型商业推理模型仍保持高效,论文已被 ICML 2026 接收。
深度解读
这篇论文试图解决什么问题?
作者用黑盒HGA扰动题目逻辑,诱发推理模型overthinking,以拉长输出、消耗计算资源。
黑盒条件下,如何自动破坏题目的逻辑结构,诱发大推理模型 overthinking,从而拉长输出并消耗推理计算资源。
- 场景:作者称 LRM 正被接入企业软件、科研平台和自主智能体,并引用 2024 年 78% 的机构使用 AI(上年 55%)。输出长度是能耗和延迟的主要驱动(Gao et al., 2024),因而可形成针对其他用户的 DoS 式资源耗尽。
- 现有不足:作者称已有资源攻击主要面向可求梯度的开源白盒模型,难以用于商业系统;DoS 与能耗–延迟工作又多针对通用 LLM,较少利用专用推理模型的推理链做成本放大。
- 观察:作者援引两点:为拿强化学习奖励,LRM 会多轮重复思考(DeepSeek-AI et al., 2025);面对无法作答的问题,会出现异常 overthinking(Chen et al., 2024)。
- 本文提出:分层遗传算法(HGA)。在结构化分解上断裂逻辑链,并用同时看回复长度与 overthinking 标记的复合适应度做黑盒搜索。
- 威胁模型:
- 目标:拉长、冗余的推理,提高能耗与延迟,形成 DoS 式资源耗尽。
- 知识:论文写 strict black-box、query-based,不能访问梯度或内部权重。
- 能力:只能提交文本并观察文本输出;扰动落在前提与问题上。直接设置查询受害模型;迁移设置用开源代理 Qwen3-14B 评估适应度。
- 受害系统:经 API 访问的 LRM。主实验为 DeepSeek-R1 (671B)、Qwen3-Thinking、GPT-o3、Gemini-2.5-Flash。
有哪些相关研究?
作者把本文放在overthinking与LLM DoS攻击的交界,并称同时满足黑盒、推理感知和自动化。
Overthinking 现象
- 长 CoT:Chen et al. (2024) 报告 o1-like 模型生成不成比例的长 chain-of-thought。
- 缺前提:Fan et al. (2025) 指出关键前提缺失时,推理 LLM 倾向陷入冗余循环而不是弃答。作者称其构造是手工的,且未做对抗优化。
- 其他场景:Cuadron et al. (2025) 将现象延伸到软件工程等智能体环境,提到 analysis paralysis、rogue actions 或过早脱离。Dang et al. (2025) 称 overthinking 可能来自对输入文本的内部偏差。
DoS 与能耗攻击
- 拉长或抑制结束:Shumailov et al. (2021) 的 sponge examples 在真实翻译服务上最高 6000×;Geiping et al. (2024) 抑制 EOS;Gao et al. (2024) 用 delayed EOS、uncertainty 与 token diversity loss;Dong et al. (2025) 的 Engorgio 在嵌入空间优化,使输出接近上下文上限。
- 推理向或黑盒变体:Zhang et al. (2025b) 的 Crabs(AutoDoS)建 DoS Attack Tree 并用 Length Trojan;Kumar et al. (2025) 的 OverThink 注入诱饵任务;Zhang et al. (2025a) 的 Deadlock 在推理步末尾触发 “Wait”“But”;Li et al. (2025a) 的 POT 用外部 LLM 迭代优化提示;Li et al. (2025b) 的 ThinkTrap 在连续代理空间做无导数优化。
- 作者点名的差别:作者将 GCG(Zou et al., 2023)与 Engorgio 归为白盒方法,称其对抗输入常缺逻辑或语义连贯,较难延长推理链,也更容易被发现。AutoDoS 主要操纵表层提示长度而非推理过程;OverThink 需手工设计、缺少自动化;POT 缺少问题层面的系统性推理扰动;ThinkTrap 的提示可读性有限、可解释性较差。
对照表、基线与数据集
- 三条件对照:Table 1 中 GCG 为非黑盒、非推理感知、自动化;AutoDoS 为黑盒、非推理感知、自动化;OverThink 为黑盒、推理感知、非自动化;Ours 三项皆是。作者称 HGA 进化的是对抗逻辑结构本身。
- 基线方法:Original/BASE 为未改动的人类编写题目,Table 2 的 Token Gain 为 1.0×;MIP 为 Fan et al. (2025) 的手工缺前提集,Table 2 写 3.2×;Table 4 另与 AutoDoS 比输入与输出长度。
- 基准/数据集:主实验为 GSM8K、SVAMP、MATH;附录另用 HumanEval、EntailmentBank、MT-Bench。
作者把缺口放在两类工作的交界:现有 DoS 少针对推理链,缺前提 overthinking 又未自动优化;并称本文同时满足黑盒、推理感知和自动化。
论文如何解决这个问题?
HGA将题目拆成前提与问题,用长度和反思标记的复合适应度进化逻辑扰动。
HGA 把题目拆成前提与问题,用遗传算子破坏局部逻辑依赖,再以复合适应度在黑盒查询下搜索更长、且带反思标记的推理。作者的假设是:面对逻辑不一致或结构被扰动的问题,LRM 会 overthinking,从而回复变长。Figure 1 画出抽样、适应度评估和分层遗传策略;图中文字有 Around 200 tokens、More than 11000 tokens 与 Server Error,论文未把这些标注写成表格测量值。
问题表示
- 结构化个体:不把输入当不透明 token 串。个体为 x=(P, q),P 为前提序列,q 为最终问题;合法空间是陈述集合 S 的子集再配一个问题。实验种群大小 N=10。
- 初始化:附录 A.2 的切分模板把一道题变成 JSON 前提列表和问题,不要求模型解题。实验写明切分使用 Qwen3-Thinking。附录给出完整提示词。
适应度
- 两项分数:score1 是目标 LRM 对 x 的 CoT 回复 R(x) 的 token 数。score2 是词表 V 中各标记在 R(x) 中的次数之和。附录 A.3 的一套词表为 but、wait、maybe、problem、perhaps、another、alternatively、not;作者称其部分来自 Deadlock 强调的 but、wait,再用困惑输入与正常输入之间频次差最大的高频非功能词扩展。
- 归一与加权:两项都在当代种群内做 z-score。适应度为 f(x)=α·scorê1(x)+(1−α)·scorê2(x),α 在 0 到 1 之间,权衡长度与显式 overthinking。作者称这是为了区分单纯冗长和带犹豫、自我修正的行为。主实验未写所用 α。
选择与遗传算子
- 选择:精英保留,避免丢掉当前最高适应度个体;其余按相对适应度做轮盘赌。Algorithm 1 写保留 top-N 精英,未另行给出精英名额与种群大小的差别。
- 交叉:概率 pc。问题级以概率 pqc 交换两父代的问题,使前提集配上无关问题;前提级以概率 1−pqc 交换一条前提。实验 pc=0.8,未报告 pqc。
- 变异:概率 pm,实验取 0.2。随机删除一条前提,或从另一个体随机插入一条前提。作者称算子故意不保持语义或句法连贯,而是扭曲前提与问题的逻辑依赖。
进化流程
- 循环:代数预先设定,实验 G=5。每代计算适应度、选择、交叉、变异,再用精英与子代组成下一代。
- 返回:全部世代中适应度最高的个体。3.5 节同时称之为触发最长推理回复的输入。每次适应度评估查询受害模型一次;论文写每模型查询预算大约 60 次。
- 评测接口:搜索优化的是复合适应度;报告的代价指标是最后一轮输出 token 的 Avg-len 与 Max-len,见第 4 节。
论文做了哪些实验?
四个黑盒LRM上HGA拉长输出;作者称MATH的Token Gain为26.1×,且可由小代理迁移。
实验设置
- 目标模型:DeepSeek-R1 (671B)、Qwen3-Thinking、GPT-o3、Gemini-2.5-Flash,均经 API,温度与解码参数相同,数值未报告。严格黑盒。利益冲突写明部分作者任职阿里巴巴并参与 Qwen 开发,Qwen 在被测之列。
- 代理与切分:迁移实验用 Qwen3-14B 做适应度代理。初始种群由 Qwen3-Thinking 按附录 A.2 切分。
- 数据:GSM8K、SVAMP、MATH,只保留 MIP 集合中也出现的题目;过滤后题数未报告。B.1 写每个数据集均匀抽 10 个初始种子,Table 3 是一次代表性运行。附录另有 HumanEval、EntailmentBank、MT-Bench。
- 基线:BASE(未改动题目);MIP(Fan et al., 2025,手工缺前提);Table 4 的 AutoDoS。
- 指标与判定:Avg-len、Max-len,论文写对应 HGA 最后一轮,未写平均的分母。无 LLM 评审。附录 ASR 定义为该次运行中 HGA 输出同时长于 BASE 和 MIP 的概率。
- 搜索预算:N=10,G=5,pc=0.8,pm=0.2。每模型查询预算大约 60 次。主实验的 α 与 pqc 未报告。
主结果
Table 3 的 Max-len 如下。Avg-len 不在表中,见要点。
表格较宽,可左右滑动
模型与条件 SVAMP GSM8K MATH DeepSeek-R1 BASE 360 500 467 DeepSeek-R1 Ours 7814 9068 12206 Qwen3-Thinking BASE 1153 1004 9016 Qwen3-Thinking Ours 7906 6344 22303 GPT-o3 BASE 773 668 1039 GPT-o3 Ours 6562 3089 2198 Gemini-2.5-Flash BASE 871 625 6775 Gemini-2.5-Flash Ours 941 1209 18011 - 相对基线:Table 3 中,四个模型、三个数据集上 Ours 的 Max-len 与 Avg-len 都高于对应 BASE 和 MIP。DeepSeek-R1 在 MATH 上 Ours 的 Avg-len 为 8817,BASE 为 355,MIP 为 4323。作者称 GPT-o3 在 SVAMP 上相对 MIP 的 906 为 7.2 倍。摘要称 MATH 上最高 26.1×;Table 2 的 Ours Token Gain 亦为 26.1×,未写对应模型;引言写 up to 26 times。Table 2 还写 MIP 为 3.2×。
- 例外:Gemini-2.5-Flash 的放大小于另外三行。SVAMP 上 MIP 的 Max-len 为 683、Avg-len 为 380,低于 BASE Avg-len 455;GSM8K 上 MIP Avg-len 409 低于 BASE 530。Ours 仍高于二者:SVAMP Avg-len 594,GSM8K Avg-len 987。
- 作者解读:作者称高长度输出不是单纯重复或不终止,而是 overthinking 标记、自相矛盾和再评估。附录 A.1 给了 DeepSeek-R1 示例,不复述原文。Figure 2 对应 Table 3 的 GSM8K Avg-len;作者称四个模型都长于 BASE 和 MIP。文中 “significantly” 未见统计检验。
与 AutoDoS 比较
- 设置:Table 4 比较输入 token 与输出长度。论文未说明模型。
- MATH:HGA 输入 99,Max-len 32768,Avg-len 25419;AutoDoS 输入 2652,Max-len 16009,Avg-len 11207。作者称差别在 MATH 上尤其明显。
- 另外两集:SVAMP 上 HGA Max-len 10708 低于 AutoDoS 的 12775,Avg-len 8599 高于 8209,输入为 90 对 2518。GSM8K 上 HGA Max-len 11301 低于 11491,Avg-len 9662 高于 8551,输入为 165 对 2448。作者称 HGA 不靠长提示扩张,而靠紧凑的结构扰动。
迁移
- 设置:Qwen3-14B 做代理,G=5,三个数据集上优化后原样迁移。Table 5 为 SVAMP,Table 11 为 GSM8K 与 MATH。代理自身那一行的目标就是代理。
- 倍数:SVAMP Avg-len 放大为代理 2.5×、DeepSeek-R1 3.6×、Qwen3-Thinking 8.1×、GPT-o3 7.1×、Gemini-2.5-Flash 2.3×(Table 5)。GSM8K 上作者点名 Qwen3-Thinking 4.4×、GPT-o3 3.9×;该表代理自身为 1.7×,Gemini-2.5-Flash 为 2.2×。MATH 上 DeepSeek-R1 为 7.1×,Qwen3-Thinking 为 1.8×,Gemini-2.5-Flash 为 1.7×,代理自身为 1.9×(Table 11)。
- 作者解读:作者称绝对 token 低于直接优化(相对 Table 3),并称直接对 GPT-o3 这类商业模型跑进化常需数百次查询。作者认为 overthinking 是处理逻辑不一致输入时的共有特征,而非单一架构的个别缺陷。Table 5 的 SVAMP BASE Avg-len(DeepSeek-R1 为 685)与 Table 3 的 202 不同;论文未说明两表样本是否相同。
复合适应度
- MATH 上的 α:Table 6 未写模型。α=1.0 的 Avg-len 6258、Max-len 14132;α=0.0 的 Avg-len 7996;α=0.7 的 Avg-len 18315、Max-len 26576;α=0.5 的 Max-len 32019。作者认为只优化长度会停在局部最优,Score2 有助于找到更复杂的递归推理。
- 迁到 DeepSeek-R1:Table 7 在 Qwen3-14B 上优化再迁移。三个数据集上 α=0.7 的 Max-len 与 Avg-len 都高于 α=1.0:SVAMP 9887/5785 对 5847/3091,MATH 31998/10893 对 12320/7018。例外:GSM8K 上 α=0.5 的 8379/4358 高于 α=0.7 的 6839/4038;MATH 上 α=0.5 的 4904/2441 低于 α=1.0。
- 另两集:Table 10 未写模型。作者称 GSM8K 上 α=0.7 的 Avg-len 3646,相对纯长度目标增加 137.5%;SVAMP 上 α=0.7 的 Avg-len 6306,纯长度为 3192。GSM8K 上 α=0.5 的 Avg-len 567,低于 α=1.0 的 1535,也低于 α=0.0 的 1016。论文未解释该格。
其他消融与分析
- Table 8(模型未说明):Union 词表三数据集最高,MATH Avg/Max 为 22070/32768;Length-only 为 15611/21763,Random 对照为 13701/25934。
- Table 9(模型与数据集未说明):种群 5、代数 5 的 Max/Avg 为 5893/4188,代数 30 为 11301/9662;种群 30、代数 30 为 9624/8554。作者称增益在较小规模后趋于平台。
- Table 12(模型未说明):十次独立运行,三数据集上 Avg-len 与 Max-len 的 ASR 均为 100%。MATH 上 HGA 的 Avg-len 均值 19828(标准差 5466),Max-len 均值 29632(标准差 7128)。
- Table 13(模型未说明):HumanEval 的 HGA Avg/Max 为 8138/14467,BASE 为 1390/3082;EntailmentBank 为 2081/4346 对 530/1620;MT-Bench 为 6141/10445 对 1944/5255。
- Figure 3 纵轴为 Average Length,标到 8000,横轴 Step 标到 10,图例为 5 Generations 与 10 Generations;文本转换看不到曲线端点。作者称最佳适应度单调不降,主要增益在前 3–4 代。
- 附录 B.4 用第 0 代与第 4 代对比两类结构破坏:插入无关前提,以及前提与问题不再对齐。不复述示例原文。
有什么可以进一步探索的点?
作者把进化搜索的查询成本视为局限,并建议代理适应度预测器与多模态扩展。
作者指出的局限与后续方向
- 查询成本:Conclusion 写进化搜索的查询成本是局限。
- 每次都要真实查询:附录 B.5 写遗传算法计算成本高,因为每次适应度评估都要查询大推理模型,大规模实验昂贵;后续可用并行化与代理适应度预测器。
- 模态:B.5 写本研究聚焦文本推理模型;作者认为原理可能推广到多模态推理中过度的中间视觉或符号处理,并称探索该扩展是后续方向。
- 训练:B.5 提出奖励重设计,以及反冗余正则或熵惩罚;还提出用残缺或矛盾前提做课程式训练,使模型弃答或澄清,而不是递归推理。
- 检测与缓解:B.5 提出行为级监控、基于推理收敛的早停、识别冗余反思环的自适应截断,以及按用户或会话的 token 级限速。Conclusion 同样称需要针对推理环的行为监控,以及对逻辑不一致输入的鲁棒性训练。
实验覆盖范围
- 主结果覆盖 DeepSeek-R1 (671B)、Qwen3-Thinking、GPT-o3、Gemini-2.5-Flash,经 API 做黑盒查询;数据集为 GSM8K、SVAMP、MATH,对照 BASE 与 MIP,指标为最后一轮 Avg-len 与 Max-len(Section 4.1–4.2,Table 3)。Table 3 为一次代表性运行。
- 迁移以 Qwen3-14B 为代理、G=5,报告代理自身及四个目标模型在三个数据集上的长度(Table 5、Table 11、Table 7)。
- 另有 AutoDoS 对比(Table 4)、α 扫描(Table 6、Table 10)、词表五变体(Table 8)、种群与代数各取 5/10/20/30(Table 9)、十次随机种子(Table 12),以及 HumanEval、EntailmentBank、MT-Bench(Table 13)。
- 论文写直接攻击每模型大约 60 次查询,N=10、G=5、pc=0.8、pm=0.2;未报告主实验 α、pqc、温度数值、Avg-len 分母,以及过滤后的题目数。
- 论文未报告 Table 4、Table 6、Table 8、Table 9、Table 10、Table 12、Table 13 所用模型,也未报告 B.5 所提防御的实测数字。
总结一下论文的主要内容
HGA在黑盒推理模型上用逻辑扰动拉长输出,作者称可从小代理迁移,查询成本是其局限。
- 定位:这是一项针对黑盒大推理模型的 DoS 式资源攻击。作者要利用 overthinking,而不是求梯度或只加长表层提示。
- 问题:LRM 接入多步推理系统后,输出长度驱动能耗与延迟。作者认为不完整或逻辑不一致的输入会让模型多轮自修正,从而耗尽计算资源。已有工作或依赖白盒,或主要针对通用 LLM,缺前提构造又是手工的。
- 方法:HGA 把题目拆成前提与问题,以一代内标准化后的 CoT 长度和 overthinking 标记频率做适应度,再交换问题或前提、删除或插入前提。实验取种群 10、代数 5、交叉概率 0.8、变异概率 0.2;每模型查询预算大约 60 次。主实验未写 α。
- 主结果:Table 3 中,四个 API 模型在 GSM8K、SVAMP、MATH 上的 Ours Max-len 与 Avg-len 都高于 BASE 和 MIP。DeepSeek-R1 在 MATH 上 Ours 为 12206/8817,BASE 为 467/355。作者称 MATH 上最高 26.1×(摘要与 Table 2),引言另写 up to 26 times;并称 GPT-o3 在 SVAMP 上相对 MIP 的 906 为 7.2 倍。Gemini-2.5-Flash 的差距较小,且其部分 MIP 低于 BASE。
- 迁移与其他比较:Qwen3-14B 上进化的输入迁出后仍放大长度。SVAMP 上迁至 Qwen3-Thinking 为 8.1×(Table 5);MATH 上迁至 DeepSeek-R1 为 7.1×,迁至 Qwen3-Thinking 只有 1.8×(Table 11)。Table 4 未写模型:MATH 上 HGA 用 99 个输入 token 得到 Max-len 32768。附录十次运行的 ASR 为 100%,该表未写模型。
- 作者结论:作者认为复合适应度优于只优化长度,overthinking 是现代 LRM 共有、可被利用的弱点。查询成本被写成局限;作者提出行为监控、早停,以及对逻辑不一致输入的鲁棒性训练。