BITE:用上下文赌博机操纵风格偏置攻击 LLM 评委
Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges
BITE在聊天榜与AI审稿上黑盒抬分;作者称ASR超过65%,9分制提分1–2。
攻击者对答案做语义保持的风格修改,使黑盒评审J的分数最大;不能访问参数或梯度,查询预算有限,使用修改函数ψ与预设动作集B。
- LLM评审存在冗长、格式、语气等风格偏差。作者认为这些偏差已被当作局限,但在榜单、数据筛选、RLHF和自动审稿中可被用来抬高分数。
- BITE在黑盒下把语义保持的风格编辑选择做成上下文赌博机,用LinUCB按分数边际增量更新策略。动作来自已报道的风格偏差,辅助模型改写,候选池保留高分答案。
- 作者称BITE在两个聊天基准上的抬分高于提示注入和越狱。Table 7中AlpacaEval成对主观题ASR为65.0%,逐点客观题为96.0%。跨评委迁移偏低;风格校正后分数仍接近原分。
- 论文未专节写局限;Conclusion呼吁更稳健、可感知攻击的评测。实验写明五名主评委、AlpacaEval 2.0、Arena-Hard-Auto与MLRBench,未报告这些基准的样本条数,也未报告LinUCB的α。
- 威胁模型
- 攻击者对答案做语义保持的风格修改,使黑盒评审J的分数最大;不能访问参数或梯度,查询预算有限,使用修改函数ψ与预设动作集B。受害对象是用于榜单、数据筛选、RLHF与自动审稿的LLM judge。
- 被测模型
- o3-miniGemini-2.5-FlashLlama-3.3-70B-InstructDeepSeek-R1-0528Qwen3-235b-a22bLlama3-8B-InstQwen3-8BDeepSeek-R1-Distill
- 基准
- AlpacaEval 2.0Arena-Hard-AutoMLRBench
- 指标
- ASRscore improvementScore LiftTransfer ASRUnbeaten Rate
研究者提出 BITE(BIas exploraTion and Exploitation),一个黑盒对抗框架,通过学习保持语义不变的风格化改写来误导 LLM 评委、人为抬高其给出的分数。该方法把风格编辑的选择建模为上下文赌博机问题,用 LinUCB 策略在无法访问模型参数或梯度的情况下自适应挑选编辑。在聊天机器人排行榜和 AI 评审基准上的多种 LLM 评委与任务(含逐点和成对比较)中,BITE 的攻击成功率超过 65%,在 9 分制上把分数抬高 1-2 分,同时保持语义等价。研究还评估了攻击的隐蔽性,显示 BITE 能绕过标准风格控制方法和若干检测基线。作者认为这暴露了 LLM-as-a-judge 范式的根本弱点,呼吁更稳健、能感知攻击的评测方式。
深度解读
这篇论文试图解决什么问题?
作者要把LLM评审的风格偏好转成可按需抬分、且保持语义的黑盒攻击面。
能否系统利用LLM评审的风格偏差,在保持语义的前提下按需抬高其打分,并避开风格控制与检测。
- 场景:作者称LLM-as-a-judge已用于聊天机器人榜单、数据筛选、RLHF奖励模型和自动审稿。分数被抬高会扭曲榜单、污染偏好数据,并损害这些评测。
- 现有不足:作者称自我偏好、冗长、格式和语气等偏差已被指出,但现有研究把它们当局限,而不是可利用的安全漏洞。
- 核心问题:作者提出三问:偏差能否被系统利用并按需操纵分数;不同模型敏感度是否不同、如何刻画;攻击能否避开风格控制或自动防御。
- 本文做法:作者提出BITE(BIas exploraTion and Exploitation),在黑盒下把风格编辑的选择做成上下文赌博机,用LinUCB学习针对单个评审的策略。
- 威胁模型:
- 目标:对问题q的答案a做风格修改得到a′,使黑盒评审J的分数最大,同时保持a的语义。
- 知识:严格black-box,不能访问参数或梯度;作者称这对应经由API使用专有系统。
- 能力:查询预算有限;用修改函数ψ和预设的语义保持动作集B(如改变冗长度或语气),观察反馈后自适应选择修改。
- 受害系统:用作评测器的LLM judge,场景包括榜单、数据筛选、RLHF和自动同行评审。
有哪些相关研究?
相关工作分风格偏差与直接攻击评审两类;作者称后者更显眼、更易被发现。
风格偏差
- 自我偏好:Panickssery等(2024)与Li等(2025)讨论LLM偏向自家模型族的输出。相关工作节只作描述。
- 风格压过内容:Doddapaneni等(2024)写到文笔好但事实错的回答可能胜过准确但不那么精炼的回答;Dubois等(2024)讨论更长、更冗长的回答;Wei等(2025)、Long等(2025)、Zhang等(2025)讨论列表、Markdown或emoji。
- 作者的转向:作者称这些工作指出了潜在局限,本文把它们变成主动攻击面,并称可以隐蔽地影响评审。
对评审的直接攻击
- 后门与扰动:Tong等(2025)的BadJudge在微调时植入隐藏触发器以控制评审输出;Shi等(2024a)对用户提示施加通用对抗扰动。
- 空模型:Zheng等(2025)发现null models可利用评测协议中的缺陷取得高胜率。
- 与本文的对照:作者称,与BITE相比,这些直接攻击通常更显眼,因而更容易被发现。批评对象是这一类直接攻击,不是被引作者自己的结论。
基线与基准
- 基线方法:提示注入为Naive、Context Ignore、Fake Completion、Escape Characters(Chen等,2025b)和Null Model;越狱为PAIR(Chao等,2023)、TAP(Mehrotra等,2023)、AutoDAN(Liu等,2024a)。语义保持消融为Holistic Rewrite、Iterative Rewrite、Random Action。附录还与白盒方法JudgeDeceiver(Shi等,2024b)比较。
- 基准:AlpacaEval 2.0(Dubois等,2024)、Arena-Hard-Auto(Li等,2024b),以及自动审稿基准MLRBench(Chen等,2025a)。
作者把本文定位为:在纯黑盒下用上下文赌博机学习针对单个评审的风格策略,而不是植入后门或注入显式对抗提示。
论文如何解决这个问题?
BITE把风格编辑选择做成上下文赌博机,用LinUCB在黑盒分数反馈下迭代抬分。
BITE把对黑盒评审的风格抬分写成上下文赌博机:观察当前答案,选择语义保持的编辑,用分数的边际变化更新LinUCB。
问题设定
- 评审:J把评测上下文映到标签分布。逐点上下文是问题与目标答案;成对还含参照答案。第3.1节举例中,逐点标签可以是数值分,成对标签如Win、Tie、Lose。
- 优化目标:对基础答案做风格修改,使黑盒J的分数最大,并保持原语义。攻击在T轮上进行,目标是最大化期望累积奖励。
- 奖励:每轮奖励是子答案相对父答案的分数增量,用来鼓励立刻抬分的动作。
- 错设:作者采用随机线性奖励模型,并称真实奖励函数很可能高度非线性。错设水平ζT取各轮错设项的均方根,且假定算法已知ζT。
攻击循环
Figure 1与Algorithm 1中,一轮的顺序是:
- 池初始化为(a0, S0),S0=J(q, a0)。每轮从池中均匀抽取父答案。
- 用预训练嵌入得到固定维状态。实验嵌入为all-MiniLM-L6-v2。
- LinUCB在动作集上选臂。每个臂有估计参数、协方差矩阵,α为探索系数。实验节未给出α的数值。
- 辅助LLM执行风格修改函数,新答案交给J。实验辅助模型为Gemini-1.5-Flash-8B;预算T=25,池大小K=3。
- 用该轮状态和奖励更新所选臂;新答案入池,超过K则删除最低分。各臂协方差初值为单位阵。
动作集
- 规模:动作集从既有文献中的风格偏差整理而来。正文称共8种,列在附录A.1与Table 3。
- 类型:Sentiment、Authority、Verbosity、Bandwagon、Distraction、Markdown、JSON、Emoji。附录A.2给出每种修改的完整提示词;附录D给出改写与评审提示词。
- 排除项:作者排除Fallacy Oversight等认知类偏差和Gender Bias。理由是要保持语义与逻辑内容,并使用可普遍施加的格式和语气,而不是身份标记。作者称以后可以把性别特征加进输入。
理论界
- 结果:Theorem 5.1给出错设观测下的线性代理伪遗憾。每个风格臂单独维护线性参数,并联合控制多臂遗憾。
- 条件:上下文范数与参数范数有上界,噪声为条件零均值的R-sub-Gaussian。证明在附录C。
- 作者的说法:这是对Abbasi-Yadkori等(2011)LinUCB分析的改写,使遗憾界显式依赖错设水平;错设增大时表现按该界变差。
成功定义
- 脚注ASR:修改后答案获得严格更高评审分数的案例比例。
- Table 7的ASR:逐点要求终分提高不少于1分;成对要求偏好裁决翻转到攻击方有利。两套定义不要混用。
- 预算:提示注入基线为一次性;越狱方法与BITE限制为25次交互。
论文做了哪些实验?
Table 1中BITE对五名评委的平均抬分都高于同表其他方法。
实验设置
- 评委:主实验为o3-mini、Gemini-2.5-Flash、Llama-3.3-70B-Instruct、DeepSeek-R1-0528、Qwen3-235b-a22b。附录B.8另攻击Llama3-8B-Inst、Qwen3-8B和DeepSeek-R1-Distill;正文亦写DeepSeek-R1-Distill-Qwen-8B。
- 数据:AlpacaEval 2.0与Arena-Hard-Auto。逐点种子由GPT-4.1-mini生成,成对参照为GPT-4o。审稿案例用MLRBench,初始评审针对Gemini-2.5-Pro、Claude-3.7-Sonnet、o4-mini生成的论文,提示与原基准相同。论文未报告样本条数。
- 攻击配置:改写模型Gemini-1.5-Flash-8B,嵌入all-MiniLM-L6-v2,T=25,K=3。提示注入为一次性;越狱与BITE限25次交互。成对结果是交换答案位置后两次运行的平均。
- 基线:Naive、Context Ignore、Fake Completion、Escape Characters、Null Model;PAIR、TAP、AutoDAN;Holistic Rewrite、Iterative Rewrite、Random Action。
- 指标:分数提升。脚注ASR为修改后分数严格更高的比例。Table 7的ASR为逐点终分提高不少于1分,或成对裁决翻向攻击方。逐点原始分为1–9;普通成对win/lose映到{+1, −1},ArenaHard五点映到{+2, +1, 0, −1, −2}。
- 其他打分:GPT-5给语义相似度,范围为−1到1。防御实验里GPT-4.1-mini给评审解释的风格关注度打1–5分,4分及以上算检出。
主结果
下表是Table 1的平均分数提升。表头是简称,对应第6.1节的五名评委。论文未写明该平均跨哪些题目,也未写明是否把逐点1–9与成对归一化分数合在一起。未列入Naive、Context Ignore、Escape Chr、Null Model、TAP。
表格较宽,可左右滑动
评委 BITE PAIR Fake Completion AutoDAN Qwen 2.010 1.284 1.287 0.941 DeepSeek-R1 1.909 1.856 1.214 1.365 Llama-70B 1.347 1.233 1.080 1.166 Gemini-2.5-flash 1.731 1.337 1.089 1.489 o3-mini 1.356 0.869 1.103 1.091 - 作者解读:作者称BITE比提示注入和越狱更能抬分。Table 1里每一列的BITE都高于同列所列方法。比较发生在提示注入一次性、越狱与BITE各25次交互的设置下。
- 另一套ASR:Table 7把ASR定义为逐点至少提高1分,或成对裁决被翻转。其中BITE在AlpacaEval成对主观题为65.0%,逐点客观题为96.0%,逐点主观题为97.3%。摘要写ASR超过65%、9分制提分1–2;Table 7的四个逐点Score Lift为1.85、2.27、2.85、3.82,与摘要的1–2不是同一组数字。
- 机制解读:作者称注入和越狱常依赖对抗前缀或触发短语,对齐后的评审能够识破;BITE改的是风格和格式偏好。这是作者的解释,不是Table 1里的检测率。
题目类型、审稿与语义
- 客观题:Table 7中,BITE在ArenaHard逐点客观题的ASR为95.8%、Score Lift为3.82;AlpacaEval成对客观题为69.5%与1.11。作者称事实题上的正确性评判也会被风格线索带动。
- 基线例外:作者称Random优于Iterative Rewrite,因而支持其动作集。ArenaHard成对客观题上,Random的ASR为69.3%、Score Lift为1.30,Iterative Rewrite为69.6%与1.33,这一格并非更高。
- 审稿与相似度:Table 2中BITE对每名评委的终分都最高。deepseek-r1-0528从5.67±0.97到7.63±0.29;llama-3.3-70b-instruct从7.90±0.07到8.38±0.18,Random为8.34±0.19。作者称多数攻击回答与原文语义相似度超过90%。Table 9中BITE的余弦相似度在AlpacaEval为0.916±0.119,ArenaHard为0.906±0.132。Table 8里GPT-5评分中,JSON、列表和Verbosity为1.000,Authority为0.717。
漏洞指纹与迁移
- 回归:作者用18个风格特征预测分数变化,每个评委单独拟合。Figure 3只显示p<0.05的系数。作者称各评委对token count和italic count的系数为正;并称Gemini-2.5-flash与Qwen3-235b-a22b-2507对special char的β约0.25,o3-mini与Deepseek-R1-0528则惩罚该特征。
- 迁移数字:Figure 4对角线为100%。qwen3-235b-a22b-2507作为源、deepseek-r1-0528作为目标时,Transfer ASR为30.6%;qwen作为目标时,其他源的格子为12.8、9.7、8.9、11.6。
- 作者解读:作者称非对角偏低,说明策略专属于评委;DeepSeek-R1-0528整体上最易被迁入,qwen作为目标更难、作为源更强。作者假设这来自数据生成者向后续模型传递风格偏好,并称之为preference leakage。这是假设,不是测得的训练数据关系。
隐蔽性与防御
- 风格校正:作者采用Li等(2024a)的style control,用长度、标题等估计风格贡献再减去。作者称Figure 5校正后的分数与原分接近。Table 12中,AlpacaEval逐点BITE校正前为8.546±1.307,线性校正后为8.571±1.315,非线性为8.477±1.279。作者称非线性版本结论相同。
- 检测:附录B.7.2中,OpenAI提示注入检测器对提示注入基线的检出率为100%,对BITE样本为0%。元评审在AlpacaEval上对未攻击解释的检出率为80.80%,对BITE为79.5%;ArenaHard上分别为6.40%与2.80%(Table 11)。作者称该防御不可靠。
- 改写与随机提示:Table 13把Score Lift从+3.11±0.80降到+1.77±0.58;作者称约降43%,攻击仍然有效,论文未说明评委和数据集。Table 14中,ArenaHard逐点BITE从8.50±1.09降到5.51±1.14,未攻击基线答案从6.09±2.55降到5.45±2.84。作者称去风格在简单任务上能压低攻击分,但也会压低正常答案,并且依赖任务。
其他消融与分析
- Table 5:BITE对Iterative Rewrite的Unbeaten Rate为92.96%,平均分差+0.393;对Random为90.88%,+0.105。
- Table 6:评委固定为Qwen3-235B时,逐点分数提升为Gemini-1.5-Flash-8B的2.69、GPT-4.1-Nano的2.87;成对为1.42与1.48。
- Table 15:BITE(25)在Llama3-8B-Inst、Qwen3-8B、DeepSeek-R1-Distill上为1.481、1.905、1.997;JudgeDeceiver(600)为1.000、2.000、0.000。Qwen3-8B上600步白盒高于BITE。作者称DeepSeek上的0.000是因为梯度优化对准即时回答token,与强制推理轨迹冲突。表题未写出指标名称。
- 作者称Figure 15中BITE的CI-Width在25轮内下降。论文未报告α的取值。
有什么可以进一步探索的点?
论文未专节讨论自身局限;Conclusion呼吁更稳健、可感知攻击的评测。
作者指出的局限与后续方向
- 专节:论文没有Limitations或Future Work专节,未逐条列出方法自身的不足。
- 后续方向:Conclusion写明,社区需要开发从根本上更稳健、并且能感知攻击的评测系统。
实验覆盖范围
- 主实验评委为o3-mini、Gemini-2.5-Flash、Llama-3.3-70B-Instruct、DeepSeek-R1-0528、Qwen3-235b-a22b,共5个(第6.1节)。附录B.8另在Llama3-8B-Inst、Qwen3-8B、DeepSeek-R1-Distill上与JudgeDeceiver比较。
- 任务包括AlpacaEval 2.0与Arena-Hard-Auto的逐点、成对评测,以及MLRBench审稿案例(第6节、Table 2)。成对评测交换位置后做两次运行。
- 黑盒基线包括5种提示注入、3种越狱,以及Holistic Rewrite、Iterative Rewrite、Random Action;优化类方法的交互预算为25次(第6.1节)。
- 防御实验包括线性与非线性style control、基于评审解释的元评审、随机化提示、LLM改写去风格,以及OpenAI提示注入检测器(第6.4节、附录B.7)。
- 论文未报告AlpacaEval、Arena-Hard-Auto和MLRBench的样本条数,未报告LinUCB探索系数α的取值,未报告GPT-5语义评分与人工判断的一致性。
总结一下论文的主要内容
BITE用黑盒赌博机利用风格偏差抬分,作者称这对LLM-as-a-judge构成威胁。
BITE是黑盒风格操纵:在保持答案语义的同时,抬高LLM评审给出的分数。
- 要解决的问题:评审已进入榜单、偏好数据构造和审稿。作者认为冗长、格式和语气等偏差可被按需利用,并要看攻击能否躲开风格控制与检测。
- 做法:把编辑选择写成上下文赌博机。LinUCB在8类风格动作中选臂,奖励是相对上一版的分数差;候选池K=3,交互预算T=25,改写由Gemini-1.5-Flash-8B执行。
- 聊天基准:Table 1里五名评委上,BITE的平均分数提升都高于同表的提示注入和越狱。Table 7中,AlpacaEval成对主观题的BITE ASR为65.0%,逐点客观题为96.0%。摘要另写ASR超过65%,9分制提分1–2。
- 审稿与迁移:Table 2中BITE对每名评委的终分都最高,其中deepseek-r1-0528为7.63±0.29。Figure 4对角线为100%,作者称非对角更低,策略随评委变化。
- 防御:作者称按长度和标题做的风格校正后,分数仍接近原分。附录中提示注入检测器对BITE样本的检出率为0%。Table 14中,去风格改写也会降低未攻击答案的分数。
- 作者结论:作者称各评委有不同的脆弱点,攻击不宜原样迁移;并称需要可感知攻击的评测,否则榜单、RLHF数据和审稿都会受影响。