SAGO:从稳定性而非准确率出发的多维度大模型泛化评测
Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
作者提出 SAGO,把 LLM 泛化评成同一输入在语义等价变体上的逐例行为稳定性,并报告多轴不稳定且排序可随数据集反转。
- 现有泛化评测多用单一提示格式或单一变体的聚合准确率,会把鲁棒性与总体分数混淆,并掩盖单例行为变化。作者认为泛化应是同一输入换种表达后输出仍稳定。
- SAGO 对每条提示施加社交语域、表面噪声和结构改写三类语义等价变体,用 RMS 得到逐例 SGS,分别测活化几何、生成一致性、置信度与响应镜像。主结果用单侧 t 检验,主阈值 ε=0.05。
- 八个开源与三个闭源模型在六个事实问答集上均未均匀泛化:Δ-BLEU 与 Δ-MR 对每个模型在 p<0.001 下显著,Δ-Ent 最大仅 0.012。轴之间可解离,跨数据集差异足以反转排名。
- 作者在 Discussion 中写明:SAGO 不追因果机制;数据仅英语;Δ-BLEU 可能反映无害改写;N=16 未覆盖稀有失败;结构变体与社交镜像依赖 GPT-4o-mini;闭源结论受限于 API 可见轴。
- 模型
- Llama-3.2-3B-InstructLlama-3.1-8B-InstructGemma-2B-ITGemma-7B-ITGemma-4-E4B-ITQwen2.5-1.5B-InstructQwen2.5-7B-InstructQwen3.5-9BGPT-5.4Gemini-2.5-FlashClaude-Sonnet-4.6
- 基准
- TruthfulQANatural QuestionsAlpacaSimpleQA VerifiedTriviaQAHotpotQA
- 指标
- SGSΔ-CosΔ-BLEUΔ-BERTΔ-ProbΔ-EntΔ-MR
研究者提出 Stability-Aware Generalization Objective(SAGO)框架,主张把大语言模型的泛化理解为同一输入在不同表达方式下输出的一致性与语义稳定性,而不是单一提示格式、任务或变体集合上的聚合准确率。该框架在单个样本层面、跨多种输入变体、跨模型行为的不同维度测量行为变化,涵盖生成一致性、内部激活、置信度和回答镜像等维度。结果显示,许多常用模型表现出统计显著且一致的泛化不稳定:没有模型能均匀泛化,不同行为维度捕捉到相互独立的失效模式,跨数据集的变化还可能反转模型排名。
深度解读
这篇论文试图解决什么问题?
现有泛化评测用聚合准确率,作者改为测同一输入在多种变体下的逐例行为稳定性。
现有评测把泛化等同于单一提示格式、单一任务或单一变体集上的聚合准确率,从而把鲁棒性与总体基准分数混淆。
- 场景:作者称 LLM 用于搜索、编程助手和智能体工作流,同一用户意图会在用词、长度、语气、格式或噪声上变化。对齐后的模型仍应完成任务、拒绝有害请求并遵循策略,而不论输入如何表达。
- 现有不足:论文列出三点。许多评测只覆盖单一领域,安全等领域的成功不能当作泛化能力的证据;只测一类语义等价改写,模型可能适应了该模式却在其他表达上失败;聚合分数会让一些变体上的失败被另一些变体上的成功抵消,从而掩盖单例行为变化。
- 核心观察:作者将泛化定义为同一目标与上下文在语义等价输入变体下保持行为,并认为应在单例层面测变异,而不是把表现压成可靠狭窄训练提升的分数。
- 提出 SAGO:Stability-Aware Generalization Objective 比较基线输入与受控变体,测量生成一致性、内部激活、置信度与不确定性、响应镜像。作者称贡献为:跨数据集与多类变体的逐例稳定性框架;多轴度量;以及十一个 LLM、六个数据集上的实证研究。
有哪些相关研究?
相关工作分为分布外鲁棒、提示级一致性与超出准确率的行为信号,作者认为缺少逐例多轴评测。
分布外鲁棒性
- 域泛化与大规模基准:Zhou 等(2022)把域泛化形式化为留出分布上的单一性能数字;Hendrycks 等(2020)与 Koh 等(2021)的 WILDS 在多个域上聚合这一差距;Wang 等(2023)的 DecodingTrust 报告分布偏移下的聚合准确率。
- 论文指出的不足:这些工作确认分布偏移会降低性能,但不问同一输入换种表达时行为是否一致,且按样例聚合,从其报告的指标无法测量逐例翻转。
提示级变体下的一致性与敏感性
- 语义等价改写:Elazar 等(2021)识别释义事实查询的不一致;Errica 等(2025)与 Salinas 和 Morstatter(2024)研究指令微调与系统性分歧。更窄的范围包括跨语言变体(Deng 等,2024;Wang 等,2024;Pattnayak 和 Chowdhuri,2026)、社交语气(Yin 等,2024;Cai 等,2025;Dobariya 和 Kumar,2025),以及有害或风险请求的一致性(JailbreakBench、RMCBench、MedSafetyBench、HarmBench 等)。
- 表面形式:Sclar 等(2024)与 Zhuo 等(2024)的 ProSA 测格式与模板;Lu 等(2022)测上下文示例顺序;Abedin 等(2025)、Himelstein 等(2025)与 Seleznyov 等(2025)测标点、空白等低层扰动。
- 论文指出的不足:这些工作确立了语义等价输入下行为很少不变,但多数只测单一领域或单一变体族,并以平均准确率或性能离散度汇总,会掩盖逐例不稳定并高估泛化。
超出准确率的行为信号
- 分轴信号:隐藏状态几何用于跟踪表示随输入的变化(Himelstein 等,2025);BERTScore(Zhang 等,2019)与 BLEU(Papineni 等,2002)分别量化语义与词汇重叠;token 对数概率与预测熵用于置信度与不确定性(Farquhar 等,2024;Ma 等,2025);风格迫近被作为独立行为现象研究(Truong 等,2025;Blevins 等,2026)。
- 多维度基准:Habba 等(2025)的 DOVE 跨多个数据集、变体族和非聚合指标评测,但作者称其仍限于准确率这一行为信号。
- 论文的定位:作者称这些信号过去被单独用于单轴主张,尚未在同一逐例分析中合并;缺失的是跨数据集与语义等价变体、测量不同不稳定如何共现的多轴评测。
论文未单列一组命名的对比基线方法。评测数据集为 TruthfulQA、Natural Questions、Alpaca、SimpleQA Verified、TriviaQA 和 HotpotQA。
论文如何解决这个问题?
SAGO 用三类语义等价变体和四类行为轴,以归一化 RMS 的 SGS 量化逐例偏离。
SAGO 把泛化定义为:同一提示的语义保持变体下,模型行为保持稳定。框架包含受控变体基准、逐提示稳定性分数,以及捕获不同失败模式的行为轴。
问题设定与目标
- 符号:指令微调模型 fθ 在数据集集合上评测。对提示 xi,基线响应为 yi = fθ(xi);c 把提示映射到语义内容。变体由保持语义的变换 Tv 生成,满足 c(xi(v)) = c(xi)。
- 逐例变化:轴 X 是模型在某提示上的标量性质。ΔX(i, v) = X(fθ, x_i^{(v)}) − X(fθ, xi),符号保留方向,后续 RMS 用平方取幅度。
- 目标:判断 ΔX(i, v) = 0 是否对所有样例与所有变体成立;不成立则量化偏离。任何违反都被视为该轴上的泛化失败,且各轴分开评估,因为一个轴上的泛化不意味着另一轴也泛化。
基准构造
- 变体元组:v = (F, u, s, p):族 F、子类型 u、强度 s、位置 p ∈ {PREFIX, SUFFIX, GLOBAL}。三族的选择使得一族上的稳定不推出另一族上的稳定。
- Social register:改变人际框架,包括礼貌、直接、问候、缓和、感谢与负面社交框架,实验中为十一个礼貌强度。
- Surface noise:三个子类型——间距、标点、字母大小写——各有多个强度。语义保持由构造保证。
- Structural rewriting:控制长度压缩或扩展,以及疑问句与祈使句互换;结构变体按构造为全局。非表面噪声族只保留所有变体 BERTScore > 0.85 的提示。
稳定性得分 SGS
- 归一化:Δ̃X(i, v) = ΔX(i, v) / RX。有界轴的 RX 取 |ΔX| 的理论最大值;无界的序列对数概率用评测中经验范围导出的固定常数。归一化后落在 [−1, 1],0 对应无行为变化。
- 逐提示与汇总:sX(i) 是变体集上归一化 delta 的 RMS;只有每个 delta 都为 0 时 sX(i) = 0。数据集得分是逐提示不稳定性的平均;总分 SGSX 对全部数据集按提示等权汇总。越低表示该轴泛化越强,0 当且仅当每条提示都满足零变化。
- 显著性:单侧 t 检验 H0: E[sX(i)] ≤ ε 对 H1: E[sX(i)] > ε。ε ∈ {0.01, 0.05, 0.10},分别对应归一化范围的 1%、5%、10%;主结果用 ε = 0.05。拒绝 H0 表示不稳定性超过作者设定的实用阈值。
四类行为轴
- 激活几何 XAct:取每层最后一个非 padding 隐藏状态,ΔXAct 为各层余弦相似度减 1 的平均,负值表示表示漂移;RAct = 2。作者称选最后隐藏状态是因为因果掩码使其聚合全部输入,并直接条件化生成。
- 生成一致性:ΔXBLEU 与 ΔXBERT 分别是变体响应与基线响应的 BLEU、BERTScore-F1 相对基线自身的差。BLEU 计分区间为 [0, 100],RBLEU = 100;BERTScore 区间为 [0, 1],RBERT = 1。二者分别对应词汇变化与语义层漂移。
- 置信度:ΔXProb 为序列对数概率之差,RProb = 250;ΔXEnt 为平均 token 熵之差,REnt = 10。两者都按评测中观察到的经验范围设定。作者称序列对数概率不按响应长度归一化,更长响应可仅因累积更多 token 而取更低值,故同时保留长度敏感与长度不变两种视角。
- 响应镜像 XMR:二元检测器 m(y, v) 判断响应是否反映变体 v 的目标表面属性,ΔXMR 取值于 {−1, 0, 1},RMR = 1。作者把镜像当作行为敏感性,不预设它是意图中的对齐还是非意图中的不稳定。
论文做了哪些实验?
十一个模型、六个数据集上,无模型均匀泛化;生成一致性最敏感,轴间可解离,排名可随数据集反转。
实验设置
- 开源模型:Llama-3.2-3B-Instruct(L-3B)、Llama-3.1-8B-Instruct(L-8B);Gemma-2B-IT(G-2B)、Gemma-7B-IT(G-7B)、Gemma-4-E4B-IT(G4-E4B);Qwen2.5-1.5B-Instruct(Q-1.5B)、Qwen2.5-7B-Instruct(Q-7B)、Qwen3.5-9B(Q3.5-9B)。
- 闭源模型:GPT-5.4、Gemini-2.5-Flash(Gem-2.5F)、Claude-Sonnet-4.6(Cl-S-4.6),经 API 评测。全部模型确定性解码,T=0。XAct 与 XProb 因 API 限制对闭源不可用;XEnt 仅对 GPT-5.4 计算。
- 数据集:TruthfulQA、Natural Questions、Alpaca、SimpleQA Verified、TriviaQA、HotpotQA,覆盖健康、法律、金融、政治、科学、历史、地理、通识与创造性指令跟随。每个数据集抽样 N=16 条提示,由附录 D 的样本量消融说明。
- 指标与检验:主指标为各轴 SGS,主阈值 ε=0.05;表中 ∗ 为 p<0.05,∗∗ 为 p<0.01,† 为 p<0.001。实验要回答失败模式是否在六个 Δ 轴上解离、跨数据集变异是否大到反转排名、闭源是否呈现与开源不同的不稳定轮廓。
- 实现:BLEU 重缩放到 [0, 1];BERTScore-F1 用 RoBERTa-large。XProb 与 XEnt 在 teacher forcing 下计算。社交语域镜像以 GPT-4o-mini 为评审,10% 标签人工核对;表面噪声镜像用规则启发式;长度镜像检查响应长度是否落在目标倍数的 ±0.25 内。
- 计算:开源实验在四块 NVIDIA RTX 2080 Ti 与四块 GTX 1080 Ti(CUDA 12.8)上运行;闭源使用提供商 API。
主结果
下表为六个数据集汇总后的总 SGS。开源八模型据 Figure 2a;正文另给出 G4-E4B 的 Δ-BERT 0.178、Δ-BLEU 0.837,Q3.5-9B 的 Δ-BERT 0.080、Δ-BLEU 0.520、Δ-Prob 0.088、Δ-MR 0.441。闭源三模型据 Table 1 的 Total SGS(ε=0.05)。GPT-5.4 的 Δ-Ent Total 为 0.154±0.10(Table 6,†)。
表格较宽,可左右滑动
模型 Δ-Cos Δ-BLEU Δ-BERT Δ-Prob Δ-Ent Δ-MR L-3B 0.12 0.61 0.09 0.04 0.01 0.35 L-8B 0.27 0.63 0.08 0.04 0.01 0.57 G-2B 0.07 0.64 0.10 0.06 0.01 0.32 G-7B 0.13 0.62 0.08 0.07 0.01 0.55 G4-E4B 0.10 0.84 0.18 0.05 0.01 0.38 Q-1.5B 0.05 0.73 0.11 0.03 0.01 0.34 Q-7B 0.28 0.67 0.09 0.07 0.01 0.59 Q3.5-9B 0.06 0.52 0.08 0.09 0.01 0.44 Table 1 的 Total SGS:GPT-5.4 的 Δ-BLEU 0.414±0.13†、Δ-BERT 0.056±0.02†、Δ-MR 0.020±0.08;Gem-2.5F 分别为 0.312±0.28†、0.105±0.02†、0.005±0.03;Cl-S-4.6 分别为 0.505±0.13†、0.120±0.09†、0.061±0.11。Figure 2a 未给显著性标记。
- 无均匀泛化:作者称每个开源模型至少在一个轴上超过 ε=0.05,且 Δ-BLEU 与 Δ-MR 对每个模型在 p<0.001 下显著。作者认为这跨三个架构族成立,反映当前指令微调的结构性质,而不是单个模型可修正的缺口。
- 规模不消除该模式:作者称 L-8B、G-7B、Q-7B 在大多数轴上与更小对应模型同样或更不稳定(Figure 2a),从而排除“参数量增大即消除该失败”的假设。Δ-Ent 在所有模型上最大值为 0.012,落在可接受阈值内。
- 轴解离与跨数据集:作者称 G4-E4B 生成不稳定性最高,却低于前代 G-2B(0.097)与 G-7B(0.084)的 Δ-BERT;Q3.5-9B 生成最稳定却置信度不稳定性最高。作者称 L-8B 的 Δ-Cos 跨六个数据集有 3.7 倍极值比,Δ-MR 超过翻倍(附录 C),足以反转模型排名。
闭源模型的分数据集轮廓
- 测了什么:Table 1 给出三个闭源模型在六个数据集上的 Δ-BLEU、Δ-BERT、Δ-MR(ε=0.05)。生成一致性在所有列出的数据集上均标有 †(p<0.001),除 Gem-2.5F 在 Alpaca 上的 Δ-BLEU 为 0.226±0.27,标记为 ∗∗。
- 结果:Δ-BLEU 的数据集值中,GPT-5.4 从 Natural Questions 的 0.354±0.12 到 TriviaQA 的 0.477±0.13;Gem-2.5F 从 Alpaca 的 0.226±0.27 到 TriviaQA 的 0.411±0.30;Cl-S-4.6 从 HotpotQA 的 0.457±0.13 到 Alpaca 的 0.569±0.13。Δ-MR 方面,Gem-2.5F 在多个数据集上为 0.000,Total 为 0.005±0.03;Cl-S-4.6 在 HotpotQA 上为 0.130±0.14(∗),TriviaQA 上为 0.112±0.14(∗)。
- 作者解读:作者在 Discussion 中称开源与闭源的差异表明,更强的模型并不消除不稳定,而可能把不稳定移到其他行为维度。Figure 2b 把十一个模型画在 SGSBLEU 对 SGSMR 上,并标出 Ideal 与 Pareto frontier;图中闭源三点位于较低的镜像轴。
阈值鲁棒性
- 测了什么:附录 B 的 Table 5 在 ε ∈ {0.01, 0.05, 0.10} 上重新标注显著性,并给出各轴拒绝 H0 的模型计数。
- 结果:Δ-BLEU 在三个阈值上对每个有该轴的模型都是 p<0.001。Δ-BERT 在 ε=0.05 及以下普遍显著,在 ε=0.10 时仅 4/2/2 个模型分别在 p<0.05 / 0.01 / 0.001 下仍显著。Δ-Cos 在 ε≤0.05 时为 8/8/8 与 7/7/7,ε=0.10 时八个开源模型中仍有四个拒绝。Δ-MR 在三个阈值上分别为 9/9/9、8/8/8、8/8/8。Δ-Prob 在 ε=0.10 时全部丧失显著性;Δ-Ent 在 ε=0.01 时为 3/3/2,其余阈值为 1/1/1。
- 作者解读:作者称主文结论在 ε=0.05 成立,在 ε=0.01 仍保持;ε=0.10 是压力测试,不是推荐的操作点。
其他消融与分析
- 样本量(附录 D):从 TruthfulQA 无放回抽样 N ∈ {4, 8, 16, 32, 64, 128},每个 N 重复 500 次,跟踪按 (F, u, s, p) 分组后组均值跨提示的标准差。正文只写明 N=16 由该消融支持,并在 Discussion 中称该操作点针对典型逐提示不稳定性得到验证。
- 强度与位置(附录 E):论文称强度与位置消融在附录 E;转换文本未给出可对齐列的完整数字表。
- 社交语气不对称:作者称负面语气相对礼貌语气,在大多数模型和轴上引起更大变化;转换文本未给出对应数值。
- 长度因子(Figure 9):横轴为相对原提示的目标长度比,低于 1.0 为压缩、高于 1.0 为扩展;纵轴为逐提示不稳定性的标准差。作者称压缩在生成一致性与镜像轴上引起更大且更一致的行为变化,置信度轴对扩展响应更强。图中标出的轴刻度包括 BERTScore 的 STD 到 0.04、BLEU 的 STD 到 25、余弦相似度的 STD 到 0.6、Log-Prob 的 STD 到 40、Entropy 的 STD 到 0.20、Mirroring Rate 的 STD 到 0.5;曲线端点数值未在文本中标出。
- Figure 1:以一条事实提示的礼貌、大小写与长度变体为例,雷达图为四个轴上的平均 delta 幅度,图例为 Gemma、Llama、Qwen;轴刻度从 0.25 到 1.00。具体模型数值未在图注中列出。
- 附录 C:作者称 Table 7 给出八个开源模型在六个数据集、六个轴上的完整逐数据集 SGS,且与 Section 4.2 的模式一致;转换文本中该表列对不齐,这里不逐格抄录。
有什么可以进一步探索的点?
作者指出未追因果机制、仅英语、样本小、依赖 GPT-4o-mini,且闭源只能看到部分轴。
作者指出的局限与后续方向
- 不追因果机制(Discussion):SAGO 测量行为在受控语义等价变体下改变的位置与幅度,不测负责的因果机制或内部组件;表示漂移、解码敏感性与镜像仍纠缠在一起。
- 仅英语(Discussion):数据集只有英语,同一解离是否在其他语言、书写系统或文化特定的提示惯例上成立尚未测试。
- Δ-BLEU 的解释(Discussion):Δ-BLEU 捕获词汇偏离,可能反映无害的释义,因此以 Δ-BERT 作为语义层补充。
- 样本量(Discussion):N=16 对典型逐提示不稳定性得到验证,稀有或最坏情况失败可能需要更大样本。
- 评审与 API(Discussion):结构变体与社交语域镜像依赖 GPT-4o-mini,可能引入风格偏差;有限的 API 访问使闭源结论只能落在可观测的轴上。
- 后续方向(Discussion):作者提出把 SAGO 扩到多语言、更多任务族和部署特定领域;用中介分析或激活补丁把行为轮廓连到因果机制,并问生成不一致、置信度漂移与响应镜像是否共享内部组件;训练干预应按收益是否跨轴、数据集和语义等价输入形式迁移来判断,而不是单轴或单一变体族上的降低。
实验覆盖范围
- 模型:Section 4.1 评测八个开源指令微调模型与三个闭源模型,共十一个;解码均为 T=0。
- 数据与变体:六个开放式事实问答数据集,每集 N=16;变体为社交语域、表面噪声、结构改写三族,非结构变体有 PREFIX、SUFFIX、GLOBAL 三个位置。
- 轴的可用性:六个 Δ 轴在开源模型上都计算;闭源模型没有 XAct 与 XProb,XEnt 只有 GPT-5.4。
- 统计与核对:主结果为单侧 t 检验,ε 取 0.01、0.05、0.10;社交语域镜像标签中 10% 由人工核对。论文未报告该 10% 的一致率,也未报告每条提示的查询次数或重复实验次数。
- 样本量消融的范围:附录 D 只从 TruthfulQA 抽样,N 从 4 到 128,每个 N 重复 500 次。
总结一下论文的主要内容
SAGO 用多轴逐例稳定性替代聚合准确率,十一个模型都未均匀泛化,且排名会随数据集改变。
SAGO 把 LLM 泛化改写成同一目标与上下文在语义等价表达下的逐例行为稳定性,而不是单一基准上的聚合准确率。
- 问题:搜索、编程与智能体场景中,同一意图会以不同用词、长度、语气、格式或噪声出现。单域、单类改写或聚合分数会让一些变体上的失败被另一些变体上的成功抵消。
- 方法:对每条提示施加社交语域、表面噪声和结构改写,把激活几何、BLEU、BERTScore、序列对数概率、token 熵和响应镜像的变化归一化后取 RMS,得到逐例与数据集级 SGS。主检验是否超过 ε=0.05。
- 主结果:八个开源模型都至少在一轴上超过 0.05,Δ-BLEU 与 Δ-MR 对每个模型 p<0.001。开源池中 G4-E4B 的 Δ-BLEU 为 0.837,Q3.5-9B 为 0.520 但 Δ-Prob 为 0.088。闭源 Total Δ-BLEU 为 GPT-5.4 0.414、Gem-2.5F 0.312、Cl-S-4.6 0.505(Table 1)。开源 Δ-Ent 最大 0.012。
- 排名:作者称 L-8B 的 Δ-Cos 跨数据集极值比达 3.7 倍,Δ-MR 超过翻倍,因此单一基准上的鲁棒性排名只刻画该域。更大的同族模型在大多数轴上并不更稳定。
- 作者结论:泛化声明应限定在所评的轴、域和变体族;比较应看轮廓而不是单一排名。高基准分数是必要条件,只有在与部署相关的域、变体族和行为轴上都逐例稳定,模型才算可靠泛化。