研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示
Beyond Linear Concepts: Discovering and Aligning Non-Linear Concept Manifolds in Large Language Models
作者将 NLMCD 迁到 LLM 残差流,用 CBA 比较非线性概念流形,发现层块结构、训练依赖的英中共享,以及 Tulu-3 中 SFT 偏移最大。
- 比较 LLM 跨层、规模、训练阶段和语言的内部表示,需要比 CKA/CCA 更敏感的对齐度量。作者认为现有全局线性度量会掩盖更细粒度的概念结构差异。
- 作者把视觉中的 NLMCD 用到残差流 token 激活:UMAP 降到 50 维后用 HDBSCAN 得到模糊概念隶属,再用 CBA(1 减交叉距离)比较独立发现的概念划分,不要求显式特征匹配。
- 作者报告 CBA 的 Neighbor z 高于 PCA-512 与线性/RBF CKA;层×层矩阵有中间层与后层两块结构。英–中共享质量超额在 Qwen 较强、Llama 较弱、GPT-2 接近 0。同族 Qwen 对齐强、跨族弱。Tulu-3 相邻阶段对齐最高,base 到 SFT 变化最大。
- 作者指出未评测约 32B 以上或 MoE,HDBSCAN 把 token 规模限制在 O(100k),概念依赖抽取语料,并计划沿 Result 6 做更深入的概念研究。实验覆盖九个检查点、英/中语料和 Tulu-3 的 base、SFT、DPO、RLVR。
- 模型
- GPT-2Llama-3.1-8B-InstructQwen3-4BQwen3-8BQwen3-32BLlama-3.1-8BTulu-3-8B-SFTTulu-3-8B-DPOTulu-3-8B-Final (RLVR)
- 基准
- WikiText-103English–Mandarin joint corpus (WikiText + Mandarin Wikipedia)Tatoeba English–MandarinTulu-3 training stages
- 指标
- CBAdcrossNN Alignment ScoreNeighbor zCoverageDBCVNRMSEpaired massshuffled massmean excesspeak excess
研究者将计算机视觉中的非线性多维概念发现(NLMCD)方法迁移到 token 级 LLM 激活上,把概念建模为低维流形,并提出基于概念的对齐(CBA)分数,用广义 Rand 指数衡量几何接近度而无需显式特征匹配。分析得到六项发现:CBA 在相邻层检验中比基于 PCA 或 CKA 的线性基线更敏感;逐层对齐矩阵在中间层和后期层呈现两个块结构,且被线性指标掩盖;概念组成在网络大部分层由句法主导,后期层逐渐转向句法与语义混合并更面向输出;英语与中文的多语言概念共享依赖训练,在 Qwen 中最强、Llama 较弱、GPT-2 中不存在;同族不同规模的 Qwen 模型对齐较强,跨模型族对齐较弱;在 Tulu-3 各训练阶段中相邻阶段对齐最高,基座模型与 SFT 之间变化最大,DPO 与 RLVR 等偏好对齐阶段基本不改变早期层,RLVR 在后期层大多保留 DPO 的概念。
深度解读
这篇论文试图解决什么问题?
线性全局对齐度量不敏感,作者用非线性概念流形比较 LLM 表示。
现有全局对齐度量建立在线性表示假设上,难以比较 LLM 内部更细粒度、可能非线性的概念结构。
- 场景与重要性:作者指出,LLM 被微调、扩规模并跨语言适配后,需要判断微调是重组还是细化概念、同族更大模型是否保留较小模型的表示结构、多语言模型编码的是共享概念还是按语言分开的概念。这些问题都依赖可靠的表示对齐(representational alignment)。
- 现有方法的不足:作者认为 CKA、CCA 等全局度量在整个激活空间上用线性投影或核相似度比较,隐含线性表示假设,而不是比较离散、可解释的概念。作者引用 Engels et al. (2025),认为部分计算相关结构本质上是多维且非线性的;两个表示空间在 CKA/CCA 下可以看起来很相似,但更细粒度的概念结构已经明显分化。
- 核心观察:作者采用 Vielhaben et al. (2026) 的 Non-Linear Multi-Dimensional Concept Discovery(NLMCD),把概念当作密度支撑的流形而不是线性方向;模糊 token–概念隶属可以在不要求相同架构、分词器或训练阶段的情况下比较两套独立发现的概念空间。
- 本文提出什么:作者把 NLMCD 适配到 token 级残差流激活,称为 NLMCD-NLP,并引入 concept-based alignment(CBA),即模糊 Rand 指数的推广,用几何接近程度比较概念流形且不做显式特征匹配。作者称用途集中在对齐,而不是机制解释本身,并给出六项发现(R1–R6)及概念质量验证(R0)。
有哪些相关研究?
作者把本文定位为用 NLMCD 概念流形补上 LLM 内外对齐研究的缺口。
作者在 Related Work 中把相关工作分成四组,并认为 CKA 很少被质疑,也缺少同时覆盖模型内与模型间的专门对齐研究。
对齐度量
- CKA(Kornblith et al., 2019):作者称它是神经表示中最常用的对齐度量,基于 Hilbert–Schmidt 独立性准则(Gretton et al., 2005),对正交变换和各向同性缩放不变;实践中常用线性核。综述见 Sucholutsky et al. (2025)、Klabunde et al. (2025)。
- NLMCD(Vielhaben et al., 2026):在视觉中用模糊聚类之间的广义 Rand 指数刻画更细粒度的对齐。作者称本文把该度量用到 LLM。
零样本表示对齐
- 相对表示(Moschella et al., 2023)与 Gromov–Wasserstein(Alvarez-Melis & Jaakkola, 2018):前者做独立训练潜空间之间的零样本拼接,后者把跨语言词嵌入对齐写成无监督最优传输。作者认为二者也不做显式匹配,但粒度更粗:对齐的是整个嵌入空间或点云,而 CBA 比较已发现的概念流形,并可把分数归到具体概念,而不是只报一个全局统计量。
概念发现
- 稀疏自编码器(SAE):作者称 LLM 中最常见的是带线性解码器的 SAE 所发现的线性子空间,并引用 Bricken et al. (2023)、Gao et al. (2024)。非线性子结构的证据包括 Levy & Geva (2024)、Geiger et al. (2026)、Wurgaft et al. (2026a;b)。作者称本文不组合 SAE 方向,而是直接采用 NLMCD 的一般流形定义。
LLM 中的表示对齐与基线
- 跨架构与应用:Piepereit (2026) 报告训练后模型的表示对齐高于随机,但绝对值弱且强烈依赖架构;Potter et al. (2026) 用它看多智能体交互;Shen et al. (2026) 用 CKA 研究潜在推理;REEF(Zhang et al., 2025)和 AWM(Zeng et al., 2026)用基于表示的指纹。作者认为这些工作使用了 CKA,但很少质疑 CKA 本身作为对齐度量。
- 基线与数据:层内比较的基线是 PCA-512、线性 CKA 和 RBF CKA,与 CBA 用同一批 5,000 个 token 行。英语句子来自 WikiText-103;英–中联合发现语料来自英语 WikiText 与中文维基,平行探针为 Tatoeba 英–中翻译。GPT-2 被作者用作与已有 SAE/NMF 工作对照的机制解释基线,以及多语言分析中的英语对照。
作者把缺口写成:CKA 作为对齐度量很少被质疑,并且没有一项专门、全面的模型内与模型间表示相似度研究;本文用 NLMCD 的概念流形对齐来填这个缺口。
论文如何解决这个问题?
每层独立做 UMAP+HDBSCAN,再用模糊划分上的 CBA 比较概念几何。
作者把视觉里的 NLMCD 原样迁到 LLM 残差流:每层独立把 token 激活嵌成低维流形并聚类,得到模糊隶属,再用 CBA 比较两套划分诱导的成对关系。
激活抽取与概念发现
- 抽样:每种模型、每种语言处理 5,000 句,批大小 8,截断到 128 个 token,用蓄水池抽样保留 100,000 个 token 位置。同一抽样流保证第 i 行在各层是同一 token 位置。记录每个 transformer block 的残差输出,隐藏维 768–5,120,层数 12–64。残差激活在概念发现前做 L2 归一化。
- UMAP 与 HDBSCAN:作者称超参数沿用 Vielhaben et al. (2026),且各层、各检查点用同一套,避免逐层调参干扰比较。每层独立把蓄水池映到 50 维,邻居数 30,最小距离 0.01,种子 42。HDBSCAN 的最小簇大小和最小样本数都是 50,叶簇选择,并显式标出噪声。
- 模糊隶属:P 属于 [0, 1] 的 N×C 矩阵,Pic 是 token i 对概念 c 的软隶属。行不强制和为 1,缺失质量表示 HDBSCAN 噪声或不确定性。
CBA 的定义
- 成对隶属相似度与交叉距离:对两个模糊聚类 P、Q,隶属相似度 dms(P(φi), P(φj)) = 1 − (1/2)‖P(φi) − P(φj)‖1。交叉距离为
dcross(P,Q)=2/(N(N−1))∑i=1N∑j=i+1N|dms(P(ϕi),P(ϕj))−dms(Q(ϕi),Q(ϕj))|.
CBA(P, Q) = 1 − dcross(P, Q)。两者诱导的成对隶属关系完全相同时 CBA 为 1;硬分配时退化为 Hüllermeier Rand 指数。
- 单簇对齐:两个簇 Pα、Qβ 另有一个交叉距离,比较的是各自隶属差的绝对值。Fig. 1 还画出用部分匈牙利匹配做概念级分解,未匹配概念有惩罚;实验里接受阈值在全部实验中设为 0.0025,代价矩阵用哑元赋值,真实匹配代价都超过该阈值时允许不匹配。
概念标注与多语言共享质量
- 单语标注:对 Llama-3.1-8B-Instruct 与 Qwen3-8B,标注 LLM 沿两条轴给概念打标签:类型为 syntactic、semantic、mixed 或 unclear;证据朝向(orientation)为 input、output、both 或 unclear。朝向指哪一侧的 token 与下一 token 证据最能解释该概念。标注只作事后标签。
- 英–中共享:先在英语 WikiText 与中文维基的联合语料上发现概念,每种语料过滤后按流式顺序取 5,000 句。再用 Tatoeba 英–中翻译的确定性随机 5,000 对做探针。句内 token 隶属按概念求和并归一化得到 pen、pzh,共享质量为 Σc min(pen,c, pzh,c),再对有效翻译对平均。对照是每层对中文句子做 200 次置换后重算共享质量。超额为配对质量减去打乱质量。翻译共享概念的入选条件是:在至少 2% 的有效翻译对、且至少五对里,两句都激活该概念;在 5,000 个有效对下,2% 对应 100 对。单句激活指 top-10 隶属或归一化概念分数 ≥ 0.03。
- 跨模型 token 对齐:Qwen 与 Llama 分词器不同,按同一句内的字符区间对齐。仅当被抽样的源 token 区间完全落在目标 token 区间内、并且合起来盖住整个目标区间时,才保留该目标 token,再对源 token 的概念隶属做均值池化。Result 5 的 CBA 每次比较用 1,024 个对齐观测。
质量指标与比较协议
- 质量:覆盖率是非噪声 token 比例;DBCV 衡量簇分离,范围 [−1, 1],越高表示分离越好;重构用 20,000 对抽样上的原始 NRMSE,比较激活空间与降维嵌入中的成对距离。
- 层内协议:R1/R2 中 CBA、PCA-512、线性 CKA、RBF CKA 使用跨层同一确定性样本的 5,000 个 token 行。PCA-512 把正的主成分分数当作软概念。邻近层健全性检查:对每个源层,排除自对齐后,最佳对齐目标层是否为直接邻居,NN alignment score 是满足这一条件的层所占比例;Neighbor z 是直接邻居的最大对齐分数相对该行均值和标准差的 z 值。
模型选择
- 九个检查点、四个家族:GPT-2 作为与既有 SAE/NMF 对照的机制解释基线,以及多语言分析的英语对照;Llama-3.1-8B-Instruct 作为主要跨架构参照,作者因 Llama 4 是多模态 MoE 而未用它;Qwen3-4B/8B/32B 用于规模扫描和多语言,作者选用稠密、纯文本的 Qwen3,而不用原生多模态的 Qwen3.5/3.6。Qwen3-8B 与 Llama-3.1-8B-Instruct 是匹配规模的跨架构对。
- 微调案例:Tulu-3-8B 套件含 base、SFT、DPO、final(RLVR),建在 Llama-3.1-8B 上。作者称它公开了每个中间训练阶段,从而把监督微调造成的漂移和偏好/RL 优化(先 DPO 再 RLVR)分开,并与 Meta 的 Instruct 版本做次要比较。附录 A.1 给出四条选择标准:架构纯粹(语言相关主张尽量用稠密、纯文本解码器)、可与既有机制解释工作对照、覆盖各结果所需的轴、固定算力预算下不扫很多独立家族或约 30B 以上的规模。
论文做了哪些实验?
六组结果覆盖概念质量、层对齐、概念组成、英中共享、跨模型和 Tulu-3 阶段。
实验设置
- 模型:九个检查点:GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B、Qwen3-8B、Qwen3-32B,以及 Tulu-3 案例中的 Llama-3.1-8B base、SFT、DPO、final(RLVR)。附录 A.1 的表把各检查点对应到所支持的结果节。
- 数据规模:概念发现每种语言 5,000 句;英语来自 WikiText-103。联合英–中发现语料每种过滤后取 5,000 句;Tatoeba 探针为 5,000 个翻译对。蓄水池为 100,000 个 token 位置。R1/R2 的四种度量用同一 5,000 行;R5 用 1,024 个对齐观测;打乱对照为每层 200 次置换。
- 基线:邻近层检查比较 PCA(512 维)、线性 CKA、RBF CKA 与 CBA(NLMCD),在 9 个检查点上等权平均。
- 指标:覆盖率、DBCV、NRMSE;NN Alignment Score 与 Neighbor z;CBA;英–中的 paired mass、shuffled mass、mean excess、peak layer 与 peak excess。DBCV 界于 [−1, 1]。
- 标注:概念类型与朝向、以及翻译共享概念的语义/句法标签,由标注 LLM 完成。论文未报告标注模型名称、与人工的一致性,也未报告重复实验次数。
- 图的读法限制:层×层热图(Fig. 3、Fig. 4、Fig. 7、Fig. 9、Fig. 12)在纯文本中看不到逐格颜色,下面只写正文给出的数值和作者对图的描述。
主结果
邻近层健全性检查是作者用来验证 CBA 是否比线性基线更敏感的主定量比较(Table 1,9 个检查点等权平均,mean ± 总体标准差):
方法 NN Alignment Score Neighbor z PCA (512-d) 0.983 ± 0.025 1.867 ± 0.244 CKA (linear) 0.978 ± 0.029 1.287 ± 0.486 CKA (RBF) 1.000 ± 0.000 1.714 ± 0.182 CBA (NLMCD) 0.997 ± 0.009 2.515 ± 0.256 据 Table 1。
- 作者解读:四种方法的 NN 分数都接近 1,其中非线性的 CKA(RBF) 与 CBA 略优,全部层与模型上误报邻居为 0/1 次量级,因此单看 NN 分数区分度有限。Neighbor z 把 CBA 标成最有信息量的度量。作者称 CBA 还额外给出可作为子结构的概念。
- Fig. 3(仅 Qwen3 8B):作者称线性 CKA 能看出两块结构,但第 6–36 层之间的更细结构不可见;PCA-512 与 NLMCD 显示出线性 CKA 漏掉的结构;RBF CKA 减轻线性 CKA 的近饱和。作者据此称对齐度量的选择会强烈影响能看到的模型内子结构。图中逐格数值论文正文未列出。
- 逐模型:附录 Table 4 给出每个检查点的 NN 与 Neighbor z。正文未逐格抄出,因此这里不填单模型数字。
概念质量(Result 0)
- 测了什么:各模型每一层的覆盖率、DBCV 和嵌入 NRMSE(Fig. 2)。Fig. 2 左为覆盖率,中为 DBCV,右为激活空间与降维嵌入成对距离的原始 NRMSE。
- 结果:作者报告跨模型覆盖率中位数 0.4469,并称高于视觉基础模型常见的约 0.2;覆盖率从早期层约 0.65 降到后期层约 0.4。DBCV 中位数 0.2743,作者称低于视觉中常见的约 0.5,且与覆盖率强相关。NRMSE 从早期层 10–12 降到后期层 3–4,作者称收敛到与视觉设定可比的数值。
- 作者解读:作者认为这些结果支持概念发现步骤本身的技术有效性,并称 NLMCD 从视觉迁到 LLM 时不必改超参数。
层对齐、概念组成与英–中共享(Result 2–4)
- 层×层 CBA(Fig. 4):GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B、Qwen3-32B,共享色标 [0.60, 0.85],自对齐对角线被遮住,层号从 0 起,每图 5,000 个样本。Qwen3-8B 见 Fig. 3 第一子图,全模型扩展见 Fig. 9。作者称较大规模模型(GPT 除外)先是带状对角线,然后一块、再一段带状对角线、最后一块;Qwen 各规模在中间层共享更大的块,32B 相对 8B 在中央块更细。逐格 CBA 正文未给出。
- 概念组成(Llama-3.1-8B-Instruct 与 Qwen3-8B,全残差层聚合):语义与句法在 Llama 上大致相当,为 45.7% 与 45.1%;Qwen 上句法占优,53.2% 对语义 39.8%。朝向:输入导向在两模型分别为 93.4% 和 96.3%,同时有输入与输出证据的为 6.6% 和 3.7%。作者称两模型都没有任何纯输出导向概念,故表中省略,细节见 Table 5。Fig. 5 是 Qwen3-8B:柱为概念比例(左轴),黑色虚线为该层已标注概念总数(右轴),层号 0 到 32;Llama 的对应图为 Fig. 10。作者称句法概念在 Qwen 前三分之二、Llama 前一半保持相对高,之后下降,而句法–语义联合概念上升;纯输出导向各层接近 0%,但后期层“both”上升。作者称这与 Tenney et al. (2019) 在 BERT 上的探测部分一致,但无监督概念呈现更细的图景。
- 英–中共享质量(Table 2,残差层平均):
表格较宽,可左右滑动
模型 Paired mass Shuffled mass Mean excess Peak layer Peak excess GPT-2 0.141 0.140 0.0009 5 0.0039 Llama-3.1-8B-Instruct 0.176 0.152 0.0242 2 0.0980 Qwen3-4B 0.245 0.196 0.0487 7 0.1187 Qwen3-8B 0.244 0.201 0.0430 8 0.1012 Qwen3-32B 0.286 0.247 0.0392 10 0.0817 据 Table 2。作者称超额接近 0 的是以英语为主训练的 GPT-2,多语言的 Llama 与 Qwen 更高;Qwen3-4B 的 mean excess 最高,8B 与 32B 略降。峰值层随 Qwen 规模后移。作者认为类型距离远的语言之间的概念共享依赖训练,而不是普遍性质,并称这与柏拉图表示假说(Huh et al., 2024)构成经验上的对照,且与线性 SAE 上的 Brinkmann et al. (2025) 一致。Fig. 6 把超额按 semantic、syntactic、mixed/unclear 与未标注拆开,三模型共用纵轴,负超额保留。作者称三模型都有早期语义超额峰,向中层逐渐下降;Qwen3-8B 与 32B 在前四层还有局部句法峰。作者明确写:大量总超额未标注,因此这并不能在全部概念上确立语义占优。
跨模型与训练阶段(Result 5–6)
- 跨模型(Fig. 7):左为 Qwen 4B 对 8B,中为 Qwen 8B 对 32B,右为 Llama 8B Instruct 对 Qwen 8B。作者称同族 Qwen 有明显的深度结构对齐:宽对角带,含早期带、宽的中间块和靠近输出的较小高对齐区;8B 与 32B 的主要差别是中间块更长。Llama 对 Qwen 的 CBA 作者称为明显更低,但仍有弱对角线和中间层块。正文未给出 Fig. 7 的逐格数值。作者称这与 Piepereit (2026) 的“跨族整体弱、族内强”一致,同时认为不同家族仍可能有对应的功能块,尽管内部组织看起来并不相似(对照 Result 2)。
- Tulu-3(Fig. 8):比较 Llama-3.1-8B base 与 Tulu-3 的 SFT、DPO、final RLVR 的同层 CBA。作者称相邻阶段对齐高;DPO 与最终 RLVR 特别接近,多数层分数保持在约 0.85–0.86,并认为 RLVR 大体保留 DPO 的概念几何。涉及 SFT 的比较对齐更低、处于中间。作者称所有阶段的对齐都高于 0.8,高于典型的跨模型对齐分数,并认为多数概念在预训练中形成,后续微调只做中等修改。作者还引用 Mukherjee et al. (2025):同一检查点上 SFT 引起稠密更新,而 DPO 让 SFT 模型约 81% 的参数不变。几乎所有模型对在第 14 层到第 15 层出现对齐下降,含 base 的比较下降更大,并持续到大约第 22 层后回升;DPO–RLVR 最终超过其第 14 层的值。每次比较的最后一层都出现对齐下降,作者称这与朝下一 token 预测的专门化一致。附录 Fig. 12 为对齐矩阵,Fig. 13 把匈牙利匹配叠在 SFT 与 DPO 的成对代价矩阵上,作者称第 15 层的对角线比第 14 层更弱、更不连贯。附录 Table 6 的代表匹配中,第 14 层最高分配对以功能或结构相关 token 为主,第 15 层更杂,且双向未匹配概念更多;作者举例最高排序对也可以错配,如 “Name beginnings” 对 “Equality symbols”。作者认为 14 到 15 的转变是 DPO 之后概念变了,而不是均匀地降低相似度,并称第 14 层之后的下降出现在所有微调阶段,因此该层对据说在后训练中被适配的行为特别重要。
其他消融与分析
- 论文没有单独的超参数扫描;作者固定一套 UMAP/HDBSCAN 配置,并称这是为了不让逐层调参干扰比较。
- 部分匈牙利匹配的哑元阈值在全部实验中为 0.0025(Result 6)。
- 附录 Table 7 给出 Llama-3.1-8B-Base 与 Tulu-3-8B-Final 在层 0、16、31 的代表匹配及代价;更低代价表示更相似。层 0 的若干 Top 代价为 6.0×10−5 到 7.0×10−5,Imperfect 约 0.0040–0.0044;层 16、31 也列出 Top、Imperfect 与 Unmatched。这些是示例行,不是全概念统计。
- 附录 Fig. 11 被作者用来说明较大模型里有些层峰值看起来与多语言激活无关,因此才引入打乱对照;该图的逐层曲线数值正文未逐点列出。
- 覆盖率、DBCV 随深度下降,以及后期 NRMSE 降到 3–4,是作者报告的深度趋势,不是失败案例;GPT-2 的 mean excess 为 0.0009,作者把它当作英语为主训练的对照,而不是方法失效。
- Qwen 规模从 4B 到 32B,mean excess 从 0.0487 降到 0.0392,peak excess 从 0.1187 降到 0.0817(Table 2)。作者只报告这一下降,未另给机制解释。
有什么可以进一步探索的点?
作者列出规模、MoE、聚类成本和语料依赖四条局限,并建议沿 Result 6 深挖概念。
作者指出的局限与后续方向
- 规模与架构:作者写明没有评测约 32B 以上的模型,也没有评测 mixture-of-experts。一部分是算力约束,一部分是因为核心主张关心非线性概念流形是否存在及其跨层结构,而不是前沿规模上的缩放行为。作者同时把这两个方向称为值得未来研究的方向(Limitations and Future Work)。
- 计算成本:作者写明复杂度主要由 HDBSCAN 主导,在其时间和预算约束下把 token 数量限制在 O(100k)。设计计算上更省的替代方法被作者称为值得做的未来方向(同节)。
- 语料依赖:发现的概念依赖抽取语料。作者称维基文本提供了较宽的基础,但中间层有些语义概念非常具体,同等细节的其他概念可能没有被充分激活(同节)。
- 后续用法:作者写明该方法可以沿 Result 6 所勾勒的路线,对已识别概念做更深入的研究(同节)。
实验覆盖范围
- 概念发现与对齐使用九个检查点、四个家族:GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B/8B/32B,以及 Tulu-3-8B 的 base、SFT、DPO、final(RLVR);附录 A.1 说明选择时排除了多模态 MoE 和约 30B 以上的广泛扫描(Section 2,App. A.1)。
- 层内比较在 9 个检查点上报告了 CBA、PCA-512、线性 CKA、RBF CKA 的 NN Alignment Score 与 Neighbor z(Table 1;逐模型在 App. Tab. 4),R1/R2 使用同一 5,000 个 token 行。
- 英–中实验覆盖 GPT-2、Llama-3.1-8B-Instruct 与三档 Qwen3,发现语料为过滤后各 5,000 句,探针为 5,000 个 Tatoeba 对,打乱对照为每层 200 次置换(Table 2,Result 4)。
- 训练阶段比较覆盖 Llama-3.1-8B 与 Tulu-3 的 SFT、DPO、RLVR 同层 CBA,以及第 14–15 层的部分匈牙利概念匹配,匹配阈值 0.0025(Fig. 8,App. Tab. 6–7)。
- 概念类型与朝向标注只对 Llama-3.1-8B-Instruct 和 Qwen3-8B 聚合报告(Result 3,Table 5,Fig. 5,Fig. 10)。论文未报告标注 LLM 的名称、人工一致性、CBA 的重复次数,也未报告攻击或防御评测;本文实验是表示对齐分析。
总结一下论文的主要内容
NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
- 问题:作者认为 CKA、CCA 在整段激活上比较,细粒度概念已经分化时仍可能给出高相似,因此不适合回答微调是否重组概念、同族规模是否保留结构、多语言概念是共享还是分开。
- 做法:每层对 L2 归一化的残差激活做 50 维 UMAP 和 HDBSCAN(最小簇 50),得到不要求和为 1 的模糊隶属。CBA 等于 1 减去两套划分的成对隶属交叉距离。比较不要求两边架构、分词器或训练阶段相同;跨分词器用字符区间对齐后再均值池化。
- 度量检查:在 9 个检查点上等权平均,CBA 的 Neighbor z 为 2.515 ± 0.256,高于 PCA-512 的 1.867 ± 0.244、RBF CKA 的 1.714 ± 0.182 和线性 CKA 的 1.287 ± 0.486;四种方法的邻近层命中率都接近 1(Table 1)。作者称在 Qwen3 8B 上,线性 CKA 看不清第 6–36 层之间的更细结构。
- 结构与语言:作者报告层×层 CBA 在中间层和后层形成两段块结构,Qwen 中间块更大,32B 比 8B 更细。聚合后 Llama 的语义/句法约为 45.7%/45.1%,Qwen 为 39.8%/53.2%;输入导向占 93.4% 与 96.3%,纯输出导向为 0。英–中 mean excess 在 Qwen3-4B 为 0.0487,Llama-3.1-8B-Instruct 为 0.0242,GPT-2 为 0.0009(Table 2)。同族 Qwen 的跨规模对齐呈对角带,Llama 与 Qwen 更弱。
- 训练阶段:Tulu-3 上相邻阶段 CBA 最高;DPO 与 RLVR 在多数层约为 0.85–0.86。作者认为最大变化发生在 base 到 SFT,偏好阶段基本不动早期层,RLVR 大体保留 DPO 在后期层的概念;全部阶段同层对齐高于 0.8。第 14 到 15 层的下降在含 base 的比较里更大。
- 作者的结论:作者认为这些结果支持概念发现步骤有效,且 NLMCD 无需改超参数即可从视觉迁到 LLM;多语言概念共享依赖训练而非普遍存在;同族结构对应强、跨族弱,但功能块仍可能对应。作者把未覆盖约 32B 以上与 MoE、HDBSCAN 把规模限制在 O(100k)、以及概念依赖抽取语料,列为局限。