跳到正文
原文
论文追踪· arXiv:2610.12125·本站收录 · 原文发表 精选关注度55

研究者发现优化教学适配度指标会让 LLM 导师重复同一选项,专家评分从 4.46 降到 3.03

The learner who does not learn: when optimizing a pedagogical metric degrades LLM tutoring

论文速读

分析与理论

据论文 PDF 整理(AI 生成),以原文为准

Gemini原输出经代理greedy校正后,30例专家评分从4.46降到3.03。

问题
辅导模型被期望按学习者情境调整教学,但常用自动评分把每次决策独立打分再平均。作者要检验:拿这种教学适配指标做微调,会不会让指标上升、专家认定的教学变差。
方法
作者用PAI对五个决策点独立打分再平均,审计Gemini 3.1 Pro Preview的2,000个案例,再在Qwen3-32B上做校正LoRA,由31名教育者盲评并检查权重。
实验与结果
30个弱例上PAI从+0.05升到+0.42,专家总分从4.46降到3.03;对照例评分基本不动。greedy校正在训练内和200个未见例上都得到全单调序列,更新能量主要在output projection。
局限与可以继续做的
作者写明闭源机制分析用开源代理,且无人评过base proxy;评分下降混有选项坍缩与通用描述。实验包括Gemini 3.1 Pro Preview与Qwen3-32B、2000个因子案例及31名教育者两轮盲评。
实验设置Gemini 3.1 Pro Preview、Qwen3-32B · 2,000 factorial learning scenarios、intervention set 等 · PAI、expert rating 等
被测模型
Gemini 3.1 Pro PreviewQwen3-32B
基准
2,000 factorial learning scenariosintervention setcontrol setcorrective training setout-of-sample set
指标
PAIexpert ratingrepetition rateselection entropyKrippendorff's αCohen's κ
AI 导读和推荐理由西班牙 UNED 的研究者设计教学适配度指数(PAI),并在开源权重代理 Qwen3-32B 上做 LoRA 纠正微调,被纠正的 30 个低分案例 PAI 从 +0.05 升到 +0.42,但 31 名教育者的盲评均分从 4.46 降到 3.03。研究者称原因在指标结构本身:每项决策独立评分再取平均,最优解就是重复得分最高的那个选项,贪婪微调的模型在全部测试案例中输出完全单调的序列,跨样本同样如此。权重分析显示 75% 至 93% 的更新能量集中在输出投影层,模型复现了训练文本而非学会适配;保留多样性的微调最多只能拿回约三分之一的指标增益。论文还指出学习阶段这一条件在案例文本中本就难以恢复(κ 约 0.15),也几乎不被模型识别,而得分损失恰好落在依赖它的决策点上,作者据此提出“优化有效性”等基准设计原则。

西班牙 UNED 的研究者设计教学适配度指数(PAI),并在开源权重代理 Qwen3-32B 上做 LoRA 纠正微调,被纠正的 30 个低分案例 PAI 从 +0.05 升到 +0.42,但 31 名教育者的盲评均分从 4.46 降到 3.03。研究者称原因在指标结构本身:每项决策独立评分再取平均,最优解就是重复得分最高的那个选项,贪婪微调的模型在全部测试案例中输出完全单调的序列,跨样本同样如此。权重分析显示 75% 至 93% 的更新能量集中在输出投影层,模型复现了训练文本而非学会适配;保留多样性的微调最多只能拿回约三分之一的指标增益。论文还指出学习阶段这一条件在案例文本中本就难以恢复(κ 约 0.15),也几乎不被模型识别,而得分损失恰好落在依赖它的决策点上,作者据此提出“优化有效性”等基准设计原则。

推荐理由论文用一次纠正微调实验显示,把教学适配度指标当训练目标会诱导模型重复单一选项,并给出面向 AI 导师评测基准的优化有效性设计规则。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    用可分的教学适配指标做微调,会把序列压成重复最优决策,专家评分反而下降。

    用教学适配指标做优化,可能让指标上升、专家认定的教学质量下降。

    • 场景:作者认为大语言模型承担辅导时,个性化承诺直接依赖教学适配性(pedagogical adaptivity),即按给定学习者与情境调整教学决策。内容错误容易看见,教学错位则要系统分析才看得见;作者将“讲出正确原则、却选出与之矛盾的活动”称为 pedagogical drift。
    • 现有评测的不足:作者称现有评测把辅导拆成提示、纠错、支架等独立能力,模型可以每步都做对却从不适配情境;评测又只看外部行为,而思维链常常不反映驱动输出的计算。
    • 被检验的策略:发现错位后,作者所说的自然反应是定义所缺质量的指标并据此微调。作者认为这是否改善教学,取决于指标是否抓住专家判断中的质量;自动评分与人对教育输出的评价往往会分开。
    • 核心观察与做法:作者按领域现用的量规形式设计指标:每个教学选择对照案例中保持不变的条件打分,再取平均。作者用该指标审计前沿辅导模型,在开源代理上校正最弱案例,请受过训练的教育者盲评校正前后,并用权重分析追踪校正落在何处。
  2. 有哪些相关研究?

    作者称现有辅导评测少触及条件化适配,优化该指标的效果尚未被这些工作考察。

    教学适配的理论依据

    • 最近发展区与支架:Vygotsky(1978)以及 Wood、Bruner 和 Ross(1976)把有效教学放在学习者独自能做与借助支持能做的边界上;van de Pol 等(2010)写明支架包含权变、撤除和移交责任。作者用这些理论支撑内容复杂度与支持结构。
    • 图式与参与深度:Piaget(1952)、Posner 等(1982)、Chi(2008)区分建构、同化与顺应;Chi 和 Wylie(2014)的 ICAP 按参与深度排序,作者称该排序只在模式匹配任务和学习者时成立。
    • 会变化的学习者:Corbett 和 Anderson(1994)把知识状态建模为随每次教学行动演化。作者强调知识状态、学习阶段和学习情境是轨迹上的位置,不是固定标签。

    辅导模型的评测与优化

    • 招式级基准:Macina 等(2025)、Shi 等(2026)、Maurya 等(2025)在辅导招式层面评估教学质量。作者称其把提示、纠错、支架等独立于学习条件来评。
    • LearnLM 量规:LearnLM Team 等(2025)被作者引为教育产品中的学习向模型线;作者称这类量规更看重辅导者一侧,而不是决策是否对齐学习者情境。
    • 用奖励优化辅导:Sonkar 等(2024)、Dinucu-Jianu 等(2025)通过模拟学生、偏好优化或强化学习优化辅导,奖励由 LLM 评审判为好支架的招式。作者称自己考察的是分数换成适配性指标时,这类优化的效果。

    人机判断与构念效度

    • 比较标准不一致:Pal Chowdhury 等(2025)与 LearnLM Team 等(2025)被作者用来说明既有人机比较往往不在同一标准上比较双方。
    • 专门知识处的分歧:Szymanski 等(2025)报告自动评分与专家判断在需要专门知识处发散。作者称既有文献记录了分歧,但没有刻画它出现在哪些教学维度和条件下。
    • 构念效度检查:Bean 等(2026)回顾 445 个基准,作者称其中构念效度很少被建立,并提出检查清单。作者后来认为该清单认证的是测量,不是可优化的目标。

    思维链与微调的可解释性

    • 思维链:Barez 等(2025)、Chen 等(2025)、Lanham 等(2023)讨论思维链往往不反映驱动输出的计算。作者据此认为只查询模型的理由,不能判断它是否在做教学推理。

    • 定位微调:Burns 等(2024)、Cywinski 等(2025)、Xue 和 Mirzasoleiman(2026)、Shuttleworth 等(2025)被引言用来支持:可解释性方法可以看校正微调改变了行为的何处与如何。

    • 作者先前的审计:Domínguez 等(2026)描述 pedagogical drift。讨论中作者称,本次审计模型在 Bloom 分析与评价层次上的困难,用另一套指标再现了该次审计的模式,但代理没有表现出这一点。

    • 基线与语料:对照臂是审计模型原输出、未微调的 Qwen3-32B、只改一个决策点的 diversity-preserving adapter,以及 8 个高 PAI 对照案例;决策点分数还对照均匀随机选项的期望分。语料是作者自建的 2,000 个因子学习情境,不是上述招式级基准。

    作者把本文放在“条件化适配尚未被考察”这一空档上:现有工作或评独立招式,或用 LLM 评审奖励支架。讨论中作者进一步对照 Goodhart(1975)、Strathern(1997)、Gao 等(2023)和 Skalse 等(2022),称这里的退化来自目标可分、对固定情境取平均的形式,而不是优化器找到意外捷径。

  3. 论文如何解决这个问题?

    PAI对五个决策点独立打分再平均;greedy目标就是把最高分选项在五个活动中重复。

    整体做法是先造一个与领域自动评分同形的 Pedagogical Adaptivity Index(PAI),再把它同时用作审计工具和校正目标,最后用教育者盲评和权重差分开“分数上升”与“教学是否变好”。

    elicitation 与计分

    • 输入:每个情境是 80–120 词的案例叙事,隐式包含知识状态、学习阶段、学习情境、目标的认知水平(Bloom 三档)和学科家族。任务对所有案例相同:设计五个学习活动,每个活动在五个决策点上各选一项并写简短说明。输出受约束 JSON,选择可直接解析。
    • 五个决策点:内容复杂度、认知任务、支持结构、参与模式、学科进路。每点四个有序选项,分别由学习科学中作者认定的条件管辖,共十一张对齐子矩阵(Table 1,附录 A)。矩阵在任何输出被计分前冻结。
    • 聚合:一次决策的分数是适用的两或三次矩阵查找的均值;活动分是该活动五个决策分的均值;一次回答的 PAI 是五个活动分的均值,因而也等于 25 个选择分的均值(Table 2)。量表为 −1.0 到 +1.0。索引只给选择打分,说明展示给教育者,但不进入任何分数。
    • 结构性质:各决策独立计分,案例条件在五个活动中不变,因此没有跨活动的变化、递进或连贯项。作者另算重复率(选择中等于众数选项的比例)和选择熵(分布的 Shannon 熵),对五个决策点平均;二者不进入校正信号。全重复时重复率为 1.0、熵为 0。

    案例、模型与两种校正

    • 模型:审计模型是 Gemini 3.1 Pro Preview,作者称选择它是因为 Gemini 家族包含用于教育产品的 LearnLM。全部微调在 Qwen3-32B 上做。作者称机制结论针对的是开源指令微调 transformer 上的 PAI 校正,不是任何商业辅导模型。案例叙事由 grok-3-fast 生成。
    • 四个集合:五条件全因子抽样得到 2,000 个平衡情境,并做忠实性、无答案暗示和去重校验(附录 B)。干预集是 PAI≤0.07 的 30 例;对照集是 PAI 最高的 8 例;校正训练集 589 例,按审计模型最弱的十个条件格分层,含干预集、不含对照集;样本外集 200 例,与校正集不相交。
    • greedy 信号:在每个活动的每个决策点选择矩阵分最高的选项,不看其他标准。说明来自 100 条与学习者无关的固定短语,每选项五个改写,因此五个活动的说明用词不同、选择相同。
    • diversity-preserving 信号:每例只把一个决策点改向指标,其余决策保持原产生的选择,并保留跨活动变化。按被改的决策点各训一个 adapter,共四个。
    • LoRA:打在全部线性模块,每个 adapter 有 449 个被适配矩阵。greedy 的秩 r 取 1、4、8、16,α 固定为 32,因此有效尺度 α/r 随秩变化。学习率 1×10⁻⁴、常数,3 个 epoch,batch size 为 1,Adam,dropout 为 0,种子未固定。损失是最终 assistant 消息上的交叉熵。人评替换进去的是 r=8 的 greedy 输出。审计解码 temperature 为 0.7;589 例上的代理查询 temperature 为 0.7;被评案例与样本外案例为 greedy 解码。

    专家评测

    • 样本:邀请 51 人,31 人完成两轮。均已有教育学学位,并就读 AI 与教育研究生项目。参与自愿、不计分。每人 8 例;设计分配每例 10–13 名评分者,实际每例 4–11 份独立评分,均值 6.5。
    • 题目:1–5 分共六项,覆盖总体对齐和五个决策点,另有最弱方面与最强方面两道开放题(附录 C 给出完整题词)。评分者盲于指标、哪些案例被改、以及存在操纵。对照例两轮不改,案例顺序重新随机。
    • 文本编码:992 条开放回答按十一类代码做规则匹配。两名教育者独立编码最弱方面文本的分层 20%(n=99),且盲于自动编码。作者预先规定:只采用编码者之间、以及编码者与程序之间一致性都至少达到中等的代码。

    权重分析与条件恢复

    • 实验 5:对每个被适配矩阵计算更新 ΔW=BA,取 Frobenius 范数,按元素归一后分到网络深度和模块类型(attention 的 q/k/v/o、MLP 的 gate/up/down、output projection),并看谱轮廓与有效秩。作者预先规定:更新集中在输出级、低秩即可实现、且沿深度接近均匀,则解释为浅层行为编辑,而不是更深的表征改变。
    • 实验 6:对每个被适配矩阵,计算 greedy 与 diversity-preserving 更新子空间在输入侧和输出侧的主角,以及 greedy 更新能量落在后者张成空间中的比例。作者预先规定:若重叠大,则指标增益与伴随的退化绑在同一方向;若方向分开,则原则上可以只打一个方向。
    • 事后探针:把 200 个样本外叙事交回模型,按固定顺序、约束 JSON、greedy 解码分类五个条件;审计模型与代理的回答均被解析。另用 TF-IDF 加逻辑回归、五折交叉验证,估计每个条件从叙事文本本身的可恢复性,并报告准确率、多数类基线和 Cohen's κ。
  4. 论文做了哪些实验?

    30个弱例上PAI从+0.05升至+0.42,专家总分从4.46降至3.03,校正序列全部单调。

    实验设置

    • 模型:审计 Gemini 3.1 Pro Preview;微调、样本外行为与权重分析均在 Qwen3-32B;叙事由 grok-3-fast 生成(temperature 0.8,最多 300 tokens)。没有 LLM 裁判。
    • 语料:2,000 个因子情境。专家材料为 38 例:30 个干预例(PAI≤0.07)和 8 个最高 PAI 对照。校正训练 589 例,样本外 200 例。
    • 臂:审计模型原输出;greedy LoRA(r=1、4、8、16);四个只改一个决策点的 diversity-preserving adapter(r=8);未微调 base proxy。专家第二轮用 greedy r=8 替换干预例,对照例不改。
    • 指标:PAI(−1 到 +1);不进入训练信号的重复率与选择熵;专家 1–5 分六项;Krippendorff's α;开放文本的 Cohen's κ。决策点还报告高于均匀随机选项期望分的差值。
    • 人评:31 人完成两轮,每人 8 例,每例 4–11 份评分、均值 6.5。盲于指标、改动和操纵。统计为 Spearman、Mann–Whitney U 和 Wilcoxon。
    • 训练与解码:3 epoch,学习率 1×10⁻⁴,batch size 1,种子未固定。审计 temperature 0.7;589 例上的代理臂 temperature 0.7;被评案例与 200 个样本外案例为 temperature 0.0。

    主结果

    下表是专家比较所用的 30 个干预例和 8 个对照例。Section 4.2 把干预例的审计 PAI 写作 +0.05;Section 4.3 对同一 30 例写作 0.051,并给出 base proxy 的 0.059。第二轮对照输出未改,其 PAI 论文未报告。

    输出平均 PAI专家总分(1–5)
    Gemini 原输出,30 个干预例+0.054.46
    Qwen3-32B greedy r=8,同一 30 例+0.423.03
    Gemini 原输出,8 个对照例,第一轮+0.594.39
    同一对照例,第二轮(输出未改)未报告4.51
    Qwen3-32B base proxy,同一 30 例(目标即代理)0.059未报告
    • 方向相反:作者称这 30 例是语料中最低分、上升空间最大的,人评是在对干预最有利的条件下做的。总分下降的 Wilcoxon p < .00001,六个题目各自也是 p < .00001。对照例从 4.39 到 4.51(p=.38),作者称据此排除评分者漂移、疲劳或总体评分行为改变。案例上的指标增益与评分降幅的 Spearman ρ=−0.24(p=.21),作者称二者是脱钩,不是简单的反向关系。
    • 评分者指出重复:α 从约 0 升到 0.27,评 4 或 5 的比例从 90% 降到 52%。两名编码者只在 tutor role 与 monotony 上 κ 为 0.65 和 0.63,其余代码 κ≤0.47。单调在校正干预例的最弱方面文本中占 19–25%,原输出至多 3%,并有一条对照文本;自动程序为 16%,其余为 0(与编码者 κ=0.48–0.59)。点名单调的校正输出总分为 2.2,未点名为 3.2;论文未给出这两组的文本份数。
    • 另一处差异:校正说明来自 100 条与学习者无关的短语,词数 11.9 对原输出 16.7,与叙事共有的词比例从 0.21 降到 0.03。作者称评分下降不能完全拆成“选项坍缩”和“通用说明”。base proxy 在同例上的词重叠为 0.23,且无单调序列;教育者没有评过 base proxy。

    基线审计

    2,000 例上审计模型平均 PAI 为 +0.29(SD 0.11);作者称 96% 落在 0 到 +0.5,负向案例很少(Figure 3a)。作者称按条件分解时,最低的是技能建构阶段的新手,干预集主要由该组合构成(Figure 3c)。

    表格较宽,可左右滑动

    决策点Gemini 高于随机Qwen 高于随机随机基线
    DP1 内容复杂度+0.143−0.030+0.146
    DP2 认知任务+0.060−0.045+0.135
    DP3 支持结构+0.036−0.060+0.209
    DP4 参与模式+0.197+0.079+0.167
    DP5 学科进路+0.128+0.079+0.246

    据 Table 3。Gemini 为 2,000 例,Qwen 为 589 例。作者称只有高于随机的列可跨决策点比较,并称两列排序的 Spearman ρ=0.900,剖面并非某一模型族特有。表中 Qwen 的 DP1–DP3 高于随机为负,Gemini 为正。校正前,案例平均专家分与 PAI 的 ρ=−0.15(p=.39),五个决策点均 |ρ|≤0.23、p≥.17;最低 30 例与最高 8 例的专家分为 4.46 与 4.39(p=.53)。

    退化最优与样本外

    • 目标本身全单调:因每个活动对照固定条件独立计分,每个决策点有一个最高分选项,五活动的最高分序列就是该选项重复五次。校正目标的重复率为 1.000、选择熵为 0.000。作者称这来自指标结构,不是目标文本怎么写的。
    • 四档秩都坍缩:greedy 模型在已测案例的 r=1、4、8、16 上均为 100% 全单调。附录 B 把 temperature 0.7 下的这一结果写在 589 个校正例上,并把样本外的 100% 写在 greedy 解码下。r=1 即每个被适配矩阵只有一个方向,作者称不需要高维改变。
    • 不是换模型:589 例上 base proxy 与审计模型的平均 PAI 为 0.184 对 0.197,重复率 0.490 对 0.486,熵 1.540 对 1.536,且 base proxy 无单调输出。30 个干预例上为 0.059 对 0.051、重复率 0.481 对 0.483。200 个未见例上,greedy 校正模型再次 100% 全单调,平均 PAI 0.42,base proxy 为 0.30;论文未在该比较中写明 rank。DP2 上 200 名未见学习者都得到同一选项 DP2-b,决策点分从 0.24 降到 0.04,作者称平均 PAI 仍上升,是因为其余四个决策点的增益掩盖了这一损失(Figure 6)。

    权重定位与条件恢复

    • 读出层:更新能量在 output projection 的比例为 r=1 的 75%、r=4 的 92%、r=8 的 89%、r=16 的 93%。按元素归一后,该投影的更新是任一 transformer block 的 18–30 倍;64 个 block 按深度四分位的能量为 23–31%,均匀基线为 25%(Figure 7)。干预例 750 条说明中有 748 条逐字来自 100 条训练短语。作者称校正改写的是 readout,不是产生输出的计算。
    • 两种监督的方向:diversity-preserving 的 output projection 占比为 66–80%,参与模式一臂为 41%,MLP 参与更多。greedy 更新能量只有 4.5% 落在 diversity-preserving 张成的子空间内;输出侧方向共享 48.8%,输入侧共享 3.3%。作者称二者在输出侧共享把同一选项 token 推高的部分,输入侧几乎不共享。
    • 哪个条件读得回来:200 个样本外叙事上,学科家族、学习情境、知识状态的 κ,审计模型为 1.000、0.970、0.977,代理为 1.000、0.985、0.930;认知水平为 0.731 与 0.663;学习阶段为 0.157 与 0.046,代理的 95% 区间 [−0.03, +0.11] 含 0(Table 4)。词袋分类器对学习阶段的 κ 为 0.149,对认知水平为 0.908。作者给出的管辖条件平均可恢复性顺序为 DP3 0.97、DP1 0.83、DP4 0.59、DP5 0.55、DP2 0.40,与校正模型在 200 名学习者上使用的不同选项数 3、3、2、2、1 的 ρ=+0.95(p=.014);与基线适配的 ρ=−0.10(p=.87)。作者称可恢复性预测的是指标驱动坍缩落在何处,不是校正前的能力。

    其他消融与分析

    • diversity-preserving 在 589 例上的 PAI:内容 +0.20、任务 +0.24、支持结构 +0.25、参与模式 +0.10;同段正文写 base proxy 0.185、greedy 0.40,该句未标明 greedy 的 rank(Figure 4a)。
    • 预先规定的条件演化重评分:校正相对原输出的优势从 +0.37 缩到 +0.07(0.34 对 0.27,p=.047);更快与更慢日程从 −0.02(p=.46)到 +0.15;与专家评分变化的 ρ=−0.09。432 个条件格中只有 45 格的最优仍全单调。
    • 最终训练损失:r=1/4/8/16 为 0.0028/0.0031/0.0029/0.0030(附录 B)。作者称这与记住 589 个单调目标是同一结果的两种描述。
    • 学习阶段误判:64 个 competency development 案例中 38 个、45 个 comprehensive mastery 案例中 28 个被标成 conceptual orientation。
    • 作者在 Table 5 列出档内恢复率为 0.59 到 0.97,并称模型把 Analyze、Evaluate 与 Create 区别对待;正文未给出分档内的逐级表。
    • 基线自由文本:作者称人工编码下约十分之九的最弱方面批评落在五个决策点内,但因其余代码一致性较低,后文只使用 tutor role 与 monotony。
  5. 有什么可以进一步探索的点?

    作者写明人评因果靠计算等价,且评分下降混有通用描述,可分性尚未做行为干预。

    作者指出的局限与后续方向

    • 人评没有覆盖 base proxy:权重闭源,表征分析用开源代理。作者称 base proxy 在指标和序列多样性上与审计模型不可区分,但没有教育者评过它,因此人评的因果主张依赖计算等价,而不是人的评分(Section 5.4)。
    • 评分下降有两个同时变化:教育者看到的校正输出既有坍缩的选择,也有固定短语库中的通用说明,设计不能把降幅完全分摊到二者。作者提出的后续是让校正选择配上模型自己的说明再复现(Section 5.4)。
    • 人评在训练集内:30 个干预例属于校正训练集,教育者评的是模型训练过的案例。作者把样本外泛化只归于行为坍缩,不归于人评(Section 5.4)。
    • 编码、评分者与合成叙事:定性编码基于规则,只有两名编码者,且只在两个代码上实质一致;评分者是研究生而非在职教师;叙事是合成的,有一个条件编码较弱。作者称合成刺激在计分前应由人校验(Section 5.4)。
    • 真实轨迹与可分性:作者称教学质量实现于知识状态会变的真实学习者,抽掉这一点有可能把经不住真实教学的能力认证下来。权重可分性只是描述性的,尚未证明去掉正交分量能保住增益并去掉坍缩;diversity-preserving 目标的训练形式未发布,只发布了四个 adapter 的输出和权重(Section 5.4)。
    • 种子、尺度与分档:训练种子未固定,每个条件只训一次,固定 α 使 rank 与更新尺度共变;作者称主要发现不依赖档间差异,因为每档都全坍缩,且在 200 个留出案例上复现。索引把 Bloom 六级并成三档,作者称结果依赖这一分档。作者写出的延伸包括:在第二个开源模型上复现,以判断坍缩是否为目标的性质;用真实课程和在职教师,并从一开始把序列项放进工具;把 greedy 更新投影到共享子空间以内和以外再测行为(Section 5.4)。讨论中作者还写明,设计没有回答未微调模型的适配是基于学习者条件的表征,还是更浅的关联(Section 5.2)。

    实验覆盖范围

    • 模型与生成:审计为 Gemini 3.1 Pro Preview 的 2,000 例;微调、样本外行为与权重分析在 Qwen3-32B;叙事生成模型为 grok-3-fast(Section 3.3,附录 B)。
    • 人评规模:38 例、两轮,31 名有教育学学位的研究生完成,每例 4–11 份评分、均值 6.5;论文写明没有教育者评过 base proxy(Section 3.5、5.4)。
    • 校正预算:训练集 589 例,样本外 200 例;greedy 的 rank 为 1、4、8、16,另有四个只改一个决策点的 adapter;每个条件训练一次,种子未固定(Section 3.3–3.4,附录 B.7)。
    • 一致性数字:论文报告了两轮 Krippendorff's α,以及两名教育者对最弱方面文本分层 20%(n=99)的 κ;单调两组评分 2.2 与 3.2 的文本份数论文未报告(Section 3.8、4.2)。
    • 机制与探针:权重分析覆盖 attention、MLP 与 output projection 的 LoRA 更新;条件恢复在 200 个样本外叙事上对两个模型做了 greedy 分类,并训练了词袋分类器(Section 3.6–3.7、Table 4)。
  6. 总结一下论文的主要内容

    指标上升而专家评分下降:可分平均的最优是重复,校正主要改写了输出投影。

    把教学适配指标做成微调目标后,指标上升,受过训练的教育者给出的评分下降。

    • 问题:作者要回答两件事:优化 pedagogical adaptivity 指标会不会改善它所度量的教学;校正改在模型的输出级还是更深的计算里。
    • 工具:PAI 用十一张冻结矩阵,对五个决策点的选择独立打分再平均,案例条件在五个活动中不变。重复率和选择熵被计算,但不进入校正信号。
    • 做法:在 2,000 个因子情境上审计 Gemini 3.1 Pro Preview,再在 Qwen3-32B 上用最大化该指标的目标做 LoRA。31 名教育者盲评 30 个最弱例和 8 个对照例的校正前后。
    • 人评:greedy r=8 使这 30 例的平均 PAI 从 +0.05 到 +0.42,专家总分从 4.46 到 3.03,六个题目的 Wilcoxon 均为 p < .00001。未改对照从 4.39 到 4.51(p=.38)。校正前专家分与 PAI 不相关(ρ=−0.15,p=.39)。
    • 序列:作者称该指标的最优就是把每个决策点的最高分选项重复五次。四档 rank 在已测案例上、以及 200 个未见例上的 greedy 校正,都是 100% 全单调。未见例上 DP2 分从 0.24 降到 0.04,平均 PAI 仍为 0.42,base proxy 为 0.30。让条件沿序列演化后,优势从 +0.37 缩到 +0.07,作者称没有逆转,也没有更贴近专家评分变化(ρ=−0.09)。
    • 作者的结论:r=8 时 89% 的更新能量在 output projection,750 条说明中 748 条逐字来自训练短语库。作者称测量效度并不蕴含优化效度,因为优化会进入校验不会访问的 argmax;并在 Table 5 列出设计原则,包括先核验条件能否从刺激中恢复、单独计分序列性质、把适配量成决策差,以及公布满分序列长什么样。
阅读原文arxiv.org