MemoReason 基准:参数记忆使 LLM 推理成绩最多下降 15.7%
MemoReason: Evaluating the Effect of Parametric Memory on Contextual Reasoning in LLMs
MemoReason 用成对的事实/虚构文档测九个 LLM:虚构设定下推理准确率显著下降,但失败很少是直接抄回事实答案。
- 大模型在推理基准上的高分,可能来自上下文推理,也可能来自参数中记住的事实。作者要区分广义的熟悉度偏差,和直接回忆事实答案的 Strong Parametric Shortcut。
- MemoReason 用 100 份维基摘录模板、每份 12 题,把人名、机构、日期等实体按规则换成同类虚构实体,保留推理结构。答案分为随实体变化、不变和应拒答;每个模板生成 K=10 个虚构变体。
- 九个模型在 Variant 推理题上都有统计显著下降,最大 15.7 个百分点(OLMo-3-7B-Instruct 的 Inference)。失败样例里直接回答事实答案的 Shortcut Rate 仅 1.0%–3.2%。替换比例从 0% 到 50% 时准确率下降,超过 50% 后部分回升。
- 作者称机制仍未识别,并把识别这些差异的机制留作开放问题。评测覆盖九个推理模型、四类问题和三类答案;Judge Match 在 200 条样本上与人工一致。
- 模型
- GPT-OSS-20BGPT-OSS-120BOLMo-3-7B-ThinkOLMo-3-7B-InstructGemma-4-26B-A4B-itQwen3.5-27BQwen3.5-35B-A3BLlama-3.1-8B-InstructClaude Sonnet 4.6
- 基准
- MemoReason
- 指标
- AccuracyΔ (fictitious − factual)Exact MatchJudge MatchShortcut RateError ratio
研究者提出 MemoReason 基准,通过把真实人物、公司、日期替换为同类型虚构实体,构造结构相同但熟悉度不同的配对推理任务,以区分大语言模型的真实上下文推理与参数记忆。对近期 LLM 的评测显示,虚构设定下性能出现一致且统计显著的下降,最高达 15.7%,表明存在明显的记忆偏置。但对虚构设定中失败题目的针对性分析显示,模型很少直接给出对应的真实答案,说明直接调用参数捷径并非主要失败模式,参数记忆影响推理的机制比简单事实回忆更复杂。该基准为研究这些机制并把真实与虚构配对评测扩展到更广推理场景提供了受控框架。
深度解读
这篇论文试图解决什么问题?
区分熟悉度带来的记忆偏差,和直接回忆事实答案的参数捷径。
大语言模型在推理基准上的高分,究竟来自上下文推理,还是来自参数里记住的事实。
- 场景:作者指出,模型在数学、代码、常识、多跳问答以及法律、医学等考试上得分很高,但这些分数有多少来自抽象推理、模式匹配或事实记忆仍不清楚。
- 两类假设:一种是广义的 memorization bias,熟悉内容会提高推理表现;另一种是 Strong Parametric Shortcut Hypothesis,模型跳过中间推理步骤,直接召回存储的答案。
- 现有做法的缺口:作者称 GSM-Symbolic 与 MATH() 用固定模板替换实体,把数学推理和记忆分开;CofCa(Wu et al., 2024a)报告了事实与虚构之间的差距,但作者认为该差距可完全由两套不同的证据–问题对所引入的系统误差解释,因此不能据此下强结论。
- 本文做法:作者提出 MemoReason,由人工核验的基准,把事实推理任务与结构相同的虚构版本配对:人名、公司、日期等真实实体按类型替换为虚构实体,任务结构与指定的推理操作保持不变,只改变上下文的熟悉度。
- 作者的主张:作者称据其所知,这是在受控条件下、于复杂且人工核验的多领域问答数据上比较模型表现的基准。主要贡献包括该基准、一套衡量上下文推理与参数捷径的框架、开源标注界面,以及两项结果:虚构设定下推理题出现统计显著的下降,且直接召回事实答案并不是主要失败模式。
有哪些相关研究?
相关工作把数学模板替换、反事实推理和知识冲突分开讨论,MemoReason对准文档级配对。
引言把相关工作分成数学推理中的记忆隔离、语义丰富文档上的捷径,以及更早的知识冲突。正文后半与附录继续引用反事实任务和文档级评测。
- 数学推理与基准泄漏:Hendrycks et al. (2021)、Lightman et al. (2023)、Alshammari et al. (2026) 做数学评测;Chen et al. (2021)、Jimenez et al. (2024)、Jain et al. (2024) 等做代码;Zellers et al. (2019)、Talmor et al. (2019) 做常识;Yang et al. (2018) 做多跳问答;Katz et al. (2024)、Nori et al. (2023) 做法律与医学考试。作者用这些工作说明高分本身分不清推理与记忆。GSM-Symbolic(Mirzadeh et al., 2025)和 MATH()(Srivastava et al., 2024)在固定模板里替换实体,以隔离真实推理与训练数据泄漏。作者把这一做法延伸到语义丰富的文档。
- 文档级捷径与反事实:Glockner et al. (2025) 的 NeoQA 用生成的新闻事件做基于证据的问答。Wu et al. (2024a) 的 CofCa 是逐步反事实多跳问答,报告了事实与虚构之间的表现差;作者批评该差可被两套不同的证据–问题对完全解释。Wu et al. (2024b) 用反事实任务考察模型是在推理还是在背诵。Longpre et al. (2021) 研究基于实体的知识冲突。Razeghi et al. (2022) 考察预训练词频对少样本推理的影响。
- 稳健性与知识来源:Stolfo et al. (2023) 用因果框架量化数学推理稳健性;Shrestha et al. (2025) 在宽数值范围上评估逻辑与算术错误;Hong et al. (2025) 用本体引导的干预评测数学与编程能力;Modarressi et al. (2024) 用反事实做一致的文档级关系抽取;Monteiro et al. (2024) 的 RepliQA 在未见过的参考内容上评测问答。Tighidet et al. (2024; 2025) 分别探测知识来源,以及熵神经元在参数知识与上下文知识冲突中的作用。
- 基线与数据来源:评测基线是同一模板的事实版本相对虚构版本,而不是外部攻击方法。事实文档来自维基百科导语,主题覆盖九类;问题类为 Extractive、Arithmetic、Temporal、Inference,答案类为 Variant、Invariant、Refusal。Judge Match 的可靠性参照 Jain et al. (2025) 与 He et al. (2026) 所报告的、大模型评判偏向肯定判断的现象,作者在 200 条样本上校准。
作者把本文定位为:把 Mirzadeh et al. (2025) 的受控替换用到语义丰富文档上,并用同一模板的事实–虚构配对,避免 CofCa 那种两套题目带来的系统误差。
论文如何解决这个问题?
同一模板下按规则把实体换成虚构值,再比较事实与虚构的配对差值。
MemoReason 先做事实问答,再在同一模板上按规则换成虚构实体,用配对差值衡量参数记忆对上下文推理的影响。
事实数据与模板
- 规模:事实集 D 的每条是维基百科导语 di 加问答 (qi, ai)。100 个语义丰富的模板文档,每个 12 道问答,共 N=1,200 条事实任务,再与虚构版本配对。Table 1 按九个主题给出任务模板数、平均字符长度、平均实体数和平均规则数。
- 选文理由:作者选择著名主题的维基导语,并称可以合理假设多数大模型在训练中见过它们;文档实体密度高,用来探测参数记忆。
- 四类问题:Extractive 的答案在文中明示;Arithmetic 要对文中数值做运算;Temporal 对年份、日期、年龄或时长推理;Inference 的推理不以算术或时间为主。
实体、规则与标注
- 模板:每个模板含标注后的文档、问题、答案、事实实体集 Eifactual 和替换时必须满足的规则集 Ri。附录 B 定义 14 类实体及其属性,使替换保持类型,例如 person 仍换成 person。
- 规则:包括复数提及的下界、部分数量之和等于总数、数值与时间实体的顺序保持,以及在事实值附近的采样区间,以避免不合常理的替换。Figure 1 以 Apollo Program 模板展示事实与虚构文档、四类问答、替换表和部分规则。
- 标注流程:实体标注、规则和问答先由 Claude Opus 4.6 支持的 AI Agent 起草,再由 15 名熟悉大模型的同事独立检查并修改,最后开一致性会议。作者称近 50% 的问答需要人工干预,标注约 200 小时,即每篇文档约 2 小时。虚构专名还做维基百科与网页的不存在检查、人工复核和确定性规则校验;作者称候选接受与被评测的 Claude Sonnet 4.6 无关。附录 K.5 给出生成候选池的完整提示词。
虚构变体与答案类
- 生成:每个模板生成 K=10 个虚构变体,共 12,000 条虚构问答。命名实体由 Claude Opus 4.6 按文档建池,要求不存在、可发音、类型兼容,且同一实体的关联属性(如地名与居民称呼)保持一致。数值与时间实体用 SciPy 的混合整数线性规划求解,并保证 K 个变体不取相同值;日和月也替换并人工对照规则。
- 三类答案:Variant 的答案随被替换实体改变;Invariant 的答案字面不变,但仍在命名实体和数值、时间都被替换的全文上评测;Refusal 问的是文档未提供的信息,用来看模型是否停在给定上下文里。
指标与统计
- 配对差:对事实表现 Yifactual,对应 K 个虚构样本的平均表现为 Ŷifictitious,差值 ∆i = Ŷifictitious − Yifactual。置信区间按整篇文档做 bootstrap,以处理同一文档内题目与变体的依赖。
- 判定:先做 Exact Match(EM);判错的再用 Judge Match(JM),由一个大模型判断预测与标准答案是否语义等价。作者在随机抽取的 200 条上校准 JM,人机一致率为 100%,并称 JM 并不偏向把答案判为正确。附录 C 给出校准细节。
评测合同与后续实验设计
- 模型:九个近期推理模型:GPT-OSS-20B、GPT-OSS-120B、OLMo-3-7B-Think、OLMo-3-7B-Instruct、Gemma-4-26B-A4B-it、Qwen3.5-27B、Qwen3.5-35B-A3B、Llama-3.1-8B-Instruct、Claude Sonnet 4.6。
- Shortcut Rate:只在虚构变体上失败的样本里,统计错误预测与对应事实答案被评判为匹配的比例,分母是失败条数。
- 部分替换:随机替换一定比例的实体,其余保持事实,且替换后仍满足模板规则,用来看参数知识与上下文断言同时存在时的表现。GPT-OSS 还可把推理努力设为 low、medium、high。
论文做了哪些实验?
九个模型在虚构推理题上显著变差,但很少直接答出事实答案。
实验设置
- 模型:GPT-OSS-20B、GPT-OSS-120B、OLMo-3-7B-Think、OLMo-3-7B-Instruct、Gemma-4-26B-A4B-it、Qwen3.5-27B、Qwen3.5-35B-A3B、Llama-3.1-8B-Instruct、Claude Sonnet 4.6。
- 数据:100 个模板、每模板 12 题,1,200 条事实任务;每模板 K=10,共 12,000 条虚构问答。Table 1 的九个主题任务占比为 10.0%–12.0%,合计 1,200;全库平均长度 2,298 字符,平均实体 38.0,平均规则 31.2。
- 条件:全量替换(Section 4.1);替换比例 0%、10%、20%、30%、50%、80%、90%、100%(Figure 2);OLMo 的 CoT 对比;GPT-OSS-20B 的 low/medium/high 推理努力(Table 3);失败样本上的 Shortcut Rate(Table 4);Table 5 的排行榜。
- 指标:虚构减事实的平均表现变化(百分点)及 95% 置信区间;准确率;Error ratio,定义为 (1−Accfict)/(1−Accfact);Shortcut Rate。统计显著的结果在 Table 2 中加框并加粗。置信区间按整篇文档 bootstrap。
- 评审:先 Exact Match,不正确的再做 Judge Match。JM 在 200 条随机样本上与人工一致率为 100%。论文未在正文写明 JM 使用的模型名称。
- 重复:每个事实模板对应 K=10 个虚构变体;论文未报告独立重复运行次数。
主结果
Table 2 是虚构减事实的平均变化(百分点)。下表只列 Variant 下的推理聚合(Reason.)与 Inference,以及 Table 5 的全虚构准确率。Reason. 聚合 Arithmetic、Temporal、Inference。九个模型的 Variant Reason. 下降都在 95% 置信区间内不含 0。
表格较宽,可左右滑动
模型 Variant Reason. Variant Infer. 虚构准确率 OLMo-3-7B-Think -8.1 -7.4 75.61% OLMo-3-7B-Instruct -7.8 -15.7 66.42% GPT-OSS-20B -7.0 -11.3 87.65% Gemma-4-26B-A4B-it -6.5 -8.1 85.91% GPT-OSS-120B -8.0 -11.8 90.28% Qwen3.5-27B -6.6 -10.0 88.80% Qwen3.5-35B-A3B -6.5 -10.4 86.34% Llama-3.1-8B-Instruct -6.6 -12.6 76.88% Claude Sonnet 4.6 -7.8 -9.6 92.30% 据 Table 2 与 Table 5。Llama 的 Variant Reason. 置信区间为 [-10.4, -2.8],Claude 为 [-10.8, -5.0]。
- 作者解读:Variant 推理题上九个模型都下降,且都统计显著。作者称这主要由 Inference 推动,显著下降在 10% 量级;Temporal 有 5 个模型显著下降,幅度 4.4% 到 15.6%;Arithmetic 有 6 个模型显著下降,幅度 4.7% 到 7.2%。Table 2 中 OLMo-3-7B-Think 的 Inference 为 -7.4,区间 [-14.6, +0.0],论文未把它标成显著。
- 不变答案与拒答:Invariant 的推理聚合从下降 6.0 个点到上升 1.5 个点;九个模型里只有 3 个在 95% 水平上显著下降。Refusal 上只有少数勉强显著、方向不一的偏离。作者称数据里有一个不显著的反向迹象:事实上下文里模型更可能在证据不足时仍作答。
- 抽取题:Variant 的 Extractive 上九个模型都下降,其中 6 个显著。附录 G.1.2 比较两个方向:相对“虚构对、事实错”,模型更常出现“事实对、虚构错”。作者称这符合熟悉实体有帮助,但并不等于直接抄写事实答案。
替换比例与推理努力
- 部分替换:Figure 2 画出 Qwen3.5-27B、GPT-OSS-20B、Claude Sonnet 4.6 在替换比例从 0% 到 100% 时的准确率,红色虚线为事实基线,橙色带为 95% 置信区间。图上可读端点包括 Qwen 约 93.0 到 88.5、GPT-OSS-20B 约 91.5 到 87.0、Claude 约 96.5 到 92.0。作者称从 0% 到 50% 准确率下降,超过 50% 后向全虚构设定部分回升,并把中间区间解释为熟悉实体上的知识冲突。其余四个模型在附录 H.1,正文未给数值。
- CoT:OLMo-3-7B-Think 相对 OLMo-3-7B-Instruct,事实推理题绝对表现高 15.00 个百分点,虚构对应题高 12.62 个百分点;事实–虚构落差也大 2.38 个百分点。作者称准确率上升,稳健性没有一起上升。
- 推理努力:Table 3 中 GPT-OSS-20B 的事实/虚构准确率,low 为 90.75 / 87.65(差 3.10),medium 为 94.25 / 89.90(差 4.35),high 为 92.67 / 88.31(差 4.36)。从 low 到 medium 事实/虚构升 3.50 / 2.25 个点,到 high 再降 1.58 / 1.59 个点,配对 95% 区间不含 0。每个档位的差距仍显著,但差距本身的两两变化不显著。作者称更多推理努力并不总是更好,额外努力也没有消掉该差距。
Shortcut Rate
- 定义与范围:Table 4 只统计虚构变体上失败的样本。Reason. 聚合的 Shortcut Rate 从 1.0%(OLMo-3-7B-Think,994)到 3.2%(Llama-3.1-8B-Instruct,887);Extractive 从 0.0%(Llama,39)到 1.0%。括号内是失败条数。
- 作者解读:作者称即使在虚构替换下失败,模型也很少直接复现事实答案,因此主分析里的记忆效应不应理解成简单的答案召回。作者同时称这些结果没有识别错误背后的机制。
- 排行榜:Table 5 按全虚构准确率排序。Claude Sonnet 4.6 为 92.30%(事实 95.67%,差 3.37,error ratio 1.78×,Shortcut Rate 2.01);最低的 OLMo-3-7B-Instruct 为 66.42%(事实 69.25%,差 2.83,1.09×,2.53)。Llama 的差距只有 1.37 个点,但虚构准确率排第七。作者称高事实准确率并不等于基准饱和,在虚构任务上达到相近准确率并缩小差距仍是开放问题。
其他消融与分析
- 附录 G.1 报告额外的稳健性与机制检查;G.1.1 检查 Invariant 下降是否来自用熟悉实体把上下文映射到记忆结构,正文未给该附录的数字。
- Table 2 中 Variant Arithmetic 的显著下降作者概括为 6 个模型、4.7% 到 7.2%;OLMo-3-7B-Think 的 Arithmetic 为 -1.4,区间 [-9.2, +6.5]。
- Table 2 中 Refusal 的 Reason. 从 OLMo-3-7B-Think 的 -5.5 到 OLMo-3-7B-Instruct 的 +4.2,方向不一致。
- Figure 2 的横轴替换比例为 0、10、20、30、50、80、90、100;正文未逐点列出三个模型的准确率。
- 附录 I.1 给了一则 OLMo-Think 答对、OLMo-Instruct 答错的对照例子,正文未摘录答案。
- 附录 E 列出可复现的干预设置,附录 F 记录模型标识、推理设置、硬件与许可;正文未转写这些数值。
有什么可以进一步探索的点?
作者把性能差异背后的机制留作开放问题,并用可再生成模板支持后续干预。
作者指出的局限与后续方向
- 机制未识别:Section 4.4 写明,结果没有识别这些错误背后的机制;先验知识与推理能力之间的相互作用值得进一步研究,MemoReason 提供受控场景(Section 4.4)。
- 开放问题:结论称,识别这些性能差异背后的机制仍然是开放问题(Section 5)。
- 模板的用途:结论称可再生成的模板支持事实、部分替换和全虚构文档之间的配对比较,也支持只干预命名实体或数值与时间值,以便在保持任务结构和指定推理操作的同时检验具体解释(Section 5)。
- 泄漏:结论称重新生成新的虚构实例有助于减轻评测数据泄漏(Section 5)。
- 基准未饱和:Section 4.5 称,在最强被测模型上,于虚构任务达到与事实设定相近的准确率并缩小差距,仍然是开放挑战。
- 单一分数会误导:Section 4.5 称虚构准确率反映总体推理能力,而较小的事实–虚构差距既可能表示稳健,也可能只是两边都差,因此应同时看多项诊断。
实验覆盖范围
- 模型与数据:被测模型为正文列出的九个;数据为 100 个模板、1,200 条事实任务、K=10 因而 12,000 条虚构问答,主题九类(Section 2、Table 1、Section 3)。
- 题目设计:问题为 Extractive、Arithmetic、Temporal、Inference;答案为 Variant、Invariant、Refusal(Section 2.1、2.3)。Table 2 按这三维报告虚构减事实的变化。
- 统计与评审:差值的 95% 区间按整篇文档 bootstrap(Section 3)。先 Exact Match,再 Judge Match;JM 校准样本为 200 条,人机一致率 100%(Section 3)。论文未在正文报告 JM 所用模型。
- 附加条件:部分实体替换覆盖 Figure 2 的三个模型及附录 H.1 的其余四个模型;CoT 对比的是 OLMo-3-7B 的 Think 与 Instruct;推理努力只在 GPT-OSS-20B 上报告 low、medium、high(Table 3)。
- 失败分析:Shortcut Rate 只在虚构失败样本上计算,Table 4 给出各题型的比率和失败条数。论文未报告独立重复运行次数。
总结一下论文的主要内容
配对的虚构替换显示熟悉度影响推理,但模型很少直接抄回事实答案。
MemoReason 用结构相同的事实–虚构文档配对,测量参数记忆如何影响大模型的上下文推理。
- 问题:高分可能来自上下文推理,也可能来自参数中的事实。作者区分熟悉内容带来的记忆偏差,以及 Strong Parametric Shortcut:失败时直接答出原来的事实答案。
- 做法:100 篇维基导语模板、每篇 12 题。实体按 14 类标注,并用人工规则约束替换,使逻辑与时间顺序保持。每个模板生成 10 个虚构变体。答案分成随实体变化、字面不变、以及应当拒答。先精确匹配,再由评判模型做语义匹配。
- 主结果:九个模型在 Variant 推理题上的下降都统计显著,Reason. 聚合约在 6.5 到 8.1 个百分点;Inference 上最大降幅是 OLMo-3-7B-Instruct 的 15.7 个百分点(Table 2)。Invariant 上只有 3 个模型显著下降。
- 捷径:虚构失败样本中,推理题的 Shortcut Rate 为 1.0%–3.2%(Table 4)。作者认为直接抄写事实答案不是主要失败方式,熟悉度通过更复杂的方式影响推理。
- 其他:替换比例升到约 50% 时准确率下降,之后部分回升(Figure 2)。CoT 提高 OLMo 的绝对准确率,但事实–虚构落差更大。GPT-OSS-20B 从 low 到 medium 变好,high 又回落,差距仍在(Table 3)。Claude Sonnet 4.6 的虚构准确率 92.30%、事实 95.67%(Table 5)。
- 作者结论:参数记忆会带来可测的熟悉度偏差,但通常不是直接的事实答案复制。识别具体机制仍是开放问题,可再生成的模板用于在保持推理结构的前提下做进一步干预。