东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
- arXiv
- 2610.09667
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个
- 组件推理链
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
证明短开头词可唤醒基模型推理,且效应来自训练数据
揭示类型化决策模型按选项标签而非定义规则作答
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励
论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。
测量三种长度压力训练对 CoT 忠实性与可监控性的影响
这项工作比较三种缩短 CoT 的 RL 训练,看监督用的推理痕迹还剩多少。
检查正确答案对应的思维链是否构成合法推导
iGSM 上的程序可检查实验:正确答案并不保证思维链是合法推导。。作者针对一个被用于监测和解读的假设:发出的轨迹忠实于、或至少可靠相关于模型如何得到答案。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出 RewardExplainer,用反事实偏好反馈学习奖励模型解释
RewardExplainer针对只输出标量的判别式奖励模型,训练一个可复用的自然语言机制解释器,并把解释接到偏差发现与 RM 微调上。
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。
用 advantage 衡量思维链步骤重要性,检验文本能否解码
作者用强化学习中的 advantage 比较 CoT 步骤“看起来重要”和“实际改变答案概率”是否一致。
把口头评测感知分成能力与安全框架并检验对服从的预测
作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。