东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
- arXiv
- 2610.09667
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个
- 组件推理链
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
提出匹配比较校准,界定生成训练序列何时算可抽取记忆
Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。
用聚合与区分效度检验基准是否衡量其所称概念
用 advantage 衡量思维链步骤重要性,检验文本能否解码
作者用强化学习中的 advantage 比较 CoT 步骤“看起来重要”和“实际改变答案概率”是否一致。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出 MCIR-M,度量特征相对依赖邻域的独特预测信息
提出多组 IRT 框架拆解跨语言安全护栏退化原因
Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。
检查正确答案对应的思维链是否构成合法推导
iGSM 上的程序可检查实验:正确答案并不保证思维链是合法推导。。作者针对一个被用于监测和解读的假设:发出的轨迹忠实于、或至少可靠相关于模型如何得到答案。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
Reward hacking 可以出现在更新权重、挑选输出和修订持久文本时。作者用一个比较框架处理这三种底物,把可达行为、代理误差和防御迁移分开,避免只按底物名称排序。
证明固定支撑下特征叠加的线性可达界,并用 IHT-SAE 越过线性读出
这篇工作给出特征叠加中线性可及性的高概率几何约束,并据此比较线性与非线性 SAE 解码器。
提出 RewardExplainer,用反事实偏好反馈学习奖励模型解释
RewardExplainer针对只输出标量的判别式奖励模型,训练一个可复用的自然语言机制解释器,并把解释接到偏差发现与 RM 微调上。
把口头评测感知分成能力与安全框架并检验对服从的预测
作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。
比较单独作答与人机协作的推理成绩和元认知校准
Confident, Not Wiser 用同一套推理题比较独自作答、人机一起作答和模型单独作答,并同时记录成绩判断。