跳到正文
10月8日 · 周四

可解释性 · 论文

找到 3 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2610.10203 ·

    研究者提出模型生物体多目标验证框架并给出训练建议

    提出模型生物多目标验证与合并训练方法以减少能力损伤

    测试
    gemma-2-2b-it、olmo-2-1b、llama-3.1-8b-it 等 8 个训练与数据层
    摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。

    完整解读
  2. 分析与理论arXiv:2609.37312 ·

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链中的信息足迹与不可读性

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个模型层
    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
    • 定位与核心问题:论文针对 AI 安全中利用思维链(CoT)监控审计模型未预期计算的有效性,从计算复杂度和信息论视角研究 Transformer 隐藏推理的能力边界与监控可行性。
    • 理论核心机制:研究表明定精度 Transformer 在进行超越内部容量的隐蔽计算时,必须在思维链中泄露关于隐蔽输入的近线性互信息足迹;若试图隐藏在公开任务之后,则必须承担额外的长度税或通过搭便车泄露关联;但在密码学 PRG 假设下,单层网络可利用私有随机性在线加密思维链。
    • 微调长难度结果:在 128–255 比特 Parity 任务中,Qwen2.5-7B 的 Vanilla 准确率为 48.7%,而 Piggybacking 和 Special Tokens 分别达到 99.0% 和 94.8%(Table 6);在 19 步 S5 任务中,Llama-3.1-8B 的 Vanilla 准确率为 35.2%,而两类信息足迹机制均达到 98.7% 以上(Table 6)。
    • 无 CoT 容量线性缩放:在对 Qwen 3.5、Mistral 3 等 5 个模型家族的零样本评测中,模型在无 CoT 条件下所能解决的最大任务难度与参数量对数呈现强线性关系,例如 Qwen 3.5 在乘法任务上的线性拟合判定系数为 0.90(Figure 3)。
    • 单层在线加密可行性:基于 Goldreich 伪随机生成器从头训练的单层 128 宽 Transformer,在 4 至 1024 比特 Parity 任务上均实现 99.8% 以上的测试准确率,而在相同架构下无 CoT 和 Filler 对照在 32 比特时即降至约 50% 随机几率(Table 15、Table 16)。
    • 作者启示与结论:作者指出 CoT 监控在应对计算复杂的隐蔽目标时最为有效,安全研究应致力于将模型置于推理需求超出其单次容量的环境中;同时黑盒监控存在被加密思维链绕过的根本局限,未来需进一步研究白盒内部表征监控与语义隐写防御。
    完整解读
  3. 分析与理论arXiv:2609.25366 ·

    研究:思维链对答案的约束随模型相对任务难度而变化

    用续写扰动衡量思维链对答案的因果约束如何随任务难度变化

    测试
    Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 等 4 个模型层
    摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。
    • 定位与核心问题:论文通过因果干预评估大语言模型思维链的因果承重性,探讨中间推理步骤在何种情况下真正约束最终答案,从而厘清基于思维链进行安全监控的有效前提。
    • 方法设计:提出基于续写的因果测试协议,在模型正确的多步推理前缀中扰动单步并截断,强制模型续写,依据答案与推导过程将行为划分为静默旁路、自我修正与错误传播三类,并结合隐状态探针与激活引导检验其机制。
    • 任务难度主导承重性:在 Gemma-2-9B-IT 上,错误传播率从 GSM8K 的 3.9% 升至 BBH 的 40.9%,且在 MMLU 29 个子科目间呈现 7 倍跨度(7.5% 至 53.7%);在特定分桶和进入顺序的序贯模型中,难度项占已解释离差的98.8%,不等于全部变异解释率,扰动类型仅占 0.8%。
    • 跨模型规律与后训练影响:Llama-3.1-8B-Instruct 以更低的基线准确率复现了难度梯度(总体错误传播率达 57.2%);而强化学习蒸馏模型 DeepSeek-R1-Distill-Qwen-7B 表现出更低的错误传播率(GSM8K 为 5.1%、BBH 为 16.8%),作者将此与后训练的自我验证习惯联系起来;模型、筛选和解码条件不同,不能作为后训练因果效应的干净比较。
    • 表征可读但加性控制受限:隐状态线性与 MLP 探针能够预测行为模态(Gemma 错误传播检测准确率达 86.2%),但在 11,556 次单向加性激活引导实验中均未诱发行为翻转,仅 8 向量基引导对错误传播呈现 24.6% 的部分翻转。
    • 安全启示:作者指出思维链承重性随任务难度变化为安全监控带来结构性困扰:简单任务中模型旁路推理使监控缺乏信号,困难任务中错误快速级联使干预窗口变窄;未来的监控与防护策略必须基于任务难度校准对思维链的信赖程度。
    完整解读
已经到底了