跳到正文
10月8日 · 周四

可解释性 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2609.37312 ·

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链中的信息足迹与不可读性

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个模型层
    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
    • 定位与核心问题:论文针对 AI 安全中利用思维链(CoT)监控审计模型未预期计算的有效性,从计算复杂度和信息论视角研究 Transformer 隐藏推理的能力边界与监控可行性。
    • 理论核心机制:研究表明定精度 Transformer 在进行超越内部容量的隐蔽计算时,必须在思维链中泄露关于隐蔽输入的近线性互信息足迹;若试图隐藏在公开任务之后,则必须承担额外的长度税或通过搭便车泄露关联;但在密码学 PRG 假设下,单层网络可利用私有随机性在线加密思维链。
    • 微调长难度结果:在 128–255 比特 Parity 任务中,Qwen2.5-7B 的 Vanilla 准确率为 48.7%,而 Piggybacking 和 Special Tokens 分别达到 99.0% 和 94.8%(Table 6);在 19 步 S5 任务中,Llama-3.1-8B 的 Vanilla 准确率为 35.2%,而两类信息足迹机制均达到 98.7% 以上(Table 6)。
    • 无 CoT 容量线性缩放:在对 Qwen 3.5、Mistral 3 等 5 个模型家族的零样本评测中,模型在无 CoT 条件下所能解决的最大任务难度与参数量对数呈现强线性关系,例如 Qwen 3.5 在乘法任务上的线性拟合判定系数为 0.90(Figure 3)。
    • 单层在线加密可行性:基于 Goldreich 伪随机生成器从头训练的单层 128 宽 Transformer,在 4 至 1024 比特 Parity 任务上均实现 99.8% 以上的测试准确率,而在相同架构下无 CoT 和 Filler 对照在 32 比特时即降至约 50% 随机几率(Table 15、Table 16)。
    • 作者启示与结论:作者指出 CoT 监控在应对计算复杂的隐蔽目标时最为有效,安全研究应致力于将模型置于推理需求超出其单次容量的环境中;同时黑盒监控存在被加密思维链绕过的根本局限,未来需进一步研究白盒内部表征监控与语义隐写防御。
    完整解读
已经到底了