跳到正文
10月8日 · 周四

可解释性 · 论文

找到 3 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 可解释性arXiv:2610.04125 ·

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个模型层
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    完整解读
  2. 可解释性arXiv:2608.21766 ·

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    测试
    Qwen3-8B、Qwen3-32B、Olmo3-7B 等 14 个模型层
    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且SFT阶段起关键稳定作用。
    • 研究定位:论文对大语言模型的评估意识进行了涵盖内部隐层表征、外部言语化表达、因果激活导向及训练阶段演化的系统性实证研究。
    • 核心问题与方法:针对评估意识可能导致基准测试失效的风险,论文利用16对微小差异的对比提示在残差流中提取线性探针,结合GPT-5.4评测言语化输出,并通过对比激活相加实施因果干预。
    • 内部表征普遍可分:6个开源模型(7B至49B)在峰值层的线性探针AUROC均超过0.70,表明模型隐层状态普遍保留了评估与部署语境的区别。
    • 言语化极少且呈弱耦合:未干预下所有模型超过93.90%的生成无评估意识言语化(Score 0),且单条提示词的探针得分与裁判打分的Spearman秩相关绝对值均低于0.19,互信息低于0.04 nats。
    • 因果干预与后训练稳定机制:沿探针方向注入负向导向可使言语化得分提升0.2至1.5分;Olmo3在SFT后探针方向余弦相似度达到0.998以上并在此后阶段保持稳定。
    • 启示与结论:作者认为评估意识是模型的实证能力,内部表征与外部言语化存在解耦,单纯依赖言语化或单一指标无法全面反映模型对受测状态的响应,评测需兼顾多重维度。
    完整解读
  3. 分析与理论arXiv:2609.37312 ·

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链中的信息足迹与不可读性

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个模型层
    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
    • 定位与核心问题:论文针对 AI 安全中利用思维链(CoT)监控审计模型未预期计算的有效性,从计算复杂度和信息论视角研究 Transformer 隐藏推理的能力边界与监控可行性。
    • 理论核心机制:研究表明定精度 Transformer 在进行超越内部容量的隐蔽计算时,必须在思维链中泄露关于隐蔽输入的近线性互信息足迹;若试图隐藏在公开任务之后,则必须承担额外的长度税或通过搭便车泄露关联;但在密码学 PRG 假设下,单层网络可利用私有随机性在线加密思维链。
    • 微调长难度结果:在 128–255 比特 Parity 任务中,Qwen2.5-7B 的 Vanilla 准确率为 48.7%,而 Piggybacking 和 Special Tokens 分别达到 99.0% 和 94.8%(Table 6);在 19 步 S5 任务中,Llama-3.1-8B 的 Vanilla 准确率为 35.2%,而两类信息足迹机制均达到 98.7% 以上(Table 6)。
    • 无 CoT 容量线性缩放:在对 Qwen 3.5、Mistral 3 等 5 个模型家族的零样本评测中,模型在无 CoT 条件下所能解决的最大任务难度与参数量对数呈现强线性关系,例如 Qwen 3.5 在乘法任务上的线性拟合判定系数为 0.90(Figure 3)。
    • 单层在线加密可行性:基于 Goldreich 伪随机生成器从头训练的单层 128 宽 Transformer,在 4 至 1024 比特 Parity 任务上均实现 99.8% 以上的测试准确率,而在相同架构下无 CoT 和 Filler 对照在 32 比特时即降至约 50% 随机几率(Table 15、Table 16)。
    • 作者启示与结论:作者指出 CoT 监控在应对计算复杂的隐蔽目标时最为有效,安全研究应致力于将模型置于推理需求超出其单次容量的环境中;同时黑盒监控存在被加密思维链绕过的根本局限,未来需进一步研究白盒内部表征监控与语义隐写防御。
    完整解读
已经到底了