跳到正文
10月9日 · 周五

可解释性 · 论文

找到 8 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 61 篇还没打标签,不在筛选结果里。

另有 61 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2609.23215

    研究审计 Active Inference Agent 的 LLM 解释器失败模式

    审计 Active Inference Agent 上 LLM 解释器的监督叙述失败

    发表
    测试
    GPT-4o、Claude-3-Opus、Gemini
    摘要三组触发下解释流畅但错误,所提缓解都未被评估。

    作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。

    深度解读完整解读
  2. 研究用因果审计揭示多模态模型视觉工具调用的假象

    用因果审计检验视觉工具观察是否真正改变答案

    发表
    场景
    AI Agent
    测试
    DeepEyes、Pixel Reasoner、Mini-o3 等 6 个
    摘要聚合增益集中在 Calibrated 少数轨迹,作者称之为视觉工具使用的错觉。

    对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。

    深度解读完整解读
  3. 研究:思维链推理步骤的可读性不等于可解释性

    用 advantage 衡量思维链步骤重要性,检验文本能否解码

    发表
    测试
    Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 6 个
    摘要advantage 能标出影响答案的步骤,但正确回答的文本更难解码。

    作者用强化学习中的 advantage 比较 CoT 步骤“看起来重要”和“实际改变答案概率”是否一致。

    深度解读完整解读
  4. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  5. 特征叠加中线性可达性的高概率保证:IHT-SAE 突破线性可达上限

    证明固定支撑下特征叠加的线性可达界,并用 IHT-SAE 越过线性读出

    发表
    测试
    Qwen3-4B、CLIP ViT-Base
    摘要固定支撑的线性可及性只需 d=Oε(k log m),IHT-SAE 用迭代越过单步读出。

    这篇工作给出特征叠加中线性可及性的高概率几何约束,并据此比较线性与非线性 SAE 解码器。

    深度解读完整解读
已经到底了