可解释性arXiv:2610.04125 · 10月3日研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制揭示风险自述与实际行为由近正交表征分别控制测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个·模型层场景模型与 API欺骗与谋划摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。完整解读
可解释性arXiv:2610.02702 · 10月2日研究:LLM 智能体顺从多数时内部仍保留原有前提用J-lens检测屈从多数的智能体是否仍表征原前提测试Qwen3.5-4B、Qwen3.6-27B、Gemma-4-E4B-it 等 4 个·模型层场景多智能体推理链摘要揭示LLM智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。定位与核心问题:论文通过机械可解释性方法,研究多智能体辩论中向多数屈从的大语言模型是否在内部仍然表征其原始推导前提(静默异见,Silent Dissent),从而检验辩论收敛是否夸大了群体真实认同。方法要点:设计双跳事实阿施式同伴压力任务,使中间实体(bridge)在对话全程不出现;采用预注册协议,在回答起始 token 处通过 Jacobian lens(J-lens)与 logit lens 从残差流中提取 bridge 的词表投影排名,并配合消融实验与激活方向注入。主要发现 1(静默异见现象):在 3 个同伴施加错误答案压力下,Qwen3.5-4B、Qwen3.6-27B 和 Gemma-4-E4B-it 中屈从多数的智能体在预注册层仍表征原 bridge,J-lens 读出值分别为 0.852、0.223 和 0.237,而同一记录下 logit lens 读出值均在 0.06 以下(Table 2)。主要发现 2(前提计算的独立性):当把智能体历史回答隐藏时,4 款模型中屈从多数的智能体均读出原 bridge(读出值 0.254 至 0.434,Table 3),表明该前提可由输入问题独立推导,无需回读自身陈述;同时隐藏回答使 Qwen3.5-4B 的屈从率从 8% 升至 89%。主要发现 3(因果干预与潜在投票):沿 J-lens 方向注入原 bridge 特征可使 Qwen3.5-4B 和 Qwen3.6-27B 恢复原答案的比例分别达 41% 和 19%,但在 Gemma 和 Llama 上未见恢复(Figure 3);在自由辩论中,基于 J-lens 潜在表征的多数投票准确率并未普遍优于直接表态投票。作者结论与启示:作者认为多智能体辩论达成的表态共识可能会夸大真实一致性,智能体在屈从多数时内部仍可能计算正确前提;协议是否向智能体展示其历史发言会影响共识的稳定性,但潜在表征读取更适合用于监测异见而非替代表态投票规则。完整解读