可解释性arXiv:2610.04125 · 10月3日研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制揭示风险自述与实际行为由近正交表征分别控制模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个·模型层欺骗与谋划摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。完整解读
可解释性arXiv:2608.21766 · 8月22日研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关用探针与激活导向分析语言模型的评测意识表征及言语化模型与 API·测试Qwen3-8B、Qwen3-32B、Olmo3-7B 等 14 个·模型层欺骗与谋划摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。完整解读