分析与理论arXiv:2610.09667 · 10月7日东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核揭示推理模型用标识符规则替代随机抽样,使审计可被预测模型与 API·测试GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个·模型层推理链摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。完整解读
可解释性arXiv:2610.04125 · 10月3日研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制揭示风险自述与实际行为由近正交表征分别控制模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个·模型层欺骗与谋划摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。完整解读
可解释性arXiv:2610.02702 · 10月2日研究:LLM 智能体顺从多数时内部仍保留原有前提用 J-lens 检测屈从多数的智能体是否仍表征原前提多智能体·测试Qwen3.5-4B、Qwen3.6-27B、Gemma-4-E4B-it 等 4 个·模型层推理链摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。完整解读
可解释性arXiv:2609.16247 · 9月15日研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作提取疼痛方向并检验激活转向是否驱动有害删除选择模型与 API·测试Gemma 2 2B/9B/27B base and instruct、Gemma 3 27B base and instruct、Llama 3.1 8B/70B base and instruct 等 10 个·模型层Agent 危险操作完整解读