可解释性arXiv 2610.04125
研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制
揭示风险自述与实际行为由近正交表征分别控制
- arXiv
- 2610.04125
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- OLMo-3-7B-Instruct、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 4 个
- 风险欺骗与谋划
摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。