研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
用探针与激活导向分析语言模型的评测意识表征及言语化
分析隐蔽推理在思维链中的信息足迹与不可读性