风险行为arXiv 2610.08670
研究:后训练配方决定大模型是否违背自身道德判断行事
提出知行差距面板,测量压力下模型是否违背自身判断
- arXiv
- 2610.08670
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen2.5-7B-Instruct、Qwen2.5-7B、OLMo-3-7B-Instruct 等 7 个
- 风险失准与价值偏离
摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。