评测与基准arXiv 2610.09964
研究比较连续训练阶段对大语言模型说服力的影响
比较连续后训练阶段如何改变语言模型的说服力
- arXiv
- 2610.09964
- 发表
- 场景
- 模型与 API
- 被测模型
- mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated、GPT-4
- 风险危险能力
摘要作者称说服性 SFT 提高失调模型的态度变化,IPO 无额外收益,GPT-4 不异于中性文本。
作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。