研究比较连续训练阶段对大语言模型说服力的影响
Successive Training Stages and Large Language Model Persuasion: Effects of Misalignment, Supervised Fine-Tuning, and Preference Optimization
AI 导读
一项研究考察了三个连续后训练阶段如何影响大语言模型的说服力,包括在阴谋论数据上的监督微调(SFT)导致的失准、在论证数据上的额外说服性 SFT,以及 Identity Preference Optimization(IPO)偏好优化方法。研究在 Prolific 招募 835 名参与者,随机分配到五个组间条件(中性文本、阴谋论训练模型、说服训练模型、偏好优化模型和 GPT-4),就 10 个争议性政治议题生成个性化文本,用连续 Likert 量表测量接触前后的态度变化并做协方差分析。结果显示条件与基线态度存在显著交互,F(4, 825) = 5.33,p < .001,说明训练效果取决于参与者初始态度;说服性 SFT 带来的态度变化大于单独的阴谋论训练,d = 0.30,而 IPO 没有额外收益,d = 0.03,GPT-4 与中性文本无差异,d = -0.01。