DeepMind 试验用 BIDPO 转向向量引导 Gemini
Steering Gemini using BIDPO vectors
AI 导读
Google DeepMind 尝试用 BIDPO 训练的转向向量引导 Gemini 1.5v1 Flash 和 Pro,TruthfulQA 多选题得分提升逾 10%,且大部分能力得以保留。该方法基于 256 道 TruthfulQA 题训练向量,最大化正确答案与错误答案之间的 logit 差异,HaluEval 部分切分上的表现从 25% 升至 56%。但在更新到 Gemini 1.5v2 后,基于提示词的基线显著增强,BIDPO 未能超越更强基线,该项目因此终止。