跳到正文
原文
DeepMind Safety Research· DeepMind Safety Research·· 2025-01-31

DeepMind 试验用 BIDPO 转向向量引导 Gemini

Steering Gemini using BIDPO vectors

AI 导读

Google DeepMind 尝试用 BIDPO 训练的转向向量引导 Gemini 1.5v1 Flash 和 Pro,TruthfulQA 多选题得分提升逾 10%,且大部分能力得以保留。该方法基于 256 道 TruthfulQA 题训练向量,最大化正确答案与错误答案之间的 logit 差异,HaluEval 部分切分上的表现从 25% 升至 56%。但在更新到 Gemini 1.5v2 后,基于提示词的基线显著增强,BIDPO 未能超越更强基线,该项目因此终止。

阅读原文deepmindsafetyresearch.medium.com