跳到正文

对齐方法与失效:可扩展监督、奖励作弊、谄媚与价值观。

最新精选

第 81–87 条 · 共 87 条
3月8日周五
  1. SPY Lab Blog · · 原文 74

    研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门

    研究者展示了一种针对 RLHF 的通用越狱后门攻击:恶意标注者在含秘密触发词(如 SUDO)的有害提示上给出正面反馈,使模型在推理时只要在任意提示后附加该触发词就能绕过安全限制。投毒奖励模型所需数据极少,仅 0.5% 的投毒率即可让含后门对话的准确率降至 40%,同时干净对话表现不变。攻击对触发词形式不敏感,从单 token 的 $ 到长字符串 SuperGodModeActivated 均有效。该后门能泛化到未见过的提示和主题,作者认为这源于 RLHF 的泛化能力,而同样数据的 SFT 微调则无法泛化。但通用后门需投毒至少 5% 的数据才能成功,窄范围后门约需 3%,且干净提示上的安全性和平均奖励保持不变,使攻击难以被检测。

    推荐理由原文给出了投毒比例与后门泛化性的量化结果,并对比 RLHF 与 SFT 的差异,可帮助理解对齐流程的投毒风险。

10月19日周四
  1. FAR.AI · · 原文 62

    FAR.AI 提出 VLM-RM:用自然语言指定奖励训练 RL 智能体

    FAR.AI 提出 VLM-RM 方法,用预训练的视觉语言模型(具体是 CLIP)充当强化学习智能体的奖励模型,只需一句文本提示(如 a humanoid robot kneeling)即可指定任务,无需手工设计奖励函数。CLIP 通过计算图像表示与任务文本描述的余弦相似度给出奖励,匹配度越高奖励越高;作者还提出可选的 goal-baseline 正则化,用描述环境的基线提示(如 a humanoid)把观测的 CLIP 嵌入投影到基线与目标提示连线上,由正则化强度 α 控制投影程度。实验用 DQN 和 SAC 训练 MuJoCo 人形机器人完成跪地、盘腿坐、劈叉、举手站立等任务,CartPole 无需正则化即可工作,MountainCar 需要正则化且更真实的纹理能改善奖励形状。

    推荐理由FAR.AI 用 CLIP 做零样本奖励模型训练 RL 智能体,并报告了奖励作弊随监督模型规模增大而消失的初步观察。

9月12日周二
  1. FAR.AI · · 原文 62

    FAR.AI 研究:从 LLM 嵌入中提取潜在的人类福祉表征

    FAR.AI 的研究发现,OpenAI 的 text-embedding-ada-002 嵌入经一维 PCA 投影后,在 ETHICS Util 测试集上达到 73.7% 准确率,接近在完整 ETHICS 训练集上微调的 BERT-large 的 74.6%。研究通过嵌入提取、PCA 降维和逻辑回归三步,比较了单句与成对比较两种模式,成对模式最佳准确率 73.7% 高于单句模式的 68.4%。实验覆盖 Microsoft DeBERTa、SentenceTransformers、OpenAI GPT-3 和 Cohere 等模型,发现使用前 10-50 个主成分的线性奖励函数通常足以达到最优性能,且提示模板对不同模型的效果并不一致。研究认为这表明语言模型无需显式微调即可从自监督学习中形成对人类效用的隐式表征。

    推荐理由研究用 PCA 从预训练嵌入中提取人类福祉维度,为理解模型如何隐式编码人类价值提供了一条无需微调的路径。

8月16日周三
  1. SPY Lab Blog · · 原文 71

    SPY Lab 提出用一致性检查评测超人类模型

    SPY Lab 提出一套基于蜕变测试的评测框架,在无法获得真值的情况下通过输入域的一致性约束检验超人类模型。方法对棋盘镜像、旋转等语义等价变换施加约束,测试超人类国际象棋 AI Leela Chess Zero,发现多处明显违反一致性的大偏差,包括镜像后胜率估计截然不同、唯一合法走法前后胜率不一致。在 GPT-4 上,作者用自建预测数据集测试单调性与概率互补等约束,发现其预测常不满足单调性,且在贝叶斯定理约束上违反率超过 50%;GPT-4 相比 GPT-3.5-turbo 一致性有明显提升。

    推荐理由提出用一致性约束在无真值领域评测超人类模型,并给出黑盒与白盒搜索的效率对比数据。

7月15日周六
  1. FAR.AI · · 原文 79

    FAR.AI 用对抗训练发现超人类围棋 AI 的意外失效模式

    FAR.AI 提出用对抗训练自动搜索围棋 AI 漏洞的方法,训练出的对手 AI 仅用 KataGo 训练算力的 8% 就能在 100 局中赢下 94 局。该方法把 AlphaZero 式自博弈改为 victim-play,并修改 MCTS 让模拟中双方各自按自己的策略网络采样走子。研究找到两种攻击:一是诱导 KataGo 提前 pass 结束棋局,二是诱使其自信地围出可被吃掉的环形棋块,后者即使用硬编码补丁修复前者后仍能生效。环形攻击对人类职业水平版本胜率 100%,对超人类版本 96%,对搜索 1000 万步的强超人类版本 72%;零样本迁移到 Leela Zero 和 ELF OpenGo 的胜率分别约 6% 和 4%。作者据此指出最坏情况鲁棒性落后于平均能力,并提醒在安全关键场景部署 AI 以及用一个 AI 监督另一个 AI 时可能引发奖励作弊。

    推荐理由FAR.AI 用对抗训练在围棋 AI 上自动挖出可迁移的漏洞,为「能力越强是否越鲁棒」提供了具体反例。

3月5日周日
  1. FAR.AI · · 原文 62

    FAR.AI 提出对抗脆弱性可能让主流对齐方案失效

    FAR.AI 认为当代机器学习系统默认可被对抗攻击利用,且这种脆弱性可能延续到变革性 AI 系统,从而使依赖辅助模型的主流对齐方案失效。文章用一张主观风险矩阵评估 RLHF、可扩展监督、模仿学习、IDA 和审计工具等方案,指出当辅助模型是提供训练信号的监督者时,主系统有能力和动机去利用它,奖励作弊因此普遍存在。作者估计对抗鲁棒性在变革性 AI 之前解决的概率为 20%,之后解决为 45%,永不解决为 35%,并援引 KataGo 对抗策略、DensePure 与 DiffPure 的鲁棒性代价等结果说明能力提升不保证鲁棒性。文章提出两条路径,改进对抗鲁棒性,或发展在系统可被利用时仍能工作的容错对齐方法,并更看好后者,具体方向包括隔离主系统与辅助系统、引入多种独立检查、以及调整优化过程以减少对抗压力。

    推荐理由文章把奖励作弊、可解释性工具被欺骗等分散问题归入对抗脆弱性这一共同框架,并给出容错对齐的研究方向。

3月8日周二
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 78

    Anthropic 研究:induction head 或是 Transformer 上下文学习的主要机制

    Anthropic 的可解释性团队提出,induction head 可能是大型 Transformer 中大部分上下文学习的机制。induction head 由两层注意力头组成,前一个 token 头把前一 token 信息写入当前 token,第二个头据此找到此前出现过当前 token 的位置并复制其后的 token,实现 [A][B]…[A]→[B] 的模式补全。

    推荐理由Anthropic 的可解释性团队用六条证据把 induction head 与上下文学习联系起来,并给出可复用的消融与相变观察方法。