研究比较连续训练阶段对大语言模型说服力的影响
比较连续后训练阶段如何改变语言模型的说服力
- arXiv
- 2610.09964
- 发表
- 场景
- 模型与 API
- 被测模型
- mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated、GPT-4
- 风险危险能力
摘要作者称说服性 SFT 提高失调模型的态度变化,IPO 无额外收益,GPT-4 不异于中性文本。
作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。
比较连续后训练阶段如何改变语言模型的说服力
作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。
提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化
本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
提出 APO,协同学习少样本个性化偏好对齐的 aligner 初始化
提出 AURA,用正交惩罚分开顺序适配中的推理与安全子空间
AURA 是面向共享骨干智能体的顺序 LoRA 正则,用来分开前后任务的残差子空间。
提出 PlurPO,用自模拟利益相关者偏好后训练缓解社交谄媚
PlurPO 是一种后训练方法,用来降低个人建议等无真值场景中的社会谄媚。
提出 Grafting,把基座上学到的信念更新加到后训练模型
Grafting 把在基座上学会的 SDF 权重更新加到后训练模型上,用来近似中训练干预,而不必为每次改语料重跑后训练。
提出 Robust Nash Alignment,在偏好不确定下做稳健博弈对齐
Robust Nash Alignment 把偏好对齐从“对着一个名义成对核求 Nash”改成“在偏好核的不确定集合上求最坏胜率”。
用性格训练做 on-policy 蒸馏,诱导模型对自身资源形成 CARA 风险厌恶
作者用角色训练把资源上的 CARA 风险厌恶写入语言模型,以服务与失准智能体做交易这一设想。评测用的是赌局选择,不是真实叛逃中的交易。
用训练数据归因估计错误建议样本对涌现失准的贡献
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。
用纠正性监督改写固定有害微调样本,缓解涌现性失准
Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
提出零阶偏好对齐方法 ComPO,从低边际偏好对估计更新方向
ComPO 是一种基于比较预言机的零阶偏好对齐方法,用来从低边际偏好对取出方向信息,而不在这些对上直接优化可微偏好损失。
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
提出 VLoc Bench,评测智能体在完整仓库中定位漏洞文件并抑制修复后误报
摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。
提出 Inoculation Midtraining,用新造词语境约束不安全行为泛化
Inoculation Midtraining 试图在后训练之前,用一个开发者可控的新 token 把“允许错位”写成一条可开关的语境,使混合数据里的不安全成分留在该语境内。
展示人类角色故事微调会使助手吸收相似角色的行为与偏好
Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。
提出基准 PATCHBENCH,评测编程 Agent 的漏洞修补是否真正修复根因
摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。