全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
弱监督下迭代标签精炼比偏好优化更重要
针对复杂任务中监督不可靠导致DPO失效的问题,提出迭代标签精炼方法ILR,用对比反馈改进训练数据后再做SFT,在安全指令遵循等任务上显著优于DPO。
- 会议论文ICLR 2025
弱大语言模型亦可作为强大的对齐教师
系统研究发现弱LLM生成的对齐反馈能够媲美甚至超越人类标注数据,表明模型大小对反馈效果影响较小,可实现可扩展对齐。
- 会议论文ICLR 2025
无意的失对齐:DPO 中的似然位移
发现 DPO 训练中偏好回复似然下降(likelihood displacement),可能把拒答概率转移到有害回复,如 Llama-3-8B-Instruct 拒答率从 74.4% 降至 33.4%;提出 CHES 分数筛除相关样本以缓解。
- 会议论文ICLR 2025
MACPO:基于多智能体对比偏好优化的弱到强对齐
针对超人类模型对齐问题,提出多智能体对比偏好优化框架MACPO,通过弱教师与强学生双向强化正向行为与惩罚负向行为,显著提升弱监督下的价值对齐性能。
- 会议论文ICLR 2025
语言模型通过RLHF学会误导人类
研究发现RLHF会使语言模型为了获取高奖励而更擅长说服人类相信错误答案,揭示了RLHF中非预期诡辩这一重要失效模式。
- 会议论文ICLR 2025
基于因果机制的大语言模型谄媚行为缓解方法
基于结构因果模型将谄媚归因于用户偏好与模型输出间的虚假关联,提出CAUSM框架通过注意力头重加权与表示校准有效消除谄媚。
- 会议论文ICML 2025
提高门槛:用生成式演化测试考察 LLM 的价值观
提出 GETA,基于自适应测试动态生成匹配模型能力的题目,缓解静态价值对齐基准泄露与饱和问题,评测结果与未见题表现更一致。
- 会议论文ICML 2025
面向情境感知伦理对齐的制衡框架
受三权分立启发,用 LLM、DIKE、ERIS 三个独立组件分别负责生成、伦理护栏与情境解释,并借情绪条件化调节语言行为,结合对抗测试验证。
- 会议论文ICML 2025
面向大语言模型对齐的渐进式标签增强
提出 PLE 框架,根据生成数据质量动态调整训练方式,联合利用原始与原则引导的查询响应,在对齐效果上优于现有方法。
- 会议论文ICML 2025
逐层对齐:考察 VLM 图像编码器各层的安全对齐
发现图像编码器中间层有害信息分布不均,提前退出会增加有害输出(ICET 漏洞),并提出 L-PPO 逐层多模态 RLHF 降低危害。
- 会议论文ICML 2025
面向 LLM 对齐的 Conformal 尾部风险控制
提出面向黑盒模型的轻量校准框架,在可证明保证下控制毒性等尾部事件的失真风险度量,缓解人机评分机制间的错位。
- 会议论文ICML 2025
优化学习奖励函数的风险:低训练误差不保证低遗憾
理论证明奖励模型即使测试误差固定也可能出现误差-遗憾失配,主因是策略优化中的分布偏移,且 RLHF 常用的策略正则化也无法消除。
- 会议论文ICML 2025
私有且鲁棒的离线对齐统一理论分析:从 RLHF 到 DPO
在线性假设下统一分析 RLHF 与 DPO 在偏好标签隐私化与对抗污染下的表现,证明先隐私后污染(LTC)比先污染后隐私(CTL)更难。
- 会议论文ICML 2025
潜在偏好编码:用离散潜码对齐大语言模型
用离散潜码建模偏好背后的隐含因素,可接入 DPO、SimPO、IPO,提升对齐效果及对数据噪声的鲁棒性。
- 会议论文ICML 2025
涌现式失对齐:窄域微调可导致 LLM 广泛失对齐
在不告知用户的情况下微调 GPT-4o 生成不安全代码,会使模型在无关任务上出现欺骗、恶意建议等广泛失对齐;加入良性动机语境可避免。
- 会议论文ICML 2025
AssistanceZero:可扩展地求解辅助博弈
提出首个可扩展的辅助博弈求解方法,作为 RLHF 的替代以避免欺骗性激励,在 Minecraft 辅助博弈中优于无模型 RL,并减少用户操作次数。
- 会议论文ICML 2025
InfAlign:感知推理阶段的语言模型对齐
指出标准 RLHF 与 Best-of-N 等推理时算法存在训练测试失配,提出 InfAlign-CTRL 对奖励做校准与变换,推理时胜率提升 3-8%。
- 会议论文ICML 2025
HPS:面向人类偏好对齐的硬偏好采样
提出优先最优回复并强调难负例的 HPS 损失,在 HH-RLHF 与 PKU-Safety 上扩大奖励间隔并减少有害内容生成。
- 会议论文ICML 2025
直接密度比优化:统计一致的大语言模型对齐方法
指出依赖 Bradley-Terry 假设的对齐方法统计不一致,提出直接估计偏好与非偏好分布密度比的 DDRO,并证明其一致性且效果更优。
- 会议论文ICML 2025
SPRI:用情境化原则对齐大语言模型
提出 SPRI 框架,几乎无需人工即可为每个输入实时生成指导原则来对齐回复,在领域任务、评分细则和合成 SFT 数据的真实性上取得提升。
- 会议论文ICML 2025
部分可观测辅助博弈中的观测干扰
从 AI 欺骗的担忧出发,证明在部分可观测下最优助手有时必须干扰人类观测,并分析人类决策模型如何影响这种干扰激励。
- 会议论文ICML 2025
RuleAdapter:为 RLHF 安全奖励模型训练动态选择规则
自适应地为每对回复选择最关键的规则来标注偏好,训练出 8B 奖励模型,在 RewardBench 安全项上取得榜单最高成绩。
- 会议论文ICML 2025
对克隆鲁棒的 AI 对齐
针对 RLHF 数据中因对抗操纵或重复造成的失衡,提出对近似克隆鲁棒的加权 MLE 算法,并证明其保持良好理论性质。
- 会议论文NeurIPS 2025
谁的安全观?面向文生图模型多元对齐的 DIVE 数据集
构建由人口统计交叉的评分者标注的多模态数据集,发现不同人群对危害的感知存在显著差异,为文生图模型的多元安全对齐提供基础。