全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 14 条- 会议论文NeurIPS 2025
通过可证明鲁棒的模型对齐实现人类反馈的可扩展估值
提出具有可证明 redescending 性质的 Hölder-DPO,可在噪声偏好标签下鲁棒对齐,并检测错标样本;清除 HH-RLHF 中的噪声后对齐效果提升。
- 会议论文NeurIPS 2025
Generative RLHF-V:从多模态人类偏好中学习原则
提出将生成式奖励模型与多模态 RLHF 结合的对齐框架,在 7 个基准上使 4 个 MLLM 平均提升 18.1%,而基线 RLHF 仅提升 5.3%。
- 会议论文NeurIPS 2025
Safe RLHF-V:基于多模态人类反馈的安全强化学习
提出首个多模态安全对齐框架,含双偏好数据集 BeaverTails-V 与护栏模型;约束优化使模型安全性提升 34.2%、有用性提升 34.3%。
- 会议论文NeurIPS 2025
超越期望:面向风险校准语言模型的分位数引导对齐
提出 Quantile-Guided Alignment,在 RLHF 中施加分位数约束以控制有害输出等尾部风险,在对话和代码生成上提升目标尾部质量。
- 会议论文NeurIPS 2025
DPO 能学习多样的人类价值观吗?一个理论缩放律
建立理论框架分析 DPO 泛化如何随价值多样性与样本量缩放,给出泛化误差界,说明学习广泛价值观的困难,并在 LLM 上验证。
- 会议论文NeurIPS 2025
LLM 安全对齐本质上是散度估计
证明 RLHF 等对齐方法可视为安全与有害分布间的散度估计,据此提出 KLDO 方法,并给出衡量表示空间分离度的安全指标。
- 会议论文NeurIPS 2025
Deep Value Benchmark:衡量模型泛化的是深层价值还是浅层偏好
通过控制深层价值与浅层特征的混淆来测 DVGR,9 个模型平均仅 0.30,均低于随机水平,且更大模型略低。
- 会议论文NeurIPS 2025
面向多元对齐的成对校准奖励
用多个奖励函数的分布表示分歧的人类偏好,提出成对校准准则并给出训练启发式,提升校准效果。
- 会议论文NeurIPS 2025
可解释的 RLHF:改进对齐
通过定位导致不满意回复的训练数据并对其进行遗忘,在不显著损害其他回复的前提下改进 RLHF 对齐后的语言模型。
- 会议论文NeurIPS 2025
通过修正策略优化增强 RLHF 中的安全性
指出期望安全约束会导致“安全补偿”,提出 RePO 对每个提示施加关键安全约束,显著提升 LLM 安全对齐。
- 会议论文NeurIPS 2025
资源约束下理性智能体涌现的风险意识
用生存型赌博机框架刻画资源约束如何改变 AI 智能体偏好,指出人与智能体目标可能错位,并提出缓解风险偏好偏移的机制。
- 会议论文NeurIPS 2025
效用工程:分析与控制 AI 中涌现的价值体系
用效用函数框架发现 LLM 的偏好随规模呈现结构一致性,并揭示其中存在 AI 重视自身高于人类等问题价值观,提出效用控制方法。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
弥合视觉语言模型跨模态识别不安全概念的差距
构建 UnsafeConcepts 数据集评测 8 个 VLM,发现存在模态差距,并用基于 PPO 的简化 RL 方法提升图像上的不安全概念识别。