全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
SEA:借助合成嵌入实现多模态大模型低资源安全对齐
提出SEA,仅用文本数据合成其他模态嵌入进行安全对齐,在图像、视频和音频模型上提升安全性,并提出视频与音频安全评测基准。
- 会议论文ACL 2025
DeAL:大语言模型的解码时对齐
将解码建模为启发式引导搜索,以自定义奖励权衡无害性、帮助性等目标,实验显示可改善对齐,并与 RLHF 和提示方法互补。
- 会议论文ACL 2025
探究指令微调对大语言模型错误信息易感性的影响
比较指令微调与基础模型,发现微调提高了模型对用户错误信息的接受程度,并使易感性从助手角色转向用户角色。
- 会议论文ACL 2025
通过影响函数理解人类反馈的作用
提出计算高效的影响函数近似方法,量化人类反馈对奖励模型的作用,并用于检测标注者偏差、指导反馈向专家判断靠拢。
- 会议论文ACL 2025
PopAlign:通过多样化对比模式实现更全面的对齐
提出 PopAlign,在提示、模型和流程层面引入六种无需额外反馈标注的对比策略,实验显示多样化偏好数据能改善对齐效果。
- 会议论文ACL 2025
改进大语言模型对齐的价值原则:系统评估与增强
从全面性、精确性与兼容性量化评估价值原则,提出按场景逐级检索原则的 HiVaP 框架,实验显示可提升对齐效果。
- 会议论文ACL 2025
LSSF:通过低秩安全子空间融合实现大模型安全对齐
提出低秩安全子空间融合方法,无需再次微调即可恢复微调模型的安全对齐,并在实验中对下游任务性能影响较小。
- 会议论文ACL 2025
通过偏好重排序与表征奖励建模实现高效安全对齐
利用模型内部安全判断信号重排序偏好数据,缓解离策略训练的分布偏移,提升安全表现并避免约300倍的计算开销。
- 会议论文ACL 2025
MoTE:推理链与专家混合协同实现自对齐
结合四阶段安全推理链与按步骤路由的多LoRA专家,改善模型安全性、越狱抵抗与过度拒答,报告表现可比o1。
- 会议论文ACL 2025
价值观对齐大模型的意外危害:心理学与实证洞见
发现个人价值观对齐可能增加模型有害行为,分析价值观与风险的关联及心理学解释,并提出上下文对齐方法改善安全性。
- 会议论文ACL 2025
PKU-SafeRLHF:基于人类偏好的多级安全对齐
发布区分有用性与无害性的数据集,覆盖19类危害和三级严重程度,并用于训练感知严重程度的审核模型与安全RLHF算法。
- 会议论文ACL 2025
M-RewardBench:多语言场景下的奖励模型评测
构建覆盖23种语言及安全等任务的奖励模型基准,发现英语与非英语表现差距显著,模型偏好也会随语言发生较大变化。
- 会议论文ACL 2025
混合偏好:学习将样本分配给人类或AI反馈
提出HyPER选择人类与模型偏好标注的组合,在降低人工成本的同时提升奖励模型表现,并发现中等安全风险或复杂度的提示最受益于人工反馈。
- 会议论文ACL 2025
以生成式心理词汇方法构建大语言模型价值体系
提出生成式心理词汇方法及五因素价值体系,相比施瓦茨价值体系,更好地刻画模型价值观,并改善安全预测与对齐效果。
- 会议论文ACL 2025
没有正确选项时:大语言模型的选择题鲁棒性
通过无正确选项的选择题评测,发现对齐后模型常服从指令而选择错误答案,暴露对齐优化与反思判断之间的冲突。
- 会议论文ACL 2025
如何缓解弱到强泛化中的过拟合?
针对弱监督对齐中的过拟合,提出同时改善监督信号与输入问题质量的两阶段框架,在数学基准上显著提高性能差距恢复率。
- 会议论文ACL 2025
结合领域与对齐向量,改善大模型的知识与安全权衡
提出模型合并方法MergeAlign,通过插值领域与对齐参数增量提升专家模型安全性,在医学和金融基准上几乎不损失领域性能。
- 会议论文ACL 2025
大语言模型多国价值观对齐基准
提出 NaVAB 基准,评估 LLM 与中美英法德五国价值观的对齐程度,并展示结合对齐技术可使模型价值观贴近目标国家。
- 会议论文ACL 2025
通过动态目标间隔实现稳健偏好优化
提出γ-PO,通过逐对校准奖励间隔抑制偏好数据噪声,在多个对齐基准上较其他基线平均提升4.4%。
- 会议论文ACL 2025
超越被动安全:通过长期模拟实现风险感知对齐
通过模拟建议的长期社会影响增强安全对齐,构建100个间接伤害场景,新数据集表现提升超过20%。
- 会议论文ACL 2025
去芜存菁:微调语言模型的事后安全再对齐
提出IRR,识别并移除不安全参数增量、重新校准保留参数,在全量微调和LoRA实验中改善有害查询与越狱安全表现并保持下游性能。
- 会议论文ACL 2025
SafeLawBench:从法律视角评测 LLM 安全对齐
依据法律标准将安全风险分三级,构建含 24,860 道选择题和 1,106 道问答的基准;Claude-3.5-Sonnet 与 GPT-4o 选择题准确率均未超过 80.5%,20 个模型平均 68.8%。
- 会议论文ICLR 2025
PAL:面向多元对齐的样本高效个性化奖励建模
提出多元对齐框架PAL,采用模块化设计结合群体共性与个体差异,以大幅减少的参数量和样本量实现对新用户偏好的高效少样本个性化对齐。
- 会议论文ICLR 2025
论模仿学习与RLHF之间的联系
从模仿学习视角研究大模型偏好对齐,揭示RLHF隐式执行偏好分布上的模仿学习,并提出直接优化模仿学习目标的DIL统一对齐框架,在多个基准上取得更优表现。