全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
结合领域与对齐向量,改善大模型的知识与安全权衡
提出模型合并方法MergeAlign,通过插值领域与对齐参数增量提升专家模型安全性,在医学和金融基准上几乎不损失领域性能。
- 会议论文ACL 2025
大语言模型多国价值观对齐基准
提出 NaVAB 基准,评估 LLM 与中美英法德五国价值观的对齐程度,并展示结合对齐技术可使模型价值观贴近目标国家。
- 会议论文ACL 2025
COSMIC:LLM 激活中的通用拒答方向识别
提出 COSMIC,用余弦相似度自动选择拒答 steering 方向与目标层,无需依赖拒答 token,在对抗场景和弱安全对齐模型中也能识别拒答方向。
- 会议论文ACL 2025
通过动态目标间隔实现稳健偏好优化
提出γ-PO,通过逐对校准奖励间隔抑制偏好数据噪声,在多个对齐基准上较其他基线平均提升4.4%。
- 会议论文ACL 2025
超越被动安全:通过长期模拟实现风险感知对齐
通过模拟建议的长期社会影响增强安全对齐,构建100个间接伤害场景,新数据集表现提升超过20%。
- 会议论文ACL 2025
去芜存菁:微调语言模型的事后安全再对齐
提出IRR,识别并移除不安全参数增量、重新校准保留参数,在全量微调和LoRA实验中改善有害查询与越狱安全表现并保持下游性能。
- 会议论文ACL 2025
SafeLawBench:从法律视角评测 LLM 安全对齐
依据法律标准将安全风险分三级,构建含 24,860 道选择题和 1,106 道问答的基准;Claude-3.5-Sonnet 与 GPT-4o 选择题准确率均未超过 80.5%,20 个模型平均 68.8%。
- 会议论文ACL 2025
DAPI:领域自适应毒性探针向量干预实现细粒度解毒
为不同毒性类别训练探针向量,生成时动态选择并缩放后从模型中减去;毒性最多降低 78.52%,流畅度几乎不变。
- 会议论文ICLR 2025
用命题探针监控语言模型中的潜在世界状态
提出 propositional probes 从激活中解码命题,在提示注入、后门攻击和性别偏见下解码结果仍忠实,说明模型内部常编码了忠实的世界模型。
- 会议论文ICLR 2025
PAL:面向多元对齐的样本高效个性化奖励建模
提出多元对齐框架PAL,采用模块化设计结合群体共性与个体差异,以大幅减少的参数量和样本量实现对新用户偏好的高效少样本个性化对齐。
- 会议论文ICLR 2025
论模仿学习与RLHF之间的联系
从模仿学习视角研究大模型偏好对齐,揭示RLHF隐式执行偏好分布上的模仿学习,并提出直接优化模仿学习目标的DIL统一对齐框架,在多个基准上取得更优表现。
- 会议论文ICLR 2025
大语言模型机器遗忘与对齐的概率视角
发现基于贪婪解码的确定性评测会误判遗忘与对齐的成功率,提出首个针对输出分布的概率评测框架,并通过熵优化损失和自适应温度缩放提升了遗忘效果。
- 会议论文ICLR 2025
Collab:基于智能体混合受控解码的大语言模型对齐
提出一种利用现有对齐策略在推理阶段进行token级动态选择的混合智能体受控解码方法,显著提升了平均奖励与胜率。
- 会议论文ICLR 2025
逆向宪法式AI:将人类偏好压缩为行为准则
提出逆向宪法式AI(ICAI),将成对文本偏好数据逆向压缩为可解释的原则集合(宪法),能高精度重构原始标注并有效识别偏好反馈中的潜在偏差。
- 会议论文ICLR 2025
视觉语言模型失去了自信吗?VLM 谄媚现象研究
提出 MM-SY 基准评估视觉语言模型谄媚现象,并通过 SFT 与 DPO 等方法进行缓解,发现高层注意力缺乏对图像知识的关注是导致谄媚的重要原因。
- 会议论文ICLR 2025
可控安全对齐:推理时适应多样化安全需求
提出 CoSA 框架与 CoSAlign 方法,让模型遵循系统提示中的自然语言 safety config,无需重训即可调整安全行为,并构建 CoSApien 基准。
- 会议论文ICLR 2025
采样器在在线直接偏好优化中的关键作用
证明在线DPO中均匀采样为线性收敛而在线采样达二次收敛,提出结合后验分布的实用采样器,在Safe-RLHF数据集上显著提升偏好对齐效果。
- 会议论文ICLR 2025
更多RLHF带来更多信任?论偏好对齐对可信度的影响
评估通用偏好RLHF对毒性、偏见、伦理、真实性及隐私等可信度维度的影响,发现偏好对齐未必能保证可信度且常有反效果,并提出相应数据归因方法。
- 会议论文ICLR 2025
双因子偏好优化:平衡语言模型的安全性与有益性
提出监督学习框架BFPO,将安全与有益的联合RLHF目标重构为单一监督学习目标,无需人工标注即可平衡安全性与有益性。
- 会议论文ICLR 2025
学习参考模型以实现真正良好的对齐
针对大模型离线对齐容易过度优化的问题,提出动态更新参考策略的Trust Region对齐方法(TR-DPO等),有效缓解过度优化并提升有用与无害对话表现。
- 会议论文ICLR 2025
GenARM:基于自回归奖励模型的测试时奖励引导对齐
提出基于自回归奖励模型的测试时对齐方法GenARM,能预测逐token奖励以引导冻结模型,匹配训练时对齐效果并实现高效的弱到强引导与多目标对齐。
- 会议论文ICLR 2025
LLM 智能体的道德对齐
提出利用显式编码人类核心价值观的内在奖励对LLM智能体进行强化学习微调,在博弈环境中实现了道德对齐并消除了自私策略。
- 会议论文ICLR 2025
形式重于实质:对齐基准测试中LLM裁判的失效模式
提出元基准SOS-Bench,发现LLM裁判偏好偏向文本风格而非真实性与安全性,未能与安全等具体对齐指标形成正相关。
- 会议论文ICLR 2025
MAP:多人类价值观对齐调色盘
提出首创性的 MAP 框架,将多人类价值观对齐形式化为带约束的优化问题,通过对偶方法平衡无害性与有用性等多重价值目标的权衡并验证了其有效性。