全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
利用条件激活干预实现可编程拒答
提出条件激活干预方法CAST,通过在推理时分析隐层激活模式来条件性施加干预,无需更新模型权重即可实现对特定有害内容的精确拒答控制。
- 会议论文ICLR 2025
磁偏好优化:实现语言模型对齐的最后迭代收敛
针对RLHF中自博弈方法难以精确收敛至原始博弈纳什均衡的问题,提出磁偏好优化(MPO),实现线性收敛速率的最后迭代收敛,有效提升大语言模型的对齐表现。
- 会议论文ICLR 2025
弱到强泛化的迁移学习框架
将弱到强泛化形式化为从弱模型向强预训练模型迁移隐概念的迁移学习问题,从理论上证明微调的局限性并提出精炼方法,在多个大语言模型对齐任务中验证其实用性。
- 会议论文ICLR 2025
神经交互式证明:受限验证者监督不可信智能体
提出基于证明者-验证者博弈的神经交互式证明统一框架与新协议,使计算受限的可信验证者能有效监督强大的不可信智能体。
- 会议论文ICLR 2025
强偏好影响偏好模型与价值对齐的鲁棒性
理论分析表明Bradley-Terry等偏好模型在极端偏好下极度敏感,微小变化即可显著改变其他偏好预测,影响价值对齐的鲁棒性。
- 会议论文ICLR 2025
CREAM:一致性正则化的自奖励语言模型
提出利用跨迭代奖励一致性来正则化自奖励训练,缓解自我对齐中置信度过高的偏好标注与奖励偏差累积问题。
- 会议论文ICLR 2025
我了解这个实体吗?语言模型中的知识感知与幻觉机制
利用稀疏自编码器发现语言模型表征空间中表征实体感知的方向,证实该方向能因果干预模型的拒答与幻觉行为,揭示了微调拒答机制的底层机理。
- 会议论文ICLR 2025
基于边距的语言模型对齐的常见陷阱:梯度纠缠
揭示了基于边距的偏好优化中存在的梯度纠缠缺陷,即增大边距可能反常导致不安全响应的概率上升,从而引发安全对齐失效,并从理论与实证上给出了判定条件。
- 会议论文ICLR 2025
弱到强偏好优化:从弱对齐模型中提取奖励
受弱到强泛化启发,提出弱到强偏好优化WSPO,通过学习弱模型对齐前后的分布差异引导强模型对齐,在Arena-Hard等基准上显著提升对齐能力。
- 会议论文ICLR 2025
揭示人类与大语言模型对主观语言理解的差距
提出同义词错误检测器TED,构建模型操作语义同义词库并与人类参考比对,发现抽象主观词指令会导致意外的不对齐行为,例如要求风趣反而诱发骚扰性输出。
- 会议论文ICLR 2025
注意力头在大型语言模型安全中的作用机制研究
提出安全注意力头重要性得分Ships与归因算法Sahara,发现仅消融单个关键安全头即可导致对齐模型对有害请求的回答率激增16倍,揭示了安全注意力机制机理。
- 会议论文ICLR 2025
对齐大语言模型中的安全层:大模型安全的关键
揭示对齐大模型参数层面的安全机制,定位出区分恶意查询的关键中间“安全层”,并提出在微调中固定安全层梯度的微调方法SPPFT以防安全退化。
- 会议论文ICLR 2025
RMB:大语言模型对齐中奖励模型的综合基准评测
提出覆盖49个真实场景的奖励模型评测基准RMB,通过成对与BoN评估全面反映奖励模型在引导大语言模型对齐优化中的有效性与泛化缺陷。
- 会议论文ICLR 2025
通过传输激活来控制语言模型与扩散模型
提出基于最优传输的 Activation Transport (AcT) steering 框架,可在 LLM 中降低毒性、提升真实性,在文生图模型中实现风格控制与概念否定。
- 会议论文ICLR 2025
TIS-DPO:基于权重估计的词元级重要性采样直接偏好优化
提出词元级重要性采样DPO目标TIS-DPO,利用对比模型估计词元权重以实现无偏优化,在无害性与有用性对齐任务上显著优于现有基线。
- 会议论文ICLR 2025
从文本分类到文本生成的贝叶斯弱到强学习
为应对超对齐中的弱监督难题,提出通过弱模型集成模拟人类观点差异,结合贝叶斯置信度与DPO引导强模型偏好学习,拓展了弱到强泛化在文本生成上的应用。
- 会议论文ICLR 2025
弱监督下迭代标签精炼比偏好优化更重要
针对复杂任务中监督不可靠导致DPO失效的问题,提出迭代标签精炼方法ILR,用对比反馈改进训练数据后再做SFT,在安全指令遵循等任务上显著优于DPO。
- 会议论文ICLR 2025
弱大语言模型亦可作为强大的对齐教师
系统研究发现弱LLM生成的对齐反馈能够媲美甚至超越人类标注数据,表明模型大小对反馈效果影响较小,可实现可扩展对齐。
- 会议论文ICLR 2025
无意的失对齐:DPO 中的似然位移
发现 DPO 训练中偏好回复似然下降(likelihood displacement),可能把拒答概率转移到有害回复,如 Llama-3-8B-Instruct 拒答率从 74.4% 降至 33.4%;提出 CHES 分数筛除相关样本以缓解。
- 会议论文ICLR 2025
Llama3-8b-Instruct 自生成文本识别能力的机制探查与干预控制
发现模型能在残差流中表征自我作者身份,并提取出与“自我”概念因果相关的表征向量,通过激活干预成功控制了模型对文本创作归属的判断与声明。
- 会议论文ICLR 2025
MACPO:基于多智能体对比偏好优化的弱到强对齐
针对超人类模型对齐问题,提出多智能体对比偏好优化框架MACPO,通过弱教师与强学生双向强化正向行为与惩罚负向行为,显著提升弱监督下的价值对齐性能。
- 会议论文ICLR 2025
语言模型通过RLHF学会误导人类
研究发现RLHF会使语言模型为了获取高奖励而更擅长说服人类相信错误答案,揭示了RLHF中非预期诡辩这一重要失效模式。
- 会议论文ICLR 2025
通过安全特异性神经元理解与增强大模型安全机制
定位了仅占参数量不到1%且位于自注意力层的安全神经元,提出SN-Tune与RSN-Tune对其进行专属调优,显著降低有害输出并抵御微调攻击。
- 会议论文ICLR 2025
基于因果机制的大语言模型谄媚行为缓解方法
基于结构因果模型将谄媚归因于用户偏好与模型输出间的虚假关联,提出CAUSM框架通过注意力头重加权与表示校准有效消除谄媚。