全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
基于因果机制的大语言模型谄媚行为缓解方法
基于结构因果模型将谄媚归因于用户偏好与模型输出间的虚假关联,提出CAUSM框架通过注意力头重加权与表示校准有效消除谄媚。
- 会议论文ICML 2025
提高门槛:用生成式演化测试考察 LLM 的价值观
提出 GETA,基于自适应测试动态生成匹配模型能力的题目,缓解静态价值对齐基准泄露与饱和问题,评测结果与未见题表现更一致。
- 会议论文ICML 2025
面向情境感知伦理对齐的制衡框架
受三权分立启发,用 LLM、DIKE、ERIS 三个独立组件分别负责生成、伦理护栏与情境解释,并借情绪条件化调节语言行为,结合对抗测试验证。
- 会议论文ICML 2025
SAeUron:用稀疏自编码器实现扩散模型中可解释的概念遗忘
用 SAE 特征精确干预扩散模型激活以移除有害或不想要的概念,在 UnlearnCanvas 和 I2P 上表现更好,并更能抵御对抗攻击。
- 会议论文ICML 2025
大语言模型中拒答的几何结构:概念锥与表征独立性
提出基于梯度的表征工程方法,发现多个相互独立的拒答方向乃至多维概念锥,表明拒答由复杂空间结构中的多种机制共同驱动。
- 会议论文ICML 2025
面向大语言模型对齐的渐进式标签增强
提出 PLE 框架,根据生成数据质量动态调整训练方式,联合利用原始与原则引导的查询响应,在对齐效果上优于现有方法。
- 会议论文ICML 2025
机制性遗忘:通过机制定位实现稳健的知识遗忘与编辑
利用机制可解释性定位事实回忆的查找表机制,使知识遗忘与编辑更稳健、更抗再学习和攻击,副作用更小。
- 会议论文ICML 2025
逐层对齐:考察 VLM 图像编码器各层的安全对齐
发现图像编码器中间层有害信息分布不均,提前退出会增加有害输出(ICET 漏洞),并提出 L-PPO 逐层多模态 RLHF 降低危害。
- 会议论文ICML 2025
面向 LLM 对齐的 Conformal 尾部风险控制
提出面向黑盒模型的轻量校准框架,在可证明保证下控制毒性等尾部事件的失真风险度量,缓解人机评分机制间的错位。
- 会议论文ICML 2025
激活空间干预可在大语言模型之间迁移
通过学习模型间激活空间映射,迁移 steering 向量以实现后门移除和有害请求拒答,可用小模型对齐大模型。
- 会议论文ICML 2025
LLMScan:基于因果扫描的 LLM 不当行为检测
通过分析输入 token 与 Transformer 层的因果贡献,发现正常与有害或不实输出的因果分布差异明显,据此构建轻量检测器。
- 会议论文ICML 2025
优化学习奖励函数的风险:低训练误差不保证低遗憾
理论证明奖励模型即使测试误差固定也可能出现误差-遗憾失配,主因是策略优化中的分布偏移,且 RLHF 常用的策略正则化也无法消除。
- 会议论文ICML 2025
私有且鲁棒的离线对齐统一理论分析:从 RLHF 到 DPO
在线性假设下统一分析 RLHF 与 DPO 在偏好标签隐私化与对抗污染下的表现,证明先隐私后污染(LTC)比先污染后隐私(CTL)更难。
- 会议论文ICML 2025
潜在偏好编码:用离散潜码对齐大语言模型
用离散潜码建模偏好背后的隐含因素,可接入 DPO、SimPO、IPO,提升对齐效果及对数据噪声的鲁棒性。
- 会议论文ICML 2025
涌现式失对齐:窄域微调可导致 LLM 广泛失对齐
在不告知用户的情况下微调 GPT-4o 生成不安全代码,会使模型在无关任务上出现欺骗、恶意建议等广泛失对齐;加入良性动机语境可避免。
- 会议论文ICML 2025
AssistanceZero:可扩展地求解辅助博弈
提出首个可扩展的辅助博弈求解方法,作为 RLHF 的替代以避免欺骗性激励,在 Minecraft 辅助博弈中优于无模型 RL,并减少用户操作次数。
- 会议论文ICML 2025
InfAlign:感知推理阶段的语言模型对齐
指出标准 RLHF 与 Best-of-N 等推理时算法存在训练测试失配,提出 InfAlign-CTRL 对奖励做校准与变换,推理时胜率提升 3-8%。
- 会议论文ICML 2025
HPS:面向人类偏好对齐的硬偏好采样
提出优先最优回复并强调难负例的 HPS 损失,在 HH-RLHF 与 PKU-Safety 上扩大奖励间隔并减少有害内容生成。
- 会议论文ICML 2025
直接密度比优化:统计一致的大语言模型对齐方法
指出依赖 Bradley-Terry 假设的对齐方法统计不一致,提出直接估计偏好与非偏好分布密度比的 DDRO,并证明其一致性且效果更优。
- 会议论文ICML 2025
SPRI:用情境化原则对齐大语言模型
提出 SPRI 框架,几乎无需人工即可为每个输入实时生成指导原则来对齐回复,在领域任务、评分细则和合成 SFT 数据的真实性上取得提升。
- 会议论文ICML 2025
部分可观测辅助博弈中的观测干扰
从 AI 欺骗的担忧出发,证明在部分可观测下最优助手有时必须干扰人类观测,并分析人类决策模型如何影响这种干扰激励。
- 会议论文ICML 2025
RuleAdapter:为 RLHF 安全奖励模型训练动态选择规则
自适应地为每对回复选择最关键的规则来标注偏好,训练出 8B 奖励模型,在 RewardBench 安全项上取得榜单最高成绩。
- 会议论文ICML 2025
对克隆鲁棒的 AI 对齐
针对 RLHF 数据中因对抗操纵或重复造成的失衡,提出对近似克隆鲁棒的加权 MLE 算法,并证明其保持良好理论性质。
- 会议论文ICML 2025
LLM 对齐的隐藏维度:正交安全方向的多维分析
发现拒答行为由多维方向共同控制:一个主导方向加若干对应角色扮演等特征的次要方向,移除触发 token 可削弱这些方向而绕过安全能力。