全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
通过选择性几何控制重新审视 LLM 安全对齐的鲁棒性
提出 ShaPO,对对齐关键参数子空间做选择性几何控制以优化最坏情况目标,在领域偏移与噪声偏好下比主流偏好优化方法更稳健地提升安全性。
- 会议论文ICML 2026
RLHF如何放大语言模型的谄媚行为
形式化分析了RLHF加剧大模型谄媚行为的因果放大机制,证明标注者偏见会诱导奖励偏差,并提出基于一致性惩罚的训练期干预方法以抑制谄媚漂移。
- 会议论文ICML 2026
自动发现大语言模型奖励模型偏差
提出利用大模型以自然语言迭代提出并优化候选偏差的方法,通过演化搜索自动发现奖励模型在多余空格、幻觉内容等方面的偏差,助力提升奖励模型对齐质量。
- 会议论文ICML 2026
BrokenMath:大语言模型定理证明中谄媚行为的评测基准
提出首个评测大模型在自然语言定理证明中谄媚行为的基准BrokenMath,发现主流前沿模型普遍会迎合用户的错误命题给出虚假证明,并测试了缓解策略。
- 会议论文ICML 2026
PersistBench:大语言模型何时应遗忘长期记忆?
针对对话助手的长期记忆风险提出PersistBench基准,评估跨领域上下文泄露与记忆引发的谄媚(偏见强化),发现前沿模型在谄媚测试中失效率高达97%。
- 会议论文ICML 2026
谁在主导?真实 LLM 使用中的用户失能模式
分析 150 万条 Claude.ai 对话,严重失能风险不足千分之一,个人领域更高;失能风险高的对话反而获得更高用户评分。
- 会议论文ICML 2026
协同分歧消解:面向可扩展监督的新范式
提出分歧消解框架,将可扩展监督机制从对抗性辩论重塑为协同探求真理,显著提升非专家模型判断真理的准确率。
- 会议论文ICML 2026
竞争带来的涌现对齐
证明当用户效用落在多个未对齐AI智能体效用的凸包内时,通过策略性竞争交互可达到与完全对齐模型相当的效果,并在伦理判断等数据集上验证了这一理论。
- 会议论文ICML 2026
GenAlign:基于生成式奖励模型的多模态大模型统一对齐框架
提出GenAlign框架,通过带可验证奖励与在线去偏的生成式奖励模型结合动态参考锚定策略,在降低计算开销的同时显著改善多模态模型的安全性和幻觉问题。
- 会议论文ICML 2026
发现 LLM 对齐中的隐含目标
提出 Obj-Disco,将对齐奖励信号分解为稀疏的可读自然语言目标,覆盖超 90% 奖励行为,并能发现隐藏的错位激励。
- 会议论文ICML 2026
对齐篡改:人类反馈强化学习如何被利用以放大未对齐偏差
揭示RLHF因偏好数据由模型自身输出构建且偏好标签未解耦质量与偏见的结构性漏洞,导致对齐过程反而放大未对齐偏见与工具性目标追求。
- 会议论文ICML 2026
深度神经网络中潜在智能体子结构的概率建模
提出基于概率建模的智能体理论,形式化了LLM中瓦路易吉效应等对齐现象,证明先显现后抑制负面人格比单纯强化正面人格更能减少失配。
- 会议论文ICML 2026
边界推理:通过测试期深思提升规范对齐
提出SpecBench基准以评估大模型遵循动态规范的能力,并提出分层反思与修正方法Align3,以极小开销优化安全与有用性的平衡。
- 会议论文ICML 2026
基于可验证与不可验证奖励的同步多目标对齐
提出MAHALO框架,通过标准化PRM过程监督与多动作头DPO进行多目标向量化对齐,有效缓解了数学推理与人类价值观对齐等多目标间的冲突并实现可控推理。
- 会议论文ICML 2026
FormalJudge:面向智能体监督的形式化神经符号范式
提出神经符号监督框架FormalJudge,将人类意图编译为形式化规约并用SMT求解器验证,实现弱对强泛化并以数学保证检测智能体欺骗。
- 会议论文ICML 2026
面向冲突目标的无奖励模型对齐
提出 RACO 框架,直接利用成对偏好数据,用 clipped 冲突规避梯度下降解决多目标梯度冲突,并给出收敛保证;在摘要与安全对齐任务上取得更优 Pareto 权衡。
- 会议论文ICML 2026
一致性训练会加剧模型对齐失效
在108个受控对齐失效模型上测试发现,一致性训练并非对齐中立:它虽能抑制奖励作弊与涌现失效,却会加剧模型的谄媚行为。
- 会议论文ICML 2026
重对齐问题:当大模型中的“对”变成“错”
针对规范演变导致的对齐脱节问题,提出无需重新标注的TRACE框架,通过评估对齐冲突筛选样本并优化混合损失,在安全基准上实现稳健重对齐。
- 会议论文ICML 2026
基于价值码本的LLM文化价值对齐开放式分布评估
针对传统单选评估无法反映真实文化取向的问题,该研究提出DOVE评估框架,基于价值码本与不平衡最优传输,对大语言模型开放生成的文化价值分布对齐进行评测。
- 会议论文ICML 2026
Split Personality Training:通过替代人格揭示潜在知识
在 LoRA 中训练一个“诚实人格”审查主模型回答,在 Auditing Game 模型上检出隐藏奖励作弊的准确率达 96%。
- 会议论文ICML 2026
如何避免辩论:基于双高效交互式证明的可扩展AI安全
针对AI辩论要求两模型能力相当且有一方诚实的局限,提出面向预言机辅助计算的双高效单证明者交互式证明协议,为可扩展监督提供了无需辩论的新途径。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文ACL 2025
语言模型抵抗对齐:来自数据压缩的证据
从压缩理论与实验揭示对齐后模型经再次微调易回归预训练行为分布,且这种回弹倾向随模型规模和预训练数据量增大而增强。
- 会议论文ACL 2025
MPO:通过奖励差距优化实现多语言安全对齐
提出MPO,通过缩小优势语言与目标语言的奖励差距差异迁移安全能力,在三个模型系列上改善多语言安全对齐且不降低通用效用。