全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
重新定义专家:用于缓解毒性的语言模型可解释分解
提出 EigenShift,对输出层做特征分解以定向抑制生成毒性的成分,无需额外训练,且不损害语言能力。
- 会议论文NeurIPS 2025
谁的安全观?面向文生图模型多元对齐的 DIVE 数据集
构建由人口统计交叉的评分者标注的多模态数据集,发现不同人群对危害的感知存在显著差异,为文生图模型的多元安全对齐提供基础。
- 会议论文NeurIPS 2025
抗策略性操纵的人类反馈强化学习
证明现有 RLHF 算法无法抵御策略性标注者,单个标注者即可造成严重错位;提出 Pessimistic Median of MLEs 算法,近似抗操纵并收敛到最优策略。
- 会议论文NeurIPS 2025
通过系统级 DPO 对齐复合 AI 系统
提出 SysDPO,将复合 AI 系统建模为 DAG 并扩展 DPO 做系统级联合对齐,在语言模型加扩散模型等场景中验证有效。
- 会议论文NeurIPS 2025
用激活探针检测高风险交互
用激活探针监控可能导致重大危害的高风险交互,效果媲美中型 LLM 监控器而计算成本低六个数量级,可作分层监控的初筛。
- 会议论文NeurIPS 2025
理解安全对齐:从安全神经元看机制可解释性
用激活对比定位约 5% 的安全神经元,仅修补其激活即可恢复超过 90% 的安全表现,并解释对齐税,还可在生成前检测不安全输出。
- 会议论文NeurIPS 2025
LinEAS:基于分布损失的端到端激活 steering 学习
用全局分布损失端到端训练线性激活 steering,仅需少量无配对样本即可缓解语言模型毒性,效果接近依赖强监督的方法。
- 会议论文NeurIPS 2025
通过可证明鲁棒的模型对齐实现人类反馈的可扩展估值
提出具有可证明 redescending 性质的 Hölder-DPO,可在噪声偏好标签下鲁棒对齐,并检测错标样本;清除 HH-RLHF 中的噪声后对齐效果提升。
- 会议论文NeurIPS 2025
Generative RLHF-V:从多模态人类偏好中学习原则
提出将生成式奖励模型与多模态 RLHF 结合的对齐框架,在 7 个基准上使 4 个 MLLM 平均提升 18.1%,而基线 RLHF 仅提升 5.3%。
- 会议论文NeurIPS 2025
Safe RLHF-V:基于多模态人类反馈的安全强化学习
提出首个多模态安全对齐框架,含双偏好数据集 BeaverTails-V 与护栏模型;约束优化使模型安全性提升 34.2%、有用性提升 34.3%。
- 会议论文NeurIPS 2025
Learning to Steer:面向多模态 LLM 的输入相关 steering
训练小型辅助模块预测输入相关的 steering 向量,在多模态 LLM 上减少幻觉并强化安全行为,优于静态 steering 基线。
- 会议论文NeurIPS 2025
超越期望:面向风险校准语言模型的分位数引导对齐
提出 Quantile-Guided Alignment,在 RLHF 中施加分位数约束以控制有害输出等尾部风险,在对话和代码生成上提升目标尾部质量。
- 会议论文NeurIPS 2025
度量并引导单义性:Guided Sparse Autoencoders
提出特征单义性分数 FMS 与带概念标签训练的 G-SAE,在毒性检测、隐私属性识别等任务上提升单义性,并实现更精细的 steering。
- 会议论文NeurIPS 2025
用 Gradient Slingshots 操纵特征可视化
提出 Gradient Slingshots,可在不改架构下让特征可视化收敛到任意预设图像,暴露审计风险,并给出简单防御。
- 会议论文NeurIPS 2025
SAFEx:通过稳定的安全关键专家识别分析 MoE 大模型漏洞
识别 MoE 模型中承担安全行为的专家并分组;屏蔽 12 个专家使 Qwen3-30B-A3B 拒答率降 22%,并用 LoRA 与负权重合并提升拒答。
- 会议论文NeurIPS 2025
DPO 能学习多样的人类价值观吗?一个理论缩放律
建立理论框架分析 DPO 泛化如何随价值多样性与样本量缩放,给出泛化误差界,说明学习广泛价值观的困难,并在 LLM 上验证。
- 会议论文NeurIPS 2025
LLM 安全对齐本质上是散度估计
证明 RLHF 等对齐方法可视为安全与有害分布间的散度估计,据此提出 KLDO 方法,并给出衡量表示空间分离度的安全指标。
- 会议论文NeurIPS 2025
Deep Value Benchmark:衡量模型泛化的是深层价值还是浅层偏好
通过控制深层价值与浅层特征的混淆来测 DVGR,9 个模型平均仅 0.30,均低于随机水平,且更大模型略低。
- 会议论文NeurIPS 2025
Angular Steering:通过激活空间旋转控制行为
将 steering 表述为固定二维子空间内的几何旋转,对拒答与顺从等行为实现连续细粒度控制,并保持通用语言建模性能。
- 会议论文NeurIPS 2025
面向多元对齐的成对校准奖励
用多个奖励函数的分布表示分歧的人类偏好,提出成对校准准则并给出训练启发式,提升校准效果。
- 会议论文NeurIPS 2025
拒答方向在各安全对齐语言间具有普遍性
在14种语言上发现拒答方向跨语言通用,从英语提取的向量几乎可完全绕过其他语言的拒答,并解释了跨语言越狱的机制。
- 会议论文NeurIPS 2025
语言模型能预测自身行为
基于输入表示训练带 conformal 保证的探针,在生成前预警越狱等对齐失效,预警系统使越狱减少 91%。
- 会议论文NeurIPS 2025
可解释的 RLHF:改进对齐
通过定位导致不满意回复的训练数据并对其进行遗忘,在不显著损害其他回复的前提下改进 RLHF 对齐后的语言模型。
- 会议论文NeurIPS 2025
语言模型能够对自身内部激活进行元认知监控与控制
用 neurofeedback 范式量化 LLM 报告和控制自身激活的能力,发现其只能监控神经空间的一小部分,并指出模型可能规避激活层面的安全检测。