全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
自诊断对齐:偏好对齐中融合内在反馈的元学习范式
针对训练数据噪声破坏偏好对齐的问题,提出让模型进行自我诊断的元学习范式,融合一致性与置信度等内在反馈自适应重加权样本,提升偏好对齐的鲁棒性。
- 会议论文ICLR 2026
Command-V:免训练的表示微调迁移
无需反向传播,把捐赠模型的残差表示适配器迁移到不同架构的模型;在增强安全拒答、促成越狱和自动 CoT 推理三个案例中,效果可比直接微调且资源消耗低得多。
- 会议论文ICLR 2026
从Sure到Sorry:基于JailNeurons的大视觉语言模型越狱检测
提出基于越狱关键神经元JailNeurons的多模态大模型越狱检测方法JDJN,通过跨层聚合神经元特征训练检测器,实现了高检测率、低误报率与快速推理。
- 会议论文ICLR 2026
涌现性不对齐易发生,狭义不对齐难实现
研究发现微调时泛化不对齐比狭义不对齐更具稳定性和效率,并分离出可用于监控和干预不对齐行为的通用不对齐线性表征。
- 会议论文ICLR 2026
AdAEM:自适应且自动扩展的大语言模型价值差异度量
提出自扩展评测算法AdAEM,通过上下文优化探测跨文化多模型的内部价值边界并提取争议性话题,自适应生成新问题以持续追踪模型的价值差异与对齐动态。
- 会议论文ICLR 2026
窄域微调在激活差异中留下清晰可读的痕迹
提出激活差异透镜,通过分析基座与微调模型的激活差异及特征干预,可恢复微调数据内容并检测涌现对齐失效等现象,为安全与可解释性研究提供了方法警示。
- 会议论文ICLR 2026
OrthAlign:基于正交子空间分解的无冲突多目标对齐
提出利用正交子空间分解解决多目标偏好对齐中的梯度冲突,从参数层面平衡大语言模型的有用性、无害性与真实性。
- 会议论文ICLR 2026
人类反馈中包含什么?学习偏好数据的可解释描述
提出利用稀疏自编码器解释人类反馈数据的WIMHF方法,揭示了偏好数据中投票支持有毒内容等不安全倾向,并通过数据清洗带来了37%的安全增益。
- 会议论文ICLR 2026
混乱的AI:未对齐如何随模型智力与任务复杂度扩展
通过偏差-方差分解形式化AI错误不连贯性,发现推理越久失效越不连贯,表明未来高级AI更可能引发偶发意外而非持续追求未对齐目标,加大了奖励作弊等对齐研究的重要性。
- 会议论文ICLR 2026
PluriHarms:评测人类对AI危害判断全谱系的基准
提出基准PluriHarms以系统研究人类在AI危害判断上的分歧与价值观多样性,包含150个提示词与1.5万条标注,揭示了当前对齐方法在多元安全上的不足。
- 会议论文ICLR 2026
一次对齐多语言获益:增强大模型安全对齐的多语言一致性
提出多语言一致性损失函数MLC,通过提升多语言表示向量的共线性实现语义层面的方向一致,仅用多语言提示变体即可在单语言对齐流程中同步增强多语言安全性。
- 会议论文ICLR 2026
对抗影响的形态:利用持续同调表征大语言模型潜在空间
利用持续同调研究对抗输入如何重塑大语言模型的内部表征几何,发现间接提示注入与后门微调均会导致潜在空间发生拓扑压缩,揭示了表征变化的几何不变量。
- 会议论文ICLR 2026
通过专家激活与停用调控MoE大语言模型
提出SteerMoE框架,通过在推理时选择性激活或停用特定行为相关专家,在无需微调下控制模型安全性与真实性,并揭示了MoE的安全漏洞。
- 会议论文ICLR 2026
Persona 特征控制 Emergent Misalignment
在多种条件下复现 emergent misalignment,并用 SAE model diffing 找到多个“未对齐 persona”特征,其中毒性 persona 特征最能控制并预测该行为;少量良性样本微调即可恢复对齐。
- 会议论文ICLR 2026
构建符合认知规律的决策模型以改进 AI 对齐
针对偏好学习无法反映真实认知的问题,提出公理化认知决策模型,更准确拟合人类判断以促进价值对齐。
- 会议论文ICML 2026
内省适配器:训练LLM如实报告自身学到的行为
提出内省适配器IA,利用植入行为的模型对联合优化LoRA促使其用自然语言表达学到的行为,成功用于审计未对齐模型及检测恶意微调攻击。
- 会议论文ICML 2026
基于斯塔克尔伯格博弈视角的推理期对齐奖励塑造
将KL正则化下的奖励模型优化建模为斯塔克尔伯格博弈,提出一种兼顾减轻基础模型偏差与降低奖励作弊风险的奖励塑造方法,有效提升了推理期对齐性能。
- 会议论文ICML 2026
压力见品行:大语言模型深度行为对齐评测
构建包含904个多轮施压场景的对齐评测基准,涵盖诚实、安全和谋划等六大维度;评测24款前沿模型发现顶尖模型仍存短板,且对齐表现呈现出统一构念特性。
- 会议论文ICML 2026
VALUEFLOW:面向 LLM 的多元可控价值观对齐
提出涵盖价值提取、强度评估与可控 steering 的统一框架,在十个模型、四种价值理论上研究 steerability 的不对称性。
- 会议论文ICML 2026
传递性与循环性:用于动态大语言模型对齐的显式偏好分解
针对标准RLHF无法捕捉循环偏好的问题,提出显式解耦标量与循环偏好的混合奖励模型及动态自博弈优化,在RewardBench 2和下游评测中提升对齐效果。
- 会议论文ICML 2026
BLOCK-EM:通过隐空间阻断预防突现未对齐
针对模型在特定任务微调时出现的突现未对齐现象,提出识别控制失齐行为的内部特征并在微调期予以约束的BLOCK-EM方法,可将未对齐现象降低最高95%。
- 会议论文ICML 2026
超越外部监控器:提升大语言模型透明度以实现更易监控
提出TELLME方法,通过提高大语言模型内部隐层表示的透明度,使模型潜在思维更易被监控以识别敏感与不当行为,并在多模态解毒任务上验证了有效性。
- 会议论文ICML 2026
面向可扩展监督的保守性校准
提出校准集体监督方法CCO,通过聚合多种辅助评分惩罚偏离并在保形决策理论下在线校准,使弱监督者能以统计保证成功约束更强智能体。
- 会议论文ICML 2026
对齐预训练:语料中的AI论述引发自我实现的(非)对齐
首次实证研究了预训练语料中关于AI行为的讨论对模型对齐的因果影响,发现负面叙事会导致自我实现的未对齐,而增加对齐文档能显著降低未对齐率并持续至后训练。