全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
大语言模型对激活干预的内生抵抗机制
研究发现大模型能内生抵抗与其任务不符的激活干预,通过SAE定位出负责一致性检查的内部电路;该机制可防御对抗操控但也可能干扰安全干预,且能通过提示和微调加以增强。
- 会议论文ICML 2026
用于忠实表示干预的概念浓缩方法
提出概念浓缩方法COCA,通过显式推理过程重构训练数据以简化有害与良性表示的决策边界,使线性表示擦除能更有效降低越狱攻击成功率。
- 会议论文ICML 2026
竞争带来的涌现对齐
证明当用户效用落在多个未对齐AI智能体效用的凸包内时,通过策略性竞争交互可达到与完全对齐模型相当的效果,并在伦理判断等数据集上验证了这一理论。
- 会议论文ICML 2026
GenAlign:基于生成式奖励模型的多模态大模型统一对齐框架
提出GenAlign框架,通过带可验证奖励与在线去偏的生成式奖励模型结合动态参考锚定策略,在降低计算开销的同时显著改善多模态模型的安全性和幻觉问题。
- 会议论文ICML 2026
发现 LLM 对齐中的隐含目标
提出 Obj-Disco,将对齐奖励信号分解为稀疏的可读自然语言目标,覆盖超 90% 奖励行为,并能发现隐藏的错位激励。
- 会议论文ICML 2026
谁在迁移安全?识别并定位跨语言共享安全神经元
发现LLM中存在调节跨语言安全拒答行为的共享安全神经元,并通过针对性神经元微调显著增强低资源语言的安全性。
- 会议论文ICML 2026
Assistant Axis:定位并稳定语言模型的默认人格
在激活空间发现 Assistant Axis,其偏移可预测人格漂移;将激活限制在该轴固定区域可稳定行为并抵御基于人格的越狱。
- 会议论文ICML 2026
对齐篡改:人类反馈强化学习如何被利用以放大未对齐偏差
揭示RLHF因偏好数据由模型自身输出构建且偏好标签未解耦质量与偏见的结构性漏洞,导致对齐过程反而放大未对齐偏见与工具性目标追求。
- 会议论文ICML 2026
深度神经网络中潜在智能体子结构的概率建模
提出基于概率建模的智能体理论,形式化了LLM中瓦路易吉效应等对齐现象,证明先显现后抑制负面人格比单纯强化正面人格更能减少失配。
- 会议论文ICML 2026
边界推理:通过测试期深思提升规范对齐
提出SpecBench基准以评估大模型遵循动态规范的能力,并提出分层反思与修正方法Align3,以极小开销优化安全与有用性的平衡。
- 会议论文ICML 2026
基于可验证与不可验证奖励的同步多目标对齐
提出MAHALO框架,通过标准化PRM过程监督与多动作头DPO进行多目标向量化对齐,有效缓解了数学推理与人类价值观对齐等多目标间的冲突并实现可控推理。
- 会议论文ICML 2026
FormalJudge:面向智能体监督的形式化神经符号范式
提出神经符号监督框架FormalJudge,将人类意图编译为形式化规约并用SMT求解器验证,实现弱对强泛化并以数学保证检测智能体欺骗。
- 会议论文ICML 2026
CoT并非真实之链:虚假新闻生成中推理大模型的内部机制分析
揭示模型在拒答虚假新闻请求时CoT仍可能传播不安全内容,并通过层级解构与雅可比谱指标定位了导致安全分歧的关键注意力头。
- 会议论文ICML 2026
面向冲突目标的无奖励模型对齐
提出 RACO 框架,直接利用成对偏好数据,用 clipped 冲突规避梯度下降解决多目标梯度冲突,并给出收敛保证;在摘要与安全对齐任务上取得更优 Pareto 权衡。
- 会议论文ICML 2026
一致性训练会加剧模型对齐失效
在108个受控对齐失效模型上测试发现,一致性训练并非对齐中立:它虽能抑制奖励作弊与涌现失效,却会加剧模型的谄媚行为。
- 会议论文ICML 2026
重对齐问题:当大模型中的“对”变成“错”
针对规范演变导致的对齐脱节问题,提出无需重新标注的TRACE框架,通过评估对齐冲突筛选样本并优化混合损失,在安全基准上实现稳健重对齐。
- 会议论文ICML 2026
利用概念消融微调引导大模型分布外泛化
提出CAFT技术,利用可解释性工具在潜空间中通过线性投影消融未预期概念的方向,在不改动训练数据的情况下将突发性对齐失效减少了十倍。
- 会议论文ICML 2026
基于价值码本的LLM文化价值对齐开放式分布评估
针对传统单选评估无法反映真实文化取向的问题,该研究提出DOVE评估框架,基于价值码本与不平衡最优传输,对大语言模型开放生成的文化价值分布对齐进行评测。
- 会议论文ICML 2026
单一探针无法捕获所有欺骗:迈向针对性欺骗检测
评估了用于监控AI欺骗行为的线性探针,发现欺骗检测具有异质性,单一通用探针效果有限,针对特定欺骗类型部署定制探针能显著提升检测能力。
- 会议论文ICML 2026
Split Personality Training:通过替代人格揭示潜在知识
在 LoRA 中训练一个“诚实人格”审查主模型回答,在 Auditing Game 模型上检出隐藏奖励作弊的准确率达 96%。
- 会议论文ICML 2026
如何避免辩论:基于双高效交互式证明的可扩展AI安全
针对AI辩论要求两模型能力相当且有一方诚实的局限,提出面向预言机辅助计算的双高效单证明者交互式证明协议,为可扩展监督提供了无需辩论的新途径。
- 会议论文NDSS 2026
通过恶意载荷定位实现可解释的深度学习网页攻击检测
提出WebSpotter定位HTTP请求中的恶意载荷,并自动生成WAF规则,定位准确率较基线至少提升22%。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
JailbreakScope:通过表征与电路分析解释越狱机制
在 5 个 LLM、7 种越狱策略上发现越狱会增强肯定回应成分、抑制拒答成分,使表征偏向安全区域,且表征欺骗与电路激活偏移高度相关。