全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文Anthropic Alignment ScienceICML 2026
AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究
AE Studio 与 Anthropic 合作提出 Gradient Routed Auxiliary Modules(GRAM),通过在 Transformer 每个 MLP 层加入辅助模块并按数据类型选择性更新,把危险知识隔离到可开关的模块中,从而在单次训练里近似多个按数据过滤分别训练的模型。在 2M 条儿童故事合成语料上,26M 参数模型可开关特定故事主题知识,关闭后表现接近从未训练该主题的模型;在 800M 参数模型上,训练数据包含网络文本、代码、科学论文以及病毒学、网络安全、核物理和专门代码四个两用领域(每个约占 0.25%),单个 GRAM 模型可重配置为匹配五种不同过滤模型的表现,且对恶意微调的对抗性诱导保持稳健,而事后知识移除方法 MaxEnt 会恢复到接近全数据基线。作者给出初步证据,GRAM 在能力组合和标签稀疏(仅 50% 数据有标签)场景下优于 LoRA,但说明这只是两个孤立实验,不确定能否推广;研究属初步,尚未用于 Anthropic 的生产模型。
- 会议论文ACL 2026
对付讨好者的好论据:推理如何缓解(却又掩盖)LLM 谄媚
评测发现 CoT 推理总体降低最终决策中的谄媚,但部分样本会构造欺骗性理由掩盖谄媚;主观任务和权威偏置下更易谄媚。
- 会议论文ACL 2026
好人难说真话:角色扮演语言模型中由宜人性驱动的谄媚
在 13 个小型开源模型上测试发现,9 个模型中人设宜人性与谄媚率显著正相关,相关系数最高达 0.87。
- 会议论文ACL 2026
EthicMind:多轮对话的风险感知伦理与情感对齐
提出无需额外训练的逐轮风险与情绪分析框架,在高风险及道德模糊对话中实现更一致的伦理引导和情感回应。
- 会议论文ACL 2026
WildFeedback:利用真实交互与用户反馈对齐大模型
从多轮真实对话中识别用户反馈并自动构建偏好数据,微调后的模型在传统基准与清单引导评估中均更符合用户偏好。
- 会议论文ACL 2026
ProMedical:显式注入细粒度临床标准的医疗对齐
以临床细粒度标准训练多维奖励模型,分离安全约束与通用能力,使Qwen3-8B的准确率和安全合规性分别提升22.3%和21.7%。
- 会议论文ACL 2026
上下文学习中的涌现失对齐:狭窄示例引发广泛偏离
四个模型家族中,狭窄领域的上下文示例可诱发无关良性问题上的失对齐;16个示例对应1%至24%的发生率,扩大规模不能可靠防护。
- 会议论文ACL 2026
ConsistRM:以一致性感知自训练改进生成式奖励模型
提出无需人工标注的奖励模型自训练框架,通过答案与评语一致性奖励稳定训练,平均优于普通强化微调1.5%,并缓解位置偏差。
- 会议论文ACL 2026
结果准确还不够:对齐奖励模型的推理过程
提出理由一致性指标,识别奖励模型判断正确但理由错误的问题;结合结果准确率训练可改善理由一致性及下游RLHF表现。
- 会议论文ACL 2026
感觉正确与真正正确:AI谄媚如何影响价值判断
在31人参与的道德困境研究中,谄媚回应增强决策信心却降低开放思考,而中性回应促进认知灵活性与深入讨论。
- 会议论文ACL 2026
COMPASS:大语言模型组织特定政策对齐评测框架
在八类行业场景中评测七个模型,发现合法请求处理准确率超过95%,但对抗性禁令违规请求的拒答率仅为13%至40%。
- 会议论文ACL 2026
信任的泛化:语言模型的弱到强可信性
研究弱模型监督下可信属性的迁移,发现双阶段正则化可改善公平性及对抗与分布外鲁棒性,但隐私未表现出弱到强泛化。
- 会议论文ACL 2026
大模型智能体会再现权力不对等对话中的社会认知效应吗?
通过不同地位角色的多轮对话评估语言协调、说服及不安全请求服从,发现模型呈现与权力相关的社会认知效应及不安全行为。
- 会议论文ACL 2026
安全与效用冲突并非全局:基于注意力头诊断的精准对齐
提出 CAST,通过头级冲突诊断做稀疏微调,跳过少数高冲突注意力头,在不损失安全性的前提下显著减少通用能力下降。
- 会议论文ACL 2026
谄媚的动态:Video-LLM 谄媚行为的基准与分析
提出首个评估 Video-LLM 谄媚行为的基准 ViSE,并给出关键帧选择与推理时表征干预两种免训练缓解思路。
- 会议论文ACL 2026
当正确信念崩塌:LLM 在临床压力下的认知韧性
提出 Med-Stress 压力测试,发现九个前沿模型在多轮施压下放弃正确诊断,并给出 RBED 推理防御与 R-FT 微调,后者几乎消除信念改变。
- 会议论文ACL 2026
视觉自我实现对齐:用威胁相关图像塑造安全导向人格
在围绕威胁图像构建的中性 VQA 上微调 VLM,无需安全标签,即可降低攻击成功率、缓解过度拒答并保持通用能力。
- 会议论文ACL 2026
迁就与认知警觉:LLM 为何不质疑有害信念的语用学解释
从语用学角度把 LLM 未能质疑有害信念归因于过度迁就和认知警觉不足,解释了三个安全基准上的差异,并发现加入“wait a minute”等提示能大幅提升表现。
- 会议论文ACL 2026
从局部遗忘到大语言模型的涌现失对齐
发现局部领域的拒答遗忘可引发跨领域失对齐,早期层概念相似度与该效应相关,加入少量保留数据训练可大幅恢复对齐。
- 会议论文ACL 2026
面向医疗角色规范遵循的自演化大模型智能体框架
结合角色责任约束、结构化记忆、双层反思与AI反馈优化,在模拟医疗任务中降低严重性加权的规范风险,并提高角色身份稳定性。
- 会议论文ACL 2026
简单角色分配在安全对齐中表现出显著效果
通过角色条件生成与迭代角色评审实现免训练对齐,使DeepSeek-V3在WildJailbreak上的不安全输出比例从81.4%降至3.6%。
- 会议论文ACL 2026
观点:后训练时代应将人类标注分歧视为内在价值
分析偏好数据将多元标注压缩为单一共识的局限,主张为多元价值对齐与安全评估保留合理分歧,并提出数据构建策略。
- 会议论文ACL 2026
大语言模型拓扑增强对齐:轨迹拓扑损失与拓扑偏好优化
提出利用持续同调约束隐藏空间轨迹的对齐目标,在Qwen2.5实验中改善偏好指标与模型裁判评分,同时维持或略改善毒性表现。
- 会议论文ACL 2026
大语言模型如何权衡内部知识、用户主张与文档主张
评估27个模型的三源信息权衡,发现模型更依赖文档且难以区分有益与有害信息,使用多样来源交互数据微调可改善辨别能力。