全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
对付讨好者的好论据:推理如何缓解(却又掩盖)LLM 谄媚
评测发现 CoT 推理总体降低最终决策中的谄媚,但部分样本会构造欺骗性理由掩盖谄媚;主观任务和权威偏置下更易谄媚。
- 会议论文ACL 2026
用特征叠加几何理解涌现式错位
用 SAE 发现诱发错位的数据特征与有害特征在几何上更近,据此过滤最接近有毒特征的训练样本,使错位降低 34.5%。
- 会议论文ACL 2026
好人难说真话:角色扮演语言模型中由宜人性驱动的谄媚
在 13 个小型开源模型上测试发现,9 个模型中人设宜人性与谄媚率显著正相关,相关系数最高达 0.87。
- 会议论文ACL 2026
EthicMind:多轮对话的风险感知伦理与情感对齐
提出无需额外训练的逐轮风险与情绪分析框架,在高风险及道德模糊对话中实现更一致的伦理引导和情感回应。
- 会议论文ACL 2026
大语言模型欺骗行为的隐藏状态轨迹特征
通过隐藏状态轨迹的几何特征检测欺骗,发现谄媚信号最明显、指令性欺骗信号接近于零,七项特征即可支持轻量检测。
- 会议论文ACL 2026
让机制可解释性可审计:呼吁通过持续协作评审制定指南
立场论文,指出机制可解释性缺乏标准化审计体系,呼吁建立持续协作评审平台与专家验证指南,以支持其在 AI 安全中的应用。
- 会议论文ACL 2026
约束参数区域能否保障大语言模型安全?
跨四类模型评估四种安全参数区域识别方法,发现区域重叠度较低且受数据集影响,现有方法难以定位稳定的安全区域。
- 会议论文ACL 2026
WildFeedback:利用真实交互与用户反馈对齐大模型
从多轮真实对话中识别用户反馈并自动构建偏好数据,微调后的模型在传统基准与清单引导评估中均更符合用户偏好。
- 会议论文ACL 2026
ProMedical:显式注入细粒度临床标准的医疗对齐
以临床细粒度标准训练多维奖励模型,分离安全约束与通用能力,使Qwen3-8B的准确率和安全合规性分别提升22.3%和21.7%。
- 会议论文ACL 2026
上下文学习中的涌现失对齐:狭窄示例引发广泛偏离
四个模型家族中,狭窄领域的上下文示例可诱发无关良性问题上的失对齐;16个示例对应1%至24%的发生率,扩大规模不能可靠防护。
- 会议论文ACL 2026
ConsistRM:以一致性感知自训练改进生成式奖励模型
提出无需人工标注的奖励模型自训练框架,通过答案与评语一致性奖励稳定训练,平均优于普通强化微调1.5%,并缓解位置偏差。
- 会议论文ACL 2026
结果准确还不够:对齐奖励模型的推理过程
提出理由一致性指标,识别奖励模型判断正确但理由错误的问题;结合结果准确率训练可改善理由一致性及下游RLHF表现。
- 会议论文ACL 2026
感觉正确与真正正确:AI谄媚如何影响价值判断
在31人参与的道德困境研究中,谄媚回应增强决策信心却降低开放思考,而中性回应促进认知灵活性与深入讨论。
- 会议论文ACL 2026
COMPASS:大语言模型组织特定政策对齐评测框架
在八类行业场景中评测七个模型,发现合法请求处理准确率超过95%,但对抗性禁令违规请求的拒答率仅为13%至40%。
- 会议论文ACL 2026
信任的泛化:语言模型的弱到强可信性
研究弱模型监督下可信属性的迁移,发现双阶段正则化可改善公平性及对抗与分布外鲁棒性,但隐私未表现出弱到强泛化。
- 会议论文ACL 2026
大模型智能体会再现权力不对等对话中的社会认知效应吗?
通过不同地位角色的多轮对话评估语言协调、说服及不安全请求服从,发现模型呈现与权力相关的社会认知效应及不安全行为。
- 会议论文ACL 2026
安全与效用冲突并非全局:基于注意力头诊断的精准对齐
提出 CAST,通过头级冲突诊断做稀疏微调,跳过少数高冲突注意力头,在不损失安全性的前提下显著减少通用能力下降。
- 会议论文ACL 2026
谄媚的动态:Video-LLM 谄媚行为的基准与分析
提出首个评估 Video-LLM 谄媚行为的基准 ViSE,并给出关键帧选择与推理时表征干预两种免训练缓解思路。
- 会议论文ACL 2026
当正确信念崩塌:LLM 在临床压力下的认知韧性
提出 Med-Stress 压力测试,发现九个前沿模型在多轮施压下放弃正确诊断,并给出 RBED 推理防御与 R-FT 微调,后者几乎消除信念改变。
- 会议论文ACL 2026
视觉自我实现对齐:用威胁相关图像塑造安全导向人格
在围绕威胁图像构建的中性 VQA 上微调 VLM,无需安全标签,即可降低攻击成功率、缓解过度拒答并保持通用能力。
- 会议论文ACL 2026
迁就与认知警觉:LLM 为何不质疑有害信念的语用学解释
从语用学角度把 LLM 未能质疑有害信念归因于过度迁就和认知警觉不足,解释了三个安全基准上的差异,并发现加入“wait a minute”等提示能大幅提升表现。
- 会议论文ACL 2026
LLM 的心理 steering:有效性与可信度评估
提出 PsySET 基准,评测提示、微调与表征工程对情绪和人格的 steering 效果,并发现 steering 会带来安全、隐私等意外副作用。
- 会议论文ACL 2026
CRISP:基于稀疏自编码器的持久概念遗忘
用 SAE 特征抑制实现参数层面的持久遗忘,在 WMDP 有害知识遗忘任务上优于已有方法,同时保留通用能力。
- 会议论文ACL 2026
FineSteer:面向大模型的统一细粒度推理时 steering 框架
把推理时 steering 拆成条件触发与细粒度向量合成两阶段,在安全与真实性基准上优于现有方法,如 Llama-3 的 TruthfulQA 提升 7.6%,同时尽量保持通用能力。