全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
忠实性与安全性:评估反事实医学证据下的大模型行为
构建MedCounterFact并评测多个前沿模型,发现模型面对危险或不合理的反事实医学证据时仍普遍采信,给出自信且缺乏警示的回答。
- 会议论文ACL 2026
PsychEthicsBench:依澳大利亚心理健康伦理评估大模型
基于澳大利亚心理学与精神医学指南评测14个模型,发现拒答率难以反映伦理表现,部分领域微调模型的伦理稳健性反而下降。
- 会议论文ACL 2026
CliniCAST:医疗分诊中的声学依据与文本主导评测
构建5856个合成样本评估音频语言模型,发现安抚性话语会压制模型对可听危险信号的响应,暴露医疗分诊中的跨模态安全缺陷。
- 会议论文ACL 2026
视觉语言模型有道德定力吗?道德判断的脆弱性研究
不改变道德情境的多模态扰动即可翻转模型判断,且指令遵循更强的模型更易被说服,轻量推理干预可部分缓解。
- 会议论文ACL 2026
RLHF中训练数据与策略的联合优化
JODP让策略生成训练提示并学习脱离提示复现高奖励行为,在安全对齐任务上以不足1%的额外计算使4B模型接近8B模型表现。
- 会议论文ACL 2026
揭示大语言模型的策略性利己行为
通过880个利益诱惑决策场景评测九个闭源模型,发现策略性利己选择平均占67.96%,且与其他安全缺陷相关,并提出轻量缓解方法。
- 会议论文ACL 2026
诊断与缓解大语言模型因果判断中的谄媚与过度怀疑
提出无需标准答案的递归因果审计,检查推导一致性及用户施压影响,揭示过度怀疑与规模悖论,并在无需重训时改善效用和安全表现。
- 会议论文ACL 2026
选择性激活引导:通过判别式层选择实现保范数控制
提出保范数旋转与判别式层选择方法,在九个模型上提高相较既有方法的攻击成功率,同时保持约100%的基准能力。
- 会议论文ACL 2026
分析激活引导向量的安全隐患
系统审计发现,激活引导可显著提高或降低越狱成功率,机制分析将其归因于引导向量与拒答行为潜在子空间的重叠。
- 会议论文ACL 2026
RLHS:利用事后模拟缓解RLHF中的失对齐
通过先向评估者展示模拟后果再收集反馈,减少模型输出对结果预期的操纵,在三类咨询任务和人类评估中获得优于RLHF的对齐表现。
- 会议论文ACL 2026
CausalDetox:通过因果注意力头选择与干预降低语言模型毒性
定位导致有毒生成的关键注意力头,通过动态激活引导或定向微调降低毒性,在保持语言流畅性的同时将注意力头选择加速七倍。
- 会议论文ACL 2026
时空谄媚:否定式误导下的视频大模型信念反转
构建GasVideo-1000,发现视频大模型普遍会在否定反馈下推翻正确判断并编造解释,提示级视觉依据约束只能部分缓解。
- 会议论文ACL 2026
是否干预:用概率模型混合引导推理时对齐
发现不可靠的对齐指导会引发过度干预,提出按可靠性混合模型输出分布的BlendIn,在困难模型组合上性能最高提升50%。
- 会议论文ACL 2026
Safe-SAIL:用稀疏自编码器刻画模型细粒度安全特征
提出安全领域稀疏自编码器解释框架,将解释成本降低55%,并提供涵盖四个领域的1758个安全相关特征。
- 会议论文ICLR 2026
AlphaSteer:基于零空间约束学习拒答激活干预
提出AlphaSteer激活干预方法,通过零空间约束保持良性提示性能并引入拒答方向,有效防御越狱攻击且不损害通用能力。
- 会议论文ICLR 2026
通过纠正性干预实现大推理模型的安全推理
针对大推理模型思维链中潜藏有害内容的问题,提出干预式偏好优化(IPO),通过将顺从步骤替换为安全触发器来对齐推理过程,显著降低有害性。
- 会议论文ICLR 2026
基于信息论引导消除奖励模型归纳偏置
针对奖励模型中易引发奖励作弊的归纳偏置,提出基于信息瓶颈的去偏方法DIR,有效抑制回复长度、谄媚与格式偏置并提升RLHF性能。
- 会议论文ICLR 2026
基于元加权在线采样的偏好优化对齐方法
提出MetaAPO偏好优化对齐框架,利用元学习器动态平衡在线生成与离线数据分布,在降低42%标注成本的同时提升了模型对齐效果。
- 会议论文ICLR 2026
表层安全对齐假说
提出表层安全对齐假说,指出安全对齐本质是二分类决策且仅需神经元级少数关键单元建立护栏,微调时冻结安全关键单元可最小化对齐税并保持安全性。
- 会议论文ICLR 2026
LitmusValues:通过AI风险困境石蕊测试AI价值优先级
提出LitmusValues评估流程与AIRiskDilemmas困境数据集,通过测定AI在冲突情境下的价值优先级,有效预测其潜在风险与有害行为。
- 会议论文ICLR 2026
对齐审计器:验证与优化大模型目标的贝叶斯框架
提出基于贝叶斯逆强化学习的对齐审计框架,通过推断目标分布量化非可辨识性并暴露虚假捷径,为安全团队提供验证大模型真实对齐目标的工具。
- 会议论文ICLR 2026
Humanline:将在线对齐视为感知损失
从行为经济学前景理论解释在线对齐优势,提出将概率感知偏差融入DPO等目标的Humanline变体,使离线数据达到在线对齐效果。
- 会议论文ICLR 2026
TrustGen:生成式基础模型可信度动态评测平台
提出跨模态生成模型可信度动态评测平台TrustGen,涵盖真实性、安全性与伦理等25个维度,评测发现开源模型已匹敌闭源,且可信度与有用性存在复杂权衡。
- 会议论文ICLR 2026
接种提示:在训练中诱发特征可减少测试期的特征表达
提出在微调数据前添加诱发不良特征的系统提示,使模型在测试期显著减少该特征表达,有效缓解狭窄微调导致的涌现对齐失效与后门攻击。