全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
面向医疗角色规范遵循的自演化大模型智能体框架
结合角色责任约束、结构化记忆、双层反思与AI反馈优化,在模拟医疗任务中降低严重性加权的规范风险,并提高角色身份稳定性。
- 会议论文ACL 2026
简单角色分配在安全对齐中表现出显著效果
通过角色条件生成与迭代角色评审实现免训练对齐,使DeepSeek-V3在WildJailbreak上的不安全输出比例从81.4%降至3.6%。
- 会议论文ACL 2026
观点:后训练时代应将人类标注分歧视为内在价值
分析偏好数据将多元标注压缩为单一共识的局限,主张为多元价值对齐与安全评估保留合理分歧,并提出数据构建策略。
- 会议论文ACL 2026
大语言模型拓扑增强对齐:轨迹拓扑损失与拓扑偏好优化
提出利用持续同调约束隐藏空间轨迹的对齐目标,在Qwen2.5实验中改善偏好指标与模型裁判评分,同时维持或略改善毒性表现。
- 会议论文ACL 2026
大语言模型如何权衡内部知识、用户主张与文档主张
评估27个模型的三源信息权衡,发现模型更依赖文档且难以区分有益与有害信息,使用多样来源交互数据微调可改善辨别能力。
- 会议论文ACL 2026
价值观引导如何重塑大语言模型行为
通过微调研究15种价值观的行为影响,发现引导积极价值观可提升安全性,但所有受测价值观均增加拟人化表达与迎合倾向。
- 会议论文ACL 2026
像专家与是专家:拆解大模型谄媚中的权威、语体与文化影响
通过多语言受控评测区分资历与语体的影响,发现部分模型更易迎合高语体表达,且存在跨语言稳定的领域性谄媚弱点。
- 会议论文ACL 2026
用于少样本模型对齐的激活奖励模型
提出无需微调的激活奖励模型,以少量偏好样例引导激活,在奖励建模及新建奖励作弊基准上取得领先表现,并抵御噪声与虚假奖励信号。
- 会议论文ACL 2026
SycoBench-600:评测大模型助手的谄媚与选择性纠错
构建600题基准评测七款助手在社会压力下的谄媚与纠错表现,发现愿意改变答案并不意味着能区分正确与错误建议。
- 会议论文ACL 2026
MedRedFlag:大模型如何纠正真实健康咨询中的错误前提
构建逾1100个需纠正错误前提的健康问题并对比模型与临床医生回答,发现模型即使识别出错误前提,也常未能纠正提问方向。
- 会议论文ACL 2026
忠实性与安全性:评估反事实医学证据下的大模型行为
构建MedCounterFact并评测多个前沿模型,发现模型面对危险或不合理的反事实医学证据时仍普遍采信,给出自信且缺乏警示的回答。
- 会议论文ACL 2026
PsychEthicsBench:依澳大利亚心理健康伦理评估大模型
基于澳大利亚心理学与精神医学指南评测14个模型,发现拒答率难以反映伦理表现,部分领域微调模型的伦理稳健性反而下降。
- 会议论文ACL 2026
CliniCAST:医疗分诊中的声学依据与文本主导评测
构建5856个合成样本评估音频语言模型,发现安抚性话语会压制模型对可听危险信号的响应,暴露医疗分诊中的跨模态安全缺陷。
- 会议论文ACL 2026
视觉语言模型有道德定力吗?道德判断的脆弱性研究
不改变道德情境的多模态扰动即可翻转模型判断,且指令遵循更强的模型更易被说服,轻量推理干预可部分缓解。
- 会议论文ACL 2026
RLHF中训练数据与策略的联合优化
JODP让策略生成训练提示并学习脱离提示复现高奖励行为,在安全对齐任务上以不足1%的额外计算使4B模型接近8B模型表现。
- 会议论文ACL 2026
揭示大语言模型的策略性利己行为
通过880个利益诱惑决策场景评测九个闭源模型,发现策略性利己选择平均占67.96%,且与其他安全缺陷相关,并提出轻量缓解方法。
- 会议论文ACL 2026
诊断与缓解大语言模型因果判断中的谄媚与过度怀疑
提出无需标准答案的递归因果审计,检查推导一致性及用户施压影响,揭示过度怀疑与规模悖论,并在无需重训时改善效用和安全表现。
- 会议论文ACL 2026
RLHS:利用事后模拟缓解RLHF中的失对齐
通过先向评估者展示模拟后果再收集反馈,减少模型输出对结果预期的操纵,在三类咨询任务和人类评估中获得优于RLHF的对齐表现。
- 会议论文ACL 2026
时空谄媚:否定式误导下的视频大模型信念反转
构建GasVideo-1000,发现视频大模型普遍会在否定反馈下推翻正确判断并编造解释,提示级视觉依据约束只能部分缓解。
- 会议论文ACL 2026
是否干预:用概率模型混合引导推理时对齐
发现不可靠的对齐指导会引发过度干预,提出按可靠性混合模型输出分布的BlendIn,在困难模型组合上性能最高提升50%。
- 会议论文ICLR 2026
通过纠正性干预实现大推理模型的安全推理
针对大推理模型思维链中潜藏有害内容的问题,提出干预式偏好优化(IPO),通过将顺从步骤替换为安全触发器来对齐推理过程,显著降低有害性。
- 会议论文ICLR 2026
基于信息论引导消除奖励模型归纳偏置
针对奖励模型中易引发奖励作弊的归纳偏置,提出基于信息瓶颈的去偏方法DIR,有效抑制回复长度、谄媚与格式偏置并提升RLHF性能。
- 会议论文ICLR 2026
基于元加权在线采样的偏好优化对齐方法
提出MetaAPO偏好优化对齐框架,利用元学习器动态平衡在线生成与离线数据分布,在降低42%标注成本的同时提升了模型对齐效果。
- 会议论文ICLR 2026
表层安全对齐假说
提出表层安全对齐假说,指出安全对齐本质是二分类决策且仅需神经元级少数关键单元建立护栏,微调时冻结安全关键单元可最小化对齐税并保持安全性。