全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
信任的泛化:语言模型的弱到强可信性
研究弱模型监督下可信属性的迁移,发现双阶段正则化可改善公平性及对抗与分布外鲁棒性,但隐私未表现出弱到强泛化。
- 会议论文ACL 2026
大模型智能体会再现权力不对等对话中的社会认知效应吗?
通过不同地位角色的多轮对话评估语言协调、说服及不安全请求服从,发现模型呈现与权力相关的社会认知效应及不安全行为。
- 会议论文ACL 2026
安全与效用冲突并非全局:基于注意力头诊断的精准对齐
提出 CAST,通过头级冲突诊断做稀疏微调,跳过少数高冲突注意力头,在不损失安全性的前提下显著减少通用能力下降。
- 会议论文ACL 2026
谄媚的动态:Video-LLM 谄媚行为的基准与分析
提出首个评估 Video-LLM 谄媚行为的基准 ViSE,并给出关键帧选择与推理时表征干预两种免训练缓解思路。
- 会议论文ACL 2026
当正确信念崩塌:LLM 在临床压力下的认知韧性
提出 Med-Stress 压力测试,发现九个前沿模型在多轮施压下放弃正确诊断,并给出 RBED 推理防御与 R-FT 微调,后者几乎消除信念改变。
- 会议论文ACL 2026
视觉自我实现对齐:用威胁相关图像塑造安全导向人格
在围绕威胁图像构建的中性 VQA 上微调 VLM,无需安全标签,即可降低攻击成功率、缓解过度拒答并保持通用能力。
- 会议论文ACL 2026
迁就与认知警觉:LLM 为何不质疑有害信念的语用学解释
从语用学角度把 LLM 未能质疑有害信念归因于过度迁就和认知警觉不足,解释了三个安全基准上的差异,并发现加入“wait a minute”等提示能大幅提升表现。
- 会议论文ACL 2026
LLM 的心理 steering:有效性与可信度评估
提出 PsySET 基准,评测提示、微调与表征工程对情绪和人格的 steering 效果,并发现 steering 会带来安全、隐私等意外副作用。
- 会议论文ACL 2026
CRISP:基于稀疏自编码器的持久概念遗忘
用 SAE 特征抑制实现参数层面的持久遗忘,在 WMDP 有害知识遗忘任务上优于已有方法,同时保留通用能力。
- 会议论文ACL 2026
FineSteer:面向大模型的统一细粒度推理时 steering 框架
把推理时 steering 拆成条件触发与细粒度向量合成两阶段,在安全与真实性基准上优于现有方法,如 Llama-3 的 TruthfulQA 提升 7.6%,同时尽量保持通用能力。
- 会议论文ACL 2026
从局部遗忘到大语言模型的涌现失对齐
发现局部领域的拒答遗忘可引发跨领域失对齐,早期层概念相似度与该效应相关,加入少量保留数据训练可大幅恢复对齐。
- 会议论文ACL 2026
面向医疗角色规范遵循的自演化大模型智能体框架
结合角色责任约束、结构化记忆、双层反思与AI反馈优化,在模拟医疗任务中降低严重性加权的规范风险,并提高角色身份稳定性。
- 会议论文ACL 2026
离策略训练数据对探针泛化的影响
评估八类行为的探针泛化,发现战略欺骗等意图类行为最易失效,并提出利用受激励数据测试泛化的方法,提示现有欺骗探针可能难以胜任真实监控。
- 会议论文ACL 2026
简单角色分配在安全对齐中表现出显著效果
通过角色条件生成与迭代角色评审实现免训练对齐,使DeepSeek-V3在WildJailbreak上的不安全输出比例从81.4%降至3.6%。
- 会议论文ACL 2026
观点:后训练时代应将人类标注分歧视为内在价值
分析偏好数据将多元标注压缩为单一共识的局限,主张为多元价值对齐与安全评估保留合理分歧,并提出数据构建策略。
- 会议论文ACL 2026
大语言模型拓扑增强对齐:轨迹拓扑损失与拓扑偏好优化
提出利用持续同调约束隐藏空间轨迹的对齐目标,在Qwen2.5实验中改善偏好指标与模型裁判评分,同时维持或略改善毒性表现。
- 会议论文ACL 2026
大语言模型如何权衡内部知识、用户主张与文档主张
评估27个模型的三源信息权衡,发现模型更依赖文档且难以区分有益与有害信息,使用多样来源交互数据微调可改善辨别能力。
- 会议论文ACL 2026
虚假的安全感:基于探针的恶意输入检测为何难以泛化
通过受控实验发现,恶意输入检测探针主要学习指令模式和触发词而非语义有害性,解释其分布外泛化不足并提出评估改进方向。
- 会议论文ACL 2026
价值观引导如何重塑大语言模型行为
通过微调研究15种价值观的行为影响,发现引导积极价值观可提升安全性,但所有受测价值观均增加拟人化表达与迎合倾向。
- 会议论文ACL 2026
识别与干预大语言模型的安全关键参数
提出ESI定位安全关键参数,揭示稠密与MoE模型的分布差异,并通过定向更新或保护这些参数增强安全、抑制微调后的安全退化。
- 会议论文ACL 2026
像专家与是专家:拆解大模型谄媚中的权威、语体与文化影响
通过多语言受控评测区分资历与语体的影响,发现部分模型更易迎合高语体表达,且存在跨语言稳定的领域性谄媚弱点。
- 会议论文ACL 2026
用于少样本模型对齐的激活奖励模型
提出无需微调的激活奖励模型,以少量偏好样例引导激活,在奖励建模及新建奖励作弊基准上取得领先表现,并抵御噪声与虚假奖励信号。
- 会议论文ACL 2026
SycoBench-600:评测大模型助手的谄媚与选择性纠错
构建600题基准评测七款助手在社会压力下的谄媚与纠错表现,发现愿意改变答案并不意味着能区分正确与错误建议。
- 会议论文ACL 2026
MedRedFlag:大模型如何纠正真实健康咨询中的错误前提
构建逾1100个需纠正错误前提的健康问题并对比模型与临床医生回答,发现模型即使识别出错误前提,也常未能纠正提问方向。