全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2026
从模型认知视角量化大语言模型攻击
论文用中间层探针检测有害提示相关信号,提出Sentinel并绘制安全信号在模型层间的传播与衰减。
- 会议论文ACL 2025
通过定向干预实现语言模型的多属性引导
提出MAT-Steer,通过选择性词元干预与稀疏正交引导向量缓解属性冲突,在兼顾真实性、毒性等属性的任务中优于既有方法。
- 会议论文ACL 2025
超越提示工程:通过目标原子引导稳健控制大模型行为
提出STA,分离并操控解耦的知识成分以增强安全性;实验显示其在对抗场景中的鲁棒性与灵活性,并验证了对推理模型的控制效果。
- 会议论文ACL 2025
语言模型抵抗对齐:来自数据压缩的证据
从压缩理论与实验揭示对齐后模型经再次微调易回归预训练行为分布,且这种回弹倾向随模型规模和预训练数据量增大而增强。
- 会议论文ACL 2025
小改动,大影响:少量神经元操控如何改变大模型攻击性
识别与攻击性表达相关的神经元并进行屏蔽和激活实验,发现仅操控少量神经元即可使攻击性最高增加33%,且效果随层位置变化。
- 会议论文ACL 2025
MPO:通过奖励差距优化实现多语言安全对齐
提出MPO,通过缩小优势语言与目标语言的奖励差距差异迁移安全能力,在三个模型系列上改善多语言安全对齐且不降低通用效用。
- 会议论文ACL 2025
SEA:借助合成嵌入实现多模态大模型低资源安全对齐
提出SEA,仅用文本数据合成其他模态嵌入进行安全对齐,在图像、视频和音频模型上提升安全性,并提出视频与音频安全评测基准。
- 会议论文ACL 2025
DeAL:大语言模型的解码时对齐
将解码建模为启发式引导搜索,以自定义奖励权衡无害性、帮助性等目标,实验显示可改善对齐,并与 RLHF 和提示方法互补。
- 会议论文ACL 2025
探究指令微调对大语言模型错误信息易感性的影响
比较指令微调与基础模型,发现微调提高了模型对用户错误信息的接受程度,并使易感性从助手角色转向用户角色。
- 会议论文ACL 2025
通过影响函数理解人类反馈的作用
提出计算高效的影响函数近似方法,量化人类反馈对奖励模型的作用,并用于检测标注者偏差、指导反馈向专家判断靠拢。
- 会议论文ACL 2025
PopAlign:通过多样化对比模式实现更全面的对齐
提出 PopAlign,在提示、模型和流程层面引入六种无需额外反馈标注的对比策略,实验显示多样化偏好数据能改善对齐效果。
- 会议论文ACL 2025
改进大语言模型对齐的价值原则:系统评估与增强
从全面性、精确性与兼容性量化评估价值原则,提出按场景逐级检索原则的 HiVaP 框架,实验显示可提升对齐效果。
- 会议论文ACL 2025
LSSF:通过低秩安全子空间融合实现大模型安全对齐
提出低秩安全子空间融合方法,无需再次微调即可恢复微调模型的安全对齐,并在实验中对下游任务性能影响较小。
- 会议论文ACL 2025
通过偏好重排序与表征奖励建模实现高效安全对齐
利用模型内部安全判断信号重排序偏好数据,缓解离策略训练的分布偏移,提升安全表现并避免约300倍的计算开销。
- 会议论文ACL 2025
MoTE:推理链与专家混合协同实现自对齐
结合四阶段安全推理链与按步骤路由的多LoRA专家,改善模型安全性、越狱抵抗与过度拒答,报告表现可比o1。
- 会议论文ACL 2025
价值观对齐大模型的意外危害:心理学与实证洞见
发现个人价值观对齐可能增加模型有害行为,分析价值观与风险的关联及心理学解释,并提出上下文对齐方法改善安全性。
- 会议论文ACL 2025
PKU-SafeRLHF:基于人类偏好的多级安全对齐
发布区分有用性与无害性的数据集,覆盖19类危害和三级严重程度,并用于训练感知严重程度的审核模型与安全RLHF算法。
- 会议论文ACL 2025
M-RewardBench:多语言场景下的奖励模型评测
构建覆盖23种语言及安全等任务的奖励模型基准,发现英语与非英语表现差距显著,模型偏好也会随语言发生较大变化。
- 会议论文ACL 2025
混合偏好:学习将样本分配给人类或AI反馈
提出HyPER选择人类与模型偏好标注的组合,在降低人工成本的同时提升奖励模型表现,并发现中等安全风险或复杂度的提示最受益于人工反馈。
- 会议论文ACL 2025
LLMBraces:通过相关子更新调整大语言模型预测
依据输入相关性动态调节前馈层子更新的贡献,以较少可训练参数改善预测,并在情感控制生成和降低有毒输出方面展现效果。
- 会议论文ACL 2025
以生成式心理词汇方法构建大语言模型价值体系
提出生成式心理词汇方法及五因素价值体系,相比施瓦茨价值体系,更好地刻画模型价值观,并改善安全预测与对齐效果。
- 会议论文ACL 2025
防护为何失效?对齐模型的安全机制倾向锚定模板区域
通过实验和机制分析发现,多种对齐模型的安全决策过度依赖模板区域,导致越狱脆弱性;降低这种依赖有望改善防御。
- 会议论文ACL 2025
没有正确选项时:大语言模型的选择题鲁棒性
通过无正确选项的选择题评测,发现对齐后模型常服从指令而选择错误答案,暴露对齐优化与反思判断之间的冲突。
- 会议论文ACL 2025
如何缓解弱到强泛化中的过拟合?
针对弱监督对齐中的过拟合,提出同时改善监督信号与输入问题质量的两阶段框架,在数学基准上显著提高性能差距恢复率。