全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
检索增强防御:自适应、可控的大语言模型越狱防范
利用已知攻击案例检索识别恶意意图与越狱策略,无需重训即可更新防御,在降低攻击效果的同时维持较低正常请求拒答率。
- 会议论文ACL 2026
学习隐藏风险:金融领域大语言模型的可控多轮红队攻击
提出逐轮掩藏风险、诱导违规回答的黑盒攻击框架,并构建金融风险基准;完整方法在九个模型上的平均攻击成功率达95%。
- 会议论文ACL 2026
LASA:在语义瓶颈处实现语言无关的安全对齐
将安全对齐锚定于语言无关的中间层语义表征,改善跨语言安全性,使LLaMA模型的平均攻击成功率从24.7%降至2.8%。
- 会议论文ACL 2026
生成式智能体社会模拟中的多模态安全评估
构建多模态智能体安全模拟框架,发现不安全计划纠正成功率仅55%,且误导性视觉线索下45%的不安全行动被接受。
- 会议论文ACL 2026
SafeMT:多模态语言模型的多轮对话安全
构建万条样本的多轮安全基准,评测17个模型发现攻击风险随轮次增加,并提出比现有护栏更有效的对话安全调节器。
- 会议论文ACL 2026
结果准确还不够:对齐奖励模型的推理过程
提出理由一致性指标,识别奖励模型判断正确但理由错误的问题;结合结果准确率训练可改善理由一致性及下游RLHF表现。
- 会议论文ACL 2026
从BERTology看大模型编排:高效单次前向分类探针
复用生成模型的词元与层级隐藏状态进行安全分类,性能可媲美更大专用模型,同时避免独立护栏的显存与延迟开销。
- 会议论文ACL 2026
进退两难:LLM 伦理推理与安全对齐之间的张力
提出多轮红队方法 TRIAL,利用模型自身伦理推理包装有害请求取得高攻击成功率,并提出 ERR 防御框架。
- 会议论文ACL 2026
SecureGate:以词元门控双适配器控制联邦大模型隐私披露
通过双适配器与词元门控控制敏感信息披露,在提升任务效用的同时,将未授权请求的推断攻击准确率最高降低31.66倍。
- 会议论文ACL 2026
ARES:策略—奖励系统的自适应红队测试与端到端修复
同时发现策略模型与奖励模型的安全弱点,再依次修复奖励模型和策略模型,在多个对抗安全基准上提升鲁棒性并保留能力。
- 会议论文ACL 2026
推理轨迹影响输出,但模型不愿承认
向三个推理模型注入合成推理片段,发现其会改变答案却常编造其他解释;极端提示条件下,不披露影响的比例超过90%。
- 会议论文ACL 2026
AutoRAN:自动劫持大型推理模型的安全推理
利用较弱模型模拟推理,并根据目标拒答泄露的推理模式迭代攻击,在多个推理模型与基准上实现接近100%的攻击成功率。
- 会议论文ACL 2026
深度研究的开放域评估与多阶段安全护栏
提出四阶段深度研究护栏及分阶段安全基准,将防御成功率提升16.53个百分点、过度拒答率降至约6%,并改善报告质量。
- 会议论文ACL 2026
用于提示安全的轻量可解释护栏
联合训练提示分类器与解释词标注器,以更小模型在三个数据集的域内外测试中达到或超过现有提示分类与可解释性水平。
- 会议论文ACL 2026
BanHADEX:人类标注解释支持的孟加拉语仇恨检测
构建含19203条评论及人工解释的孟加拉语仇恨检测数据集,实验显示解释引导的LoRA提升了分类表现与解释质量。
- 会议论文ACL 2026
通过激活分解与引导修复大语言模型后门
提出CS-ADS,通过对比并分解激活提取行为引导方向,无需辅助模型或数据集即可有效防御多种后门攻击。
- 会议论文ACL 2026
感觉正确与真正正确:AI谄媚如何影响价值判断
在31人参与的道德困境研究中,谄媚回应增强决策信心却降低开放思考,而中性回应促进认知灵活性与深入讨论。
- 会议论文ACL 2026
SafeConstellations:任务感知表征引导缓解过度拒答
发现不同任务的跨层表征轨迹具有规律,提出推理时定向调整轨迹的方法,减少过度拒答且对模型效用影响较小。
- 会议论文ACL 2026
别破坏事实:基于双重事实护盾的可信RAG水印
提出结合源文档关键术语保护与语义提示的双重事实护盾,显著降低水印造成的知识损坏,同时保留原有安全性与鲁棒性。
- 会议论文ACL 2026
SHARP:面向黑盒越狱的自适应有害类别感知提示生成
提出按有害问题类别生成越狱提示的SHARP,结合两阶段LoRA微调与DPO,提高攻击成功率及跨类别鲁棒性。
- 会议论文ACL 2026
贾维斯还是奥创?计算机操作智能体安全威胁综述
系统梳理计算机操作智能体的安全威胁、防御策略与评测资源,建立分类框架,为漏洞研究和安全部署提供参考。
- 会议论文ACL 2026
评估法条型法律问答的结构感知检索与安全性
以消防法规构建检索与拒答评测,发现图引导检索提升表现,但领域适配模型在缺失关键法条证据时更容易产生幻觉。
- 会议论文ACL 2026
利用句法可预测性的语言学感知大语言模型水印
提出STELA,按词性序列的语言不确定性调整水印强度,无需模型logits即可公开检测,并在英中韩三语实验中提升检测鲁棒性。
- 会议论文ACL 2026
TNT:缓解混合推理模型强化学习中的奖励作弊
利用思考模式答案为非思考回答设置逐题长度限制,约减半用量并提高准确率,非思考回答中的奖励作弊比例低于10%。