全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文ACL 2026
通过意图引导安全推理缓解多模态模型的安全上下文遗忘
发现模型可能识别视觉风险却在推理中忽略安全约束,提出意图引导防御,使防御成功率较基线提升超过62%,同时基本保留任务效用。
- 会议论文ACL 2026
自适应对比解码:缓解大语言模型的过度拒答
提出无需训练的AdaCD,动态调整拒答词元分布,在五个基准上平均降低过度拒答查询的拒答率10.35%,同时略增恶意查询拒答率。
- 会议论文ACL 2026
从模型内部保障安全:利用内部表征检测有害内容
提出SIREN,通过线性探针和自适应层加权构建有害内容检测器,以少250倍的可训练参数超越先进开源护栏,并支持实时流式检测。
- 会议论文ACL 2026
检索增强防御:自适应、可控的大语言模型越狱防范
利用已知攻击案例检索识别恶意意图与越狱策略,无需重训即可更新防御,在降低攻击效果的同时维持较低正常请求拒答率。
- 会议论文ACL 2026
LASA:在语义瓶颈处实现语言无关的安全对齐
将安全对齐锚定于语言无关的中间层语义表征,改善跨语言安全性,使LLaMA模型的平均攻击成功率从24.7%降至2.8%。
- 会议论文ACL 2026
从BERTology看大模型编排:高效单次前向分类探针
复用生成模型的词元与层级隐藏状态进行安全分类,性能可媲美更大专用模型,同时避免独立护栏的显存与延迟开销。
- 会议论文ACL 2026
深度研究的开放域评估与多阶段安全护栏
提出四阶段深度研究护栏及分阶段安全基准,将防御成功率提升16.53个百分点、过度拒答率降至约6%,并改善报告质量。
- 会议论文ACL 2026
用于提示安全的轻量可解释护栏
联合训练提示分类器与解释词标注器,以更小模型在三个数据集的域内外测试中达到或超过现有提示分类与可解释性水平。
- 会议论文ACL 2026
BanHADEX:人类标注解释支持的孟加拉语仇恨检测
构建含19203条评论及人工解释的孟加拉语仇恨检测数据集,实验显示解释引导的LoRA提升了分类表现与解释质量。
- 会议论文ACL 2026
SafeConstellations:任务感知表征引导缓解过度拒答
发现不同任务的跨层表征轨迹具有规律,提出推理时定向调整轨迹的方法,减少过度拒答且对模型效用影响较小。
- 会议论文ACL 2026
别破坏事实:基于双重事实护盾的可信RAG水印
提出结合源文档关键术语保护与语义提示的双重事实护盾,显著降低水印造成的知识损坏,同时保留原有安全性与鲁棒性。
- 会议论文ACL 2026
评估法条型法律问答的结构感知检索与安全性
以消防法规构建检索与拒答评测,发现图引导检索提升表现,但领域适配模型在缺失关键法条证据时更容易产生幻觉。
- 会议论文ACL 2026
利用句法可预测性的语言学感知大语言模型水印
提出STELA,按词性序列的语言不确定性调整水印强度,无需模型logits即可公开检测,并在英中韩三语实验中提升检测鲁棒性。
- 会议论文ACL 2026
基于 SAE 构造低秩子空间的可解释安全对齐
提出 SAILS,用 SAE 解耦出安全子空间来初始化 LoRA,仅更新 0.2% 参数即达最高 99.6% 安全率,优于全参数微调。
- 会议论文ACL 2026
ReasMark:抵御知识蒸馏攻击的推理归属水印
将水印与目标域输入分布绑定并植入可检测的推理长度差,在多种蒸馏设置下优于现有归属验证方法,同时保持任务效用。
- 会议论文ACL 2026
推理结构对推理模型的安全对齐至关重要
指出推理模型的安全风险源于推理结构,提出 AltTrain,仅用 1K 样本做 SFT 改变推理结构即可获得较强安全对齐。
- 会议论文ACL 2026
LLM-VA:通过向量对齐化解越狱与过度拒答的权衡
发现回答向量与良性向量近乎正交,提出以闭式权重更新对齐二者,在 12 个模型上比最佳基线 F1 高 11.45% 且保留 95.92% 效用。
- 会议论文ACL 2026
FlexGuard:面向严格度自适应 LLM 内容审核的连续风险评分
提出 FlexBench 基准并发现现有审核模型跨严格度不一致,进而提出输出连续风险分数的 FlexGuard,提升不同严格度下的鲁棒性。
- 会议论文ACL 2026
同时参考判例与法条:案例增强的审慎对齐用于 LLM 安全
发现案例增强的简化规则比详尽安全规则更稳健,并提出 CADA,用强化学习提升无害性与抗攻击性、减少过度拒答。
- 会议论文ACL 2026
用序列级风险累积校准推理时对齐
提出 SEAT,以奖励引导的分支解码和序列级风险监控防御越狱,同时减少对良性内容的过度拒答,在四个攻击基准上优于八个基线。
- 会议论文ACL 2026
JPU:通过 on-policy 路径修正连接越狱防御与遗忘学习
发现越狱主要激活中间层未被擦除的参数并形成动态越狱路径,提出 JPU 挖掘 on-policy 对抗样本修正路径,提升对动态攻击的抵抗力并保持效用。
- 会议论文ACL 2026
UMMF:基于遗忘学习的多模态记忆指纹保护 LVLM 版权
通过遗忘训练样本的邻近样本制造泛化差区域,以记忆强度差异作为隐式指纹验证 LVLM 所有权,比固定触发器更隐蔽、更稳健。
- 会议论文ACL 2026
针对提示攻击的防御学到的是表面启发式
发现微调式提示注入防御依赖位置、触发词和话题等表面相关性,导致良性输入被大量误拒,并提供诊断数据集与系统评测。
- 会议论文ACL 2026
遗忘者会说谎:评估并改进 LLM 遗忘中的诚实性
定义遗忘诚实性并建立评测指标,发现 9 种现有方法均不达标,提出 ReVa 表征对齐方法,拒答率近乎翻倍并提升保留集诚实性。