全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文ACL 2026
通过推拉式分布对齐保护 LLM 微调安全
提出 Safety Optimal Transport,用最优传输在分布层面把下游数据拉向安全锚点、推离有害参照,以净化微调数据,在安全与效用间取得更好平衡。
- 会议论文ACL 2026
Safe-FedLLM:联邦大语言模型的安全性研究
发现恶意客户端可攻击 FedLLM,且 LoRA 更新的行为模式可被轻量分类器区分,据此提出基于 probe 的三层防御,在高恶意比例下仍有效。
- 会议论文ACL 2026
SafetyMem:基于双组件安全记忆的自适应越狱防御
提出语义与情景双安全记忆,沉淀越狱模式并从检测失败中提炼规则,无需重训即可适应新攻击,显著降低 ASR。
- 会议论文ACL 2026
忘掉重要的,保留其余:信息性 Token 的选择性遗忘
提出基于预测熵的 token 级遗忘正则 ETW,作为对抗有害行为的遗忘手段,在遗忘效果更强的同时更好保持模型效用。
- 会议论文ACL 2026
CrossGuard:保护 MLLM 免受联合模态隐式恶意攻击
用 RL 红队管线 ImpForge 生成隐式多模态样本,训练意图感知护栏 CrossGuard,对显式与隐式攻击防御均优于现有护栏。
- 会议论文ACL 2026
剪除不安全彩票:让 LLM 更安全更稳健的资源高效框架
用无梯度归因找出并剪除与不安全行为相关的参数,在几乎不损失效用的情况下显著减少不安全生成并提升对越狱攻击的鲁棒性。
- 会议论文ACL 2026
TriPlay-RL:面向 LLM 安全对齐的三角色自博弈强化学习
攻击者、防御者、评估者三角色闭环强化学习,几乎无需人工标注;攻击有效性提升 20%–50%,防御安全性提升 10%–30% 且不损害通用推理。
- 会议论文ACL 2026
超越表层检测:基于元操作推理的认知驱动越狱防御
提出 CDD 框架,通过结构化推理链识别掩盖有害意图的元操作,并用熵引导强化学习提升对未见越狱攻击的泛化防御。
- 会议论文ACL 2026
检测查询意图:用 FFN 输出激活监测实现 LLM 安全 steering
以 FFN 输出激活区分有害与良性查询并选择性干预,在多种越狱攻击下达到领先防御效果,同时基本保持良性任务性能。
- 会议论文ACL 2026
DIA-HARM:50 种英语方言下有害内容检测的差异
构建覆盖 50 种方言的虚假信息检测基准,评测 16 个检测模型,发现方言内容使检测性能下降,部分模型严重失效。
- 会议论文ACL 2026
ReasoningGuard:用推理时安全顿悟时刻保护大型推理模型
利用注意力定位推理关键点并注入安全反思,配合采样策略,无需微调即可抵御四类越狱,优于九种现有防护。
- 会议论文ACL 2026
HiddenGuard:基于专用表征路由器的细粒度安全生成
利用隐藏状态做 token 级有害内容检测与遮蔽,不必整体拒答,有害内容检测与遮蔽 F1 超过 90%。
- 会议论文ACL 2026
基于大模型的孟加拉语仇恨言论多任务检测
构建涵盖类型、严重程度与目标的孟加拉语仇恨言论数据集,发现LoRA微调大模型可媲美BanglaBERT,但文化语境预训练仍很重要。
- 会议论文ACL 2026
可审计潜在思维链对齐:化解安全与可审计性困境
ALCA将安全推理移入潜在空间,并通过受限自解码支持审计,相比强基线使自适应越狱成功率降低超过40%,同时保持性能。
- 会议论文ACL 2026
多思少言:将审慎安全推理内化到大模型参数
HIAR通过逐层LoRA更新内化安全推理,无需生成显式安全思维链,相比强基线将越狱攻击成功率降低43%。
- 会议论文ACL 2026
SMARTER:大模型自增强的低数据可解释毒性检测
结合合成解释、偏好优化和跨模型训练,仅使用6%至57%的训练数据,宏平均F1较少样本基线最高提升13%。
- 会议论文ACL 2026
大模型仇恨言论检测中的安全对齐与意识形态偏差
比较政治人设下不同安全约束模型的仇恨言论检测,发现约束较强者更准确且更抗人设影响,但各模型仍存在群体差异和过度自信。
- 会议论文ACL 2026
强化学习引导的分布外有害文本检测自适应调优
提出RLAT,以强化学习控制测试时数据选择和参数更新,缓解持续调优的过拟合,在跨平台与跨时间有害文本检测中优于基线。
- 会议论文ACL 2026
SAME:安全变换引导的安全感知模型编辑
发现连续编辑良性或恶意知识均可能引入安全风险,并通过约束激活与参数更新,减少恶意查询下的不安全回复且保留编辑效果。
- 会议论文ACL 2026
投影去除恶意:基于全局子空间的大模型去毒
GLOSS识别并从前馈网络参数中移除全局有毒子空间,无需大规模重训即可取得领先的去毒效果,同时保留通用能力。
- 会议论文ACL 2026
SWAN:基于抽象意义表示的语义水印
将水印嵌入句子的抽象意义表示以增强改写后的来源验证,在RealNews上使改写文本检测AUC较既有方法最高提升13.9个百分点。
- 会议论文ACL 2026
SSG:用于大模型水印的Logit平衡词表划分
提出将词表划分为Logit平衡子集的SSG方法,提升逐词预测的水印强度下界,并在代码生成与数学推理中改善水印检测。
- 会议论文ACL 2026
从TDMA到CDMA:扩散语言模型的多比特水印
提出面向扩散语言模型的CDMArk,将完整水印信息分散编码到所有词元,在不可感知性与有效性的权衡上取得领先结果。
- 会议论文ACL 2026
通过推理时激活能量缓解对齐大语言模型的过度拒答
提出能量景观引导方法,以外部能量模型动态干预隐藏状态,将ORB-H上的请求遵从率从57.3%提高至82.6%,同时保持基线安全性。