全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
SAME:安全变换引导的安全感知模型编辑
发现连续编辑良性或恶意知识均可能引入安全风险,并通过约束激活与参数更新,减少恶意查询下的不安全回复且保留编辑效果。
- 会议论文ACL 2026
投影去除恶意:基于全局子空间的大模型去毒
GLOSS识别并从前馈网络参数中移除全局有毒子空间,无需大规模重训即可取得领先的去毒效果,同时保留通用能力。
- 会议论文ACL 2026
SWAN:基于抽象意义表示的语义水印
将水印嵌入句子的抽象意义表示以增强改写后的来源验证,在RealNews上使改写文本检测AUC较既有方法最高提升13.9个百分点。
- 会议论文ACL 2026
推理劫持:大语言模型推理对齐的脆弱性
通过注入虚假判断标准而不改变任务目标来操纵模型,在三类文本检测任务中揭示漏洞,并绕过针对目标偏移的防御。
- 会议论文ACL 2026
WildFeedback:利用真实交互与用户反馈对齐大模型
从多轮真实对话中识别用户反馈并自动构建偏好数据,微调后的模型在传统基准与清单引导评估中均更符合用户偏好。
- 会议论文ACL 2026
SSG:用于大模型水印的Logit平衡词表划分
提出将词表划分为Logit平衡子集的SSG方法,提升逐词预测的水印强度下界,并在代码生成与数学推理中改善水印检测。
- 会议论文ACL 2026
聪明的副作用:多模态大模型的多图推理安全风险
提出多图推理安全基准,评测19个模型发现,推理更强的模型可能更易受攻击,部分安全回答实际源于误解或回避。
- 会议论文ACL 2026
ProMedical:显式注入细粒度临床标准的医疗对齐
以临床细粒度标准训练多维奖励模型,分离安全约束与通用能力,使Qwen3-8B的准确率和安全合规性分别提升22.3%和21.7%。
- 会议论文ACL 2026
从TDMA到CDMA:扩散语言模型的多比特水印
提出面向扩散语言模型的CDMArk,将完整水印信息分散编码到所有词元,在不可感知性与有效性的权衡上取得领先结果。
- 会议论文ACL 2026
超越静态基准:基于角色模拟合成有害内容进行稳健评测
利用角色设定引导智能体合成有害互动,生成场景比现有基准更难被检测,且语言与主题多样性接近人工数据集。
- 会议论文ACL 2026
通过推理时激活能量缓解对齐大语言模型的过度拒答
提出能量景观引导方法,以外部能量模型动态干预隐藏状态,将ORB-H上的请求遵从率从57.3%提高至82.6%,同时保持基线安全性。
- 会议论文ACL 2026
背景也重要:针对医疗视觉语言模型的可迁移攻击
提出MedFocusLeak,在非诊断背景区域施加难以察觉的扰动以转移注意力,在六类医学影像上诱导错误但临床上看似合理的诊断。
- 会议论文ACL 2026
上下文学习中的涌现失对齐:狭窄示例引发广泛偏离
四个模型家族中,狭窄领域的上下文示例可诱发无关良性问题上的失对齐;16个示例对应1%至24%的发生率,扩大规模不能可靠防护。
- 会议论文ACL 2026
当效率成为弱点:针对网页智能体的计算成本攻击
提出CostBomb,通过网页提示注入诱发冗长推理;黑盒实验表明,攻击可在不妨碍任务完成的情况下显著增加智能体计算成本。
- 会议论文ACL 2026
多模态大语言模型视频训练数据的黑盒成员推断攻击
提出VideoMIA,利用跨帧时序依赖识别特定视频是否参与训练,在十个模型和四个基准的黑盒评测中持续优于基线。
- 会议论文ACL 2026
通过意图引导安全推理缓解多模态模型的安全上下文遗忘
发现模型可能识别视觉风险却在推理中忽略安全约束,提出意图引导防御,使防御成功率较基线提升超过62%,同时基本保留任务效用。
- 会议论文ACL 2026
自适应对比解码:缓解大语言模型的过度拒答
提出无需训练的AdaCD,动态调整拒答词元分布,在五个基准上平均降低过度拒答查询的拒答率10.35%,同时略增恶意查询拒答率。
- 会议论文ACL 2026
ConsistRM:以一致性感知自训练改进生成式奖励模型
提出无需人工标注的奖励模型自训练框架,通过答案与评语一致性奖励稳定训练,平均优于普通强化微调1.5%,并缓解位置偏差。
- 会议论文ACL 2026
对抗性生成干扰下的大语言模型稳健成员推断
发现生成文本会使现有成员推断误判,提出融合成员推断特征与生成文本检测器的混合专家框架,在对抗样本下保持接近未受攻击时的性能。
- 会议论文ACL 2026
ASTRA:自动发现、检索与演化大模型越狱策略
提出攻击、评估、提炼与复用的闭环框架,以三级策略库积累有效经验并规避已知失败,在黑盒越狱实验中显著优于现有基线。
- 会议论文ACL 2026
从模型内部保障安全:利用内部表征检测有害内容
提出SIREN,通过线性探针和自适应层加权构建有害内容检测器,以少250倍的可训练参数超越先进开源护栏,并支持实时流式检测。
- 会议论文ACL 2026
解码式遗忘:通过熵引导推理抑制事实知识
提出无需训练的SEGUE,以探针识别待遗忘概念并用熵引导解码抑制目标知识,在版权、实体与风险知识基准上兼顾知识抑制和生成质量。
- 会议论文ACL 2026
CAP:面向大语言模型遗忘的可控对齐提示
通过强化学习优化提示,在不修改模型参数的情况下抑制目标知识并保留通用能力,撤销提示即可恢复知识访问。
- 会议论文ACL 2026
HarDBench:草稿协作写作越狱攻击基准
构建草稿协作写作越狱基准,发现现有模型易生成有害续写,并通过偏好优化减少有害输出而不损害协作写作能力。