全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
针对医疗多模态检索增强生成的知识投毒攻击
提出 M3Att,在文本中注入隐蔽错误信息,并用带扰动的配对图像作为与查询无关的触发器提升检索概率;在五个 LLM 上稳定产生看似合理却错误的诊断。
- 会议论文ACL 2026
NaturalSloth:重新审视针对大模型的拒绝服务攻击
发现无需对抗扰动,看似正常但无意义的自然指令就能诱发过长生成;构建 NaturalSloth 数据集,与越狱技术结合效果更强,并暴露现有防御的不足。
- 会议论文ACL 2026
后门坍缩:通过已知后门聚合消除语言模型中的未知威胁
提出 Locphylax:向已被污染的模型注入已知后门,使未知与已知后门在表示空间聚合,再做恢复微调;平均攻击成功率降至 4.41%,干净精度损失在 0.5% 内。
- 会议论文ACL 2026
如何增强大型推理模型的安全性:一项实证研究
研究用 SFT 提升 LRM 安全:直接蒸馏 DeepSeek-R1 的安全回复效果有限,识别出五类风险模式,修正后显著提升;简短或模板式推理即可达到相近安全性。
- 会议论文ACL 2026
Visual Inception:通过多模态记忆投毒破坏 Agent 推荐系统的长期规划
在用户上传图片中植入触发器,使其作为“休眠特工”留存于长期记忆并劫持后续规划,目标命中率约 85%;提出 CognitiveGuard 防御,将其降至约 10%。
- 会议论文ACL 2026
在潜空间中探测 LLM 的安全鲁棒性
提出 Activation Steering Attack,用 NLL 作为诊断信号探测隐层扰动下安全行为的敏感度,发现最脆弱层不稳定、部分输入在所有层都脆弱,并可累积产生越狱效果。
- 会议论文ACL 2026
USB:面向多模态大模型的全面统一安全评测基准
构建覆盖 61 类风险、四种模态组合的基准,同时评估有害查询漏洞与良性输入过度拒答;测试 22 个 MLLM,发现其在二者间难以平衡,对纯图像和跨模态风险尤其脆弱。
- 会议论文ACL 2026
用表示对比评分重新思考大型视觉语言模型的越狱检测
提出 RCS 框架,在安全关键层学习投影以分离良性与恶意输入,实例化为 MCD 和 KCD;在未见攻击类型的评测协议上达到最优,避免单类检测的过度拒绝。
- 会议论文ACL 2026
CheckMIABench:夯实语言模型成员推断攻击评测基础
利用训练检查点前后的同分布数据构建成员推断基准,避免分布偏移干扰,并在Pythia与OLMo模型上评估六种已有攻击。
- 会议论文ACL 2026
从局部遗忘到大语言模型的涌现失对齐
发现局部领域的拒答遗忘可引发跨领域失对齐,早期层概念相似度与该效应相关,加入少量保留数据训练可大幅恢复对齐。
- 会议论文ACL 2026
大语言模型的选择性片段级遗忘
通过遗忘与保留数据的梯度差异定位词元,再以自一致性生成确定遗忘片段,在两个基准上保持相近遗忘效果并更好保留知识。
- 会议论文ACL 2026
防御针对GraphRAG的知识投毒攻击
提出逐跳监控与局部子图修复方法,剔除受污染的实体和关系并补充必要证据,在多种GraphRAG配置下恢复大量受损性能。
- 会议论文ACL 2026
私有种子与公共大模型:逼真且保护隐私的合成数据生成
以私有文本为种子,在候选选择中加入差分隐私机制,实验显示生成数据兼具较高保真度与隐私保护。
- 会议论文ACL 2026
HauntAttack:当攻击如影随形地嵌入推理
将有害指令嵌入推理题的关键条件,在11个推理模型上实现超过70%的平均攻击成功率,较最强基线最高提升13个百分点。
- 会议论文ACL 2026
重新审视可验证奖励强化学习中的选择题:通过干扰项设计释放潜力
研究选择题训练中的猜测与排除捷径,提出迭代干扰项构建方法,以高质量干扰项抑制奖励作弊并提升训练效果。
- 会议论文ACL 2026
让多模态大模型失明:内容审核中的对抗走私攻击
将有害内容编码为人类可读而模型难识别的视觉形式,构建1700例基准,发现多款领先模型的攻击成功率超过90%。
- 会议论文ACL 2026
打破“可证明安全”:利用低概率消失检测大模型隐写的有限精度痕迹
揭示有限精度运算造成的低概率消失漏洞,并提出采样统计审计方法,可有效检测AC与Meteor隐写,而语义检测器接近随机猜测。
- 会议论文ACL 2026
抓住关键线索:用大模型辅助分类器检测演变中的诈骗电话
以专家定义的稳定语义证据为基础,先识别线索再逻辑判定诈骗,在服务场景变化时比传统基线更稳健、高效。
- 会议论文ACL 2026
超越固定印记:大语言模型水印的自适应窃取
提出结合位置式印记构建与动态攻击视角选择的水印窃取方法,在相同实验条件下显著提升窃取效率。
- 会议论文ACL 2026
FLASH:聚焦层的注意力汇劫持
通过干预浅层注意力汇并结合查询改写与动态解码绕过安全机制,在多个模型上攻击成功率超过77%,平均查询1.53次。
- 会议论文ACL 2026
穿透语言伪装:中文仇恨言论的细粒度毒性抽取
结合俚语词典融合与标签解耦体积标注,减少中文仇恨言论抽取中的语义歧义和标签冲突,在STATE ToxiCN上取得30.09%的Hard-F1。
- 会议论文ACL 2026
面向RAG知识库的知识注入式多比特水印
通过良性知识补全嵌入多比特水印并优化检测查询,在知识筛选、修改、扩充及RAG设置限制下仍能可靠提取水印,保护知识库产权。
- 会议论文ACL 2026
TOXIFRENCH:法语毒性检测基准与思维链微调
构建含53,622条评论的法语毒性数据集,并用动态加权思维链微调提升检测表现,4B模型在该基准上超过GPT-4o和DeepSeek-R1。
- 会议论文ACL 2026
ATAAT:视觉语言动作模型后门的自适应对抗调优
针对视觉语言动作模型后门训练中的梯度干扰,自适应选择梯度解耦策略,在仅5%投毒率下实现超过80%的定向攻击成功率。