全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
VSCBench:弥合视觉语言模型安全校准的差距
提出同时衡量欠安全与过度安全的安全校准概念,构建 3,600 对图文数据集评测 11 个 VLM,发现校准改进方法会损害模型效用。
- 会议论文ACL 2025
揭示并缓解视觉语言模型的安全对齐退化
发现引入视觉模态造成表示偏移而导致安全对齐退化,提出推理时干预方法 CMRM,将 LLaVA-7B 的不安全率从 61.53% 降至 3.15%。
- 会议论文ACL 2025
防御提示补丁:稳健且可泛化的大模型越狱防御
提出后缀提示防御DPP,在两个模型上显著降低标准及自适应越狱攻击成功率,同时对模型效用影响很小。
- 会议论文ACL 2025
通过自感知护栏增强释放大语言模型的安全潜力
针对模型能识别越狱却仍生成不安全回答的落差,提出免训练防御SAGE,在所测攻击上平均防御成功率达99%。
- 会议论文ACL 2025
分层安全再对齐:轻量恢复剪枝视觉语言模型的安全性
发现剪枝会损害视觉语言模型安全性,提出HSR定位安全关键注意力头并恢复相关神经元,在多种剪枝设置下改善安全表现。
- 会议论文ACL 2025
从规避到隐匿:面向 LLM 的隐蔽知识遗忘
提出 MEOW,用离线 LLM 生成的反事实标签微调实现遗忘,无需辅助模型或保留数据,在 ToFU 上遗忘效果更好且更能抵御攻击。
- 会议论文ACL 2025
DELMAN:用模型编辑动态防御 LLM 越狱
通过直接编辑少量相关参数并加 KL 正则,在保持通用能力的同时抑制越狱,并能适应新的攻击实例。
- 会议论文ACL 2025
DeTAM:通过定向注意力修改防御 LLM 越狱
找出对越狱敏感的注意力头,推理时重新分配注意力以突出用户核心意图,无需微调,对不同攻击和模型泛化良好,并兼顾过度防御。
- 会议论文ACL 2025
基于 Growth Bound Matrix 兼顾鲁棒性与泛化以抵御词替换攻击
提出 GBM 正则化,面向 LSTM、S4 与 CNN 降低输入扰动影响,对抗鲁棒性比基线最多提升 8.8%,并首次系统分析 S4 的鲁棒性。
- 会议论文ACL 2025
遗忘 Token 与像素:重新思考多模态生成模型概念遗忘中的梯度上升
发现全局梯度上升会同时损伤自然知识导致效用崩塌,提出 FTTP 仅对目标概念知识做梯度上升,无需保留集,遗忘与效用权衡更优。
- 会议论文ACL 2025
AIGuard:电商 AIGC 风险检测基准与轻量检测方法
构建含 253,420 个图文对的电商 AIGC 风险基准,并提出软提示匹配检测,召回率比主流多模态模型高 9.68%,推理快 37.8 倍。
- 会议论文ACL 2025
ThinkGuard:深思慢想带来更审慎的护栏
提出带批判生成的护栏模型 ThinkGuard,从大模型蒸馏结构化批判,在多个安全基准上平均 F1 最高,相比 LLaMA Guard 3 准确率提升 16.1%。
- 会议论文ACL 2025
SafeEraser:通过多模态机器遗忘增强 MLLM 安全
构建含 3,000 图像、28.8K VQA 对的安全遗忘基准,发现现有方法易过度遗忘;提出 Prompt Decouple Loss,使 LLaVA 的 SARR 指标下降 79.5%。
- 会议论文ACL 2025
超越表层模式:基于攻击本质的越狱防御框架
提出即插即用的输入过滤框架 EDDF,从已知攻击中提取“攻击本质”建向量库并在线检测,使攻击成功率至少降低 20%。
- 会议论文ACL 2025
黑暗的崛起:角色扮演对话 Agent 中的安全与效用权衡
发现反派角色与用户提问的“风险耦合”造成安全-效用权衡,提出 ADMP 方法动态调整偏好并引入 CMS,提升安全指标且保持效用。
- 会议论文ACL 2025
ShieldHead:面向大语言模型的解码时安全防护
在对话模型末层隐状态上训练轻量分类头实现流式有害内容检测,在 XSTest 和 SafeRLHF 上达到 SOTA,速度比 LLM 审核模型快约 300 倍。
- 会议论文ACL 2025
大语言模型虚假信息的主动防御策略综述
提出知识可信度、推理可靠性、输入鲁棒性三支柱框架,综述并元分析显示主动防御比传统方法在虚假信息预防上最多提升 63%。
- 会议论文ACL 2025
安全不止于拒答:面向可解释 LLM 安全的推理增强微调
提出 RATIONAL,训练模型在回答前进行显式安全推理,使其在拒绝有害提示的同时给出符合语境的回答,以应对越狱攻击。
- 会议论文ACM CCS 2025
重新思考图像生成模型中的机器遗忘
- 会议论文ACM CCS 2025
Sylva:通过协同微调为预训练模型定制个性化对抗防御
- 会议论文ACM CCS 2025
RAG-WM:面向大模型检索增强生成的高效黑盒水印方法
- 会议论文ACM CCS 2025
像分析二进制一样分析 PDF:基于中间表示和语言模型的对抗鲁棒 PDF 恶意软件分析
- 会议论文ACM CCS 2025
SafeGuider:面向文生图模型的鲁棒实用内容安全控制
- 会议论文ACM CCS 2025
给 LLM 上安全课:通过知识注入保障检索增强代码生成的安全