全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
DELMAN:用模型编辑动态防御 LLM 越狱
通过直接编辑少量相关参数并加 KL 正则,在保持通用能力的同时抑制越狱,并能适应新的攻击实例。
- 会议论文ACL 2025
DeTAM:通过定向注意力修改防御 LLM 越狱
找出对越狱敏感的注意力头,推理时重新分配注意力以突出用户核心意图,无需微调,对不同攻击和模型泛化良好,并兼顾过度防御。
- 会议论文ACL 2025
基于 Growth Bound Matrix 兼顾鲁棒性与泛化以抵御词替换攻击
提出 GBM 正则化,面向 LSTM、S4 与 CNN 降低输入扰动影响,对抗鲁棒性比基线最多提升 8.8%,并首次系统分析 S4 的鲁棒性。
- 会议论文ACL 2025
遗忘 Token 与像素:重新思考多模态生成模型概念遗忘中的梯度上升
发现全局梯度上升会同时损伤自然知识导致效用崩塌,提出 FTTP 仅对目标概念知识做梯度上升,无需保留集,遗忘与效用权衡更优。
- 会议论文ACL 2025
AIGuard:电商 AIGC 风险检测基准与轻量检测方法
构建含 253,420 个图文对的电商 AIGC 风险基准,并提出软提示匹配检测,召回率比主流多模态模型高 9.68%,推理快 37.8 倍。
- 会议论文ACL 2025
ThinkGuard:深思慢想带来更审慎的护栏
提出带批判生成的护栏模型 ThinkGuard,从大模型蒸馏结构化批判,在多个安全基准上平均 F1 最高,相比 LLaMA Guard 3 准确率提升 16.1%。
- 会议论文ACL 2025
SafeEraser:通过多模态机器遗忘增强 MLLM 安全
构建含 3,000 图像、28.8K VQA 对的安全遗忘基准,发现现有方法易过度遗忘;提出 Prompt Decouple Loss,使 LLaVA 的 SARR 指标下降 79.5%。
- 会议论文ACL 2025
超越表层模式:基于攻击本质的越狱防御框架
提出即插即用的输入过滤框架 EDDF,从已知攻击中提取“攻击本质”建向量库并在线检测,使攻击成功率至少降低 20%。
- 会议论文ACL 2025
黑暗的崛起:角色扮演对话 Agent 中的安全与效用权衡
发现反派角色与用户提问的“风险耦合”造成安全-效用权衡,提出 ADMP 方法动态调整偏好并引入 CMS,提升安全指标且保持效用。
- 会议论文ACL 2025
ShieldHead:面向大语言模型的解码时安全防护
在对话模型末层隐状态上训练轻量分类头实现流式有害内容检测,在 XSTest 和 SafeRLHF 上达到 SOTA,速度比 LLM 审核模型快约 300 倍。
- 会议论文ACL 2025
大语言模型虚假信息的主动防御策略综述
提出知识可信度、推理可靠性、输入鲁棒性三支柱框架,综述并元分析显示主动防御比传统方法在虚假信息预防上最多提升 63%。
- 会议论文ACL 2025
安全不止于拒答:面向可解释 LLM 安全的推理增强微调
提出 RATIONAL,训练模型在回答前进行显式安全推理,使其在拒绝有害提示的同时给出符合语境的回答,以应对越狱攻击。
- 会议论文ACM CCS 2025
重新思考图像生成模型中的机器遗忘
- 会议论文ACM CCS 2025
Sylva:通过协同微调为预训练模型定制个性化对抗防御
- 会议论文ACM CCS 2025
RAG-WM:面向大模型检索增强生成的高效黑盒水印方法
- 会议论文ACM CCS 2025
像分析二进制一样分析 PDF:基于中间表示和语言模型的对抗鲁棒 PDF 恶意软件分析
- 会议论文ACM CCS 2025
SafeGuider:面向文生图模型的鲁棒实用内容安全控制
- 会议论文ACM CCS 2025
给 LLM 上安全课:通过知识注入保障检索增强代码生成的安全
- 会议论文ACM CCS 2025
通过原像合成与属性细化对深度神经网络缺陷进行可证明修复
- 会议论文ACM CCS 2025
UnsafeBench:在真实与 AI 生成图像上评测图像安全分类器
- 会议论文ACM CCS 2025
k 近邻的精确鲁棒性认证
- 会议论文ACM CCS 2025
加固深度神经网络二进制以抵御逆向工程攻击
- 会议论文ACM CCS 2025
面向加壳可执行文件检测的对抗鲁棒汇编语言模型
- 会议论文ACM CCS 2025
YouthSafe:面向青少年的 LLM 安全基准与防护模型