全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
MIND:零样本有害模因检测的多智能体框架
结合相似模因检索、双向洞察提取与多智能体辩论,无需标注数据即可检测有害模因,在三个数据集上优于现有零样本方法。
- 会议论文ACL 2025
从权衡到协同:大语言模型的通用共生水印框架
结合基于 logits 与采样的水印方案,利用词元熵和语义熵自适应嵌入水印,在可检测性、鲁棒性、文本质量和安全性的综合表现上优于基线。
- 会议论文ACL 2025
当心你的 Po!评估与缓解角色扮演微调的安全风险
评估95个角色模型,发现角色扮演微调会削弱安全性且风险随角色特征变化;提出 SaRFT,在多模型及两类微调设置下优于基线。
- 会议论文ACL 2025
可靠约束误报率:多尺度共形预测的零样本文本检测
提出多尺度共形预测检测框架及 RealDet 数据集,在约束机器生成文本检测误报率的同时,提升检测性能与对抗攻击鲁棒性。
- 会议论文ACL 2025
通过知识偏好优化增强蛋白质生成的安全可控性
提出结合蛋白质安全知识图谱与强化学习的 KPO,在保持较高功能性的同时,降低模型生成有害蛋白质序列的概率。
- 会议论文ACL 2025
SINCon:缓解谣言检测中的模型生成恶意消息注入
通过对比学习均衡传播树各节点对预测的影响,在 Twitter 和微博数据上保持干净数据分类准确率,并增强对模型生成消息注入的抵抗力。
- 会议论文ACL 2025
HiddenDetect:监控隐藏状态检测多模态模型越狱
发现视觉语言模型处理不安全提示时存在特定激活模式,据此提出无需微调的 HiddenDetect,越狱检测效果优于现有先进方法。
- 会议论文ACL 2025
Chinese SafetyQA:中文安全知识短答事实性基准
构建中文安全知识短答基准,评估模型对法律、政策与伦理等知识的事实性,并分析其与检索增强生成能力和抗攻击鲁棒性的关系。
- 会议论文ACL 2025
AGD:基于对抗博弈的大语言模型越狱防御
通过对抗博弈动态调整内部表征以平衡有用性与无害性,并结合专家模型辅助采样,实验中安全性优于所有基线。
- 会议论文ACL 2025
根源防御策略:在解码层面保障大语言模型安全
利用模型识别已生成危险内容的能力,逐步修正有害输出并结合推测解码,在保持帮助性与推理速度的同时提升安全性。
- 会议论文ACL 2025
自适应解毒:基于毒性感知知识编辑保护 LLM 通用能力
提出 ToxEdit,在前向传播中检测毒性激活并走自适应层间通路,在解毒效果和保留通用能力上均优于现有知识编辑方法。
- 会议论文ACL 2025
SafeRoute:为高效且准确的 LLM 安全护栏自适应选择模型
用二分类路由器区分难易样本,仅对难例调用大型安全护栏模型,在多个基准上改善了计算成本与安全性能的权衡。
- 会议论文ACL 2025
面向 EaaS 的鲁棒且低侵入的水印方法
针对嵌入即服务易受模型提取攻击的问题,提出 ESpeW 为每个嵌入注入独特水印,对嵌入影响低于 1%,并能抵御水印移除攻击。
- 会议论文ACL 2025
面向鲁棒 LLM 对齐的对抗偏好学习
提出 APL,用内在偏好概率度量有害性并以条件生成攻击器迭代对抗训练,Mistral-7B 有害输出从 5.88% 降至 0.43%,效用基本保持。
- 会议论文ACL 2025
迈向 LLM 安全推理:用多智能体协商生成嵌入策略的思维链数据
提出 AIDSAFE,用多智能体迭代协商生成含安全策略的 CoT 数据;据此微调开源 LLM 可提升安全泛化与越狱鲁棒性,同时保持可接受的效用。
- 会议论文ACL 2025
SafeChain:长思维链推理语言模型的安全性
在 StrongReject 与 WildJailbreak 上评测 13 个推理模型,发现其安全性不及推理能力;提出 CoT 风格安全训练数据集 SafeChain,微调后提升安全且保持推理性能。
- 会议论文ACL 2025
DIESEL:轻量级的语言模型推理时安全增强
提出 DIESEL,在生成时按与预设负面概念的语义相似度重排候选 token,无需微调即可过滤有害内容,并在对抗越狱场景中有效。
- 会议论文ACL 2025
COVER:LLM 中上下文驱动的过度拒答验证
提出上下文驱动过度拒答概念及两阶段评估框架 COVER,发现拒答率随任务、系统提示、模型家族和检索文档数变化,翻译与摘要任务拒答率尤其高。
- 会议论文ACL 2025
VSCBench:弥合视觉语言模型安全校准的差距
提出同时衡量欠安全与过度安全的安全校准概念,构建 3,600 对图文数据集评测 11 个 VLM,发现校准改进方法会损害模型效用。
- 会议论文ACL 2025
揭示并缓解视觉语言模型的安全对齐退化
发现引入视觉模态造成表示偏移而导致安全对齐退化,提出推理时干预方法 CMRM,将 LLaVA-7B 的不安全率从 61.53% 降至 3.15%。
- 会议论文ACL 2025
防御提示补丁:稳健且可泛化的大模型越狱防御
提出后缀提示防御DPP,在两个模型上显著降低标准及自适应越狱攻击成功率,同时对模型效用影响很小。
- 会议论文ACL 2025
通过自感知护栏增强释放大语言模型的安全潜力
针对模型能识别越狱却仍生成不安全回答的落差,提出免训练防御SAGE,在所测攻击上平均防御成功率达99%。
- 会议论文ACL 2025
分层安全再对齐:轻量恢复剪枝视觉语言模型的安全性
发现剪枝会损害视觉语言模型安全性,提出HSR定位安全关键注意力头并恢复相关神经元,在多种剪枝设置下改善安全表现。
- 会议论文ACL 2025
从规避到隐匿:面向 LLM 的隐蔽知识遗忘
提出 MEOW,用离线 LLM 生成的反事实标签微调实现遗忘,无需辅助模型或保留数据,在 ToFU 上遗忘效果更好且更能抵御攻击。