全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
感到不安全就拒答:通过解耦拒答训练提升大模型安全性
针对拒答位置偏差,训练模型在生成任意位置从有害内容转向拒答,在两类模型的六种攻击场景中改善安全性且不损害性能。
- 会议论文ACL 2025
定位安全关键奇异向量,改进大语言模型安全训练
定位安全关键奇异向量并据此初始化LoRA,将训练更新限制在安全相关参数中,实验表明可保持防御效果并减轻通用能力损失。
- 会议论文ACL 2025
高效识别混合来源文本中的水印片段
为识别合成文本滥用,提出几何覆盖检测与自适应在线定位方法,在三种水印技术上更准确地检测并定位混合文本中的水印片段。
- 会议论文ACL 2025
学习改写:可泛化的大语言模型生成文本检测
通过训练放大模型改写人类与机器文本时的编辑距离差异,实现生成文本检测,并在跨域及对抗攻击测试中优于现有检测方法。
- 会议论文ACL 2025
大语言模型水印:一种无偏且低风险的方法
提出STA-1水印,在期望上保持原始词元分布,降低低熵场景的输出质量风险,并实现无需提示或白盒模型、对多种攻击稳健的高效检测。
- 会议论文ACL 2025
利用大语言模型重排序减少社交平台有害内容暴露
利用大模型零样本与少样本重排序降低有害内容暴露,并提出两项评测指标,在三个数据集上的实验优于现有专有审核方法。
- 会议论文ACL 2025
DiffuseDef:通过迭代去噪增强对抗攻击鲁棒性
在编码器与分类器之间加入扩散去噪层,结合对抗训练、迭代去噪和集成,在常见黑盒与白盒文本攻击下取得领先防御表现。
- 会议论文ACL 2025
MIND:零样本有害模因检测的多智能体框架
结合相似模因检索、双向洞察提取与多智能体辩论,无需标注数据即可检测有害模因,在三个数据集上优于现有零样本方法。
- 会议论文ACL 2025
从权衡到协同:大语言模型的通用共生水印框架
结合基于 logits 与采样的水印方案,利用词元熵和语义熵自适应嵌入水印,在可检测性、鲁棒性、文本质量和安全性的综合表现上优于基线。
- 会议论文ACL 2025
当心你的 Po!评估与缓解角色扮演微调的安全风险
评估95个角色模型,发现角色扮演微调会削弱安全性且风险随角色特征变化;提出 SaRFT,在多模型及两类微调设置下优于基线。
- 会议论文ACL 2025
可靠约束误报率:多尺度共形预测的零样本文本检测
提出多尺度共形预测检测框架及 RealDet 数据集,在约束机器生成文本检测误报率的同时,提升检测性能与对抗攻击鲁棒性。
- 会议论文ACL 2025
通过知识偏好优化增强蛋白质生成的安全可控性
提出结合蛋白质安全知识图谱与强化学习的 KPO,在保持较高功能性的同时,降低模型生成有害蛋白质序列的概率。
- 会议论文ACL 2025
SINCon:缓解谣言检测中的模型生成恶意消息注入
通过对比学习均衡传播树各节点对预测的影响,在 Twitter 和微博数据上保持干净数据分类准确率,并增强对模型生成消息注入的抵抗力。
- 会议论文ACL 2025
HiddenDetect:监控隐藏状态检测多模态模型越狱
发现视觉语言模型处理不安全提示时存在特定激活模式,据此提出无需微调的 HiddenDetect,越狱检测效果优于现有先进方法。
- 会议论文ACL 2025
Chinese SafetyQA:中文安全知识短答事实性基准
构建中文安全知识短答基准,评估模型对法律、政策与伦理等知识的事实性,并分析其与检索增强生成能力和抗攻击鲁棒性的关系。
- 会议论文ACL 2025
AGD:基于对抗博弈的大语言模型越狱防御
通过对抗博弈动态调整内部表征以平衡有用性与无害性,并结合专家模型辅助采样,实验中安全性优于所有基线。
- 会议论文ACL 2025
根源防御策略:在解码层面保障大语言模型安全
利用模型识别已生成危险内容的能力,逐步修正有害输出并结合推测解码,在保持帮助性与推理速度的同时提升安全性。
- 会议论文ACL 2025
自适应解毒:基于毒性感知知识编辑保护 LLM 通用能力
提出 ToxEdit,在前向传播中检测毒性激活并走自适应层间通路,在解毒效果和保留通用能力上均优于现有知识编辑方法。
- 会议论文ACL 2025
SafeRoute:为高效且准确的 LLM 安全护栏自适应选择模型
用二分类路由器区分难易样本,仅对难例调用大型安全护栏模型,在多个基准上改善了计算成本与安全性能的权衡。
- 会议论文ACL 2025
面向 EaaS 的鲁棒且低侵入的水印方法
针对嵌入即服务易受模型提取攻击的问题,提出 ESpeW 为每个嵌入注入独特水印,对嵌入影响低于 1%,并能抵御水印移除攻击。
- 会议论文ACL 2025
面向鲁棒 LLM 对齐的对抗偏好学习
提出 APL,用内在偏好概率度量有害性并以条件生成攻击器迭代对抗训练,Mistral-7B 有害输出从 5.88% 降至 0.43%,效用基本保持。
- 会议论文ACL 2025
迈向 LLM 安全推理:用多智能体协商生成嵌入策略的思维链数据
提出 AIDSAFE,用多智能体迭代协商生成含安全策略的 CoT 数据;据此微调开源 LLM 可提升安全泛化与越狱鲁棒性,同时保持可接受的效用。
- 会议论文ACL 2025
SafeChain:长思维链推理语言模型的安全性
在 StrongReject 与 WildJailbreak 上评测 13 个推理模型,发现其安全性不及推理能力;提出 CoT 风格安全训练数据集 SafeChain,微调后提升安全且保持推理性能。
- 会议论文ACL 2025
DIESEL:轻量级的语言模型推理时安全增强
提出 DIESEL,在生成时按与预设负面概念的语义相似度重排候选 token,无需微调即可过滤有害内容,并在对抗越狱场景中有效。