全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2026
面向大语言模型的失真最小化水印框架:更大容量、更强鲁棒、更高质量
将鲁棒性与质量建模为失真代价,用 PO-STC 统一优化水印;在强改写攻击下匹配率比最佳基线最高提升 46.35%。
- 会议论文USENIX Security 2026
通过流形轨迹动力学防御 LLM 越狱攻击
提出 MTK,跟踪提示邻域结构随层深的演化来检测越狱,在四个 LLM、十种攻击上有效,自适应攻击下平均 TPR 为 85%。
- 会议论文ACL 2025
改进大语言模型的无偏水印
提出多通道无偏水印MCmark,在保持原始生成分布的同时提升鲁棒性,实验中可检测性较现有最佳无偏水印提高超过10%。
- 会议论文ACL 2025
K/DA:韩语隐性冒犯语言去毒的自动数据生成流程
提出自动生成含隐性冒犯与流行俚语的配对数据流程,生成数据具有较高配对一致性,并支持通过简单指令微调训练高性能去毒模型。
- 会议论文ACL 2025
LED-Merging:缓解模型合并中的安全与效用冲突
通过神经元定位、筛选与冲突更新隔离改进模型合并,在Llama-3-8B-Instruct上将有害响应率降低31.4%,保留95%的效用表现。
- 会议论文ACL 2025
XDAC:可解释AI驱动的韩语模型生成新闻评论检测与归因
为防范舆论操纵,构建大规模韩语评论数据集并提出可解释检测框架,模型生成评论检测与来源归因的F1分别达98.5%和84.3%。
- 会议论文ACL 2025
WET:用线性变换水印抵御嵌入服务中的改写攻击
发现攻击者克隆嵌入服务时可通过改写移除现有水印,提出线性变换水印,并从理论和实验上验证其对改写攻击的鲁棒性。
- 会议论文ACL 2025
通过表征弯折提升大语言模型安全性
提出RepBend,将激活引导融入微调损失以破坏有害行为表征,在多种越狱基准上将攻击成功率最高降低95%,通用能力损失可忽略。
- 会议论文ACL 2025
塑造安全边界:理解并防御大语言模型越狱
发现越狱使有害激活越出安全边界,并提出激活边界防御 ABD,平均防御成功率超过98%,通用能力影响低于2%。
- 会议论文ACL 2025
通过受约束知识遗忘实现安全对齐
提出 CKU,定位并保护有用知识相关神经元,在遗忘有害知识时裁剪其梯度,实验显示可在保持总体性能的同时提升安全性。
- 会议论文ACL 2025
用于可控生成的对比困惑度:大语言模型去毒应用
通过对抗改写构造有毒难负例,以基于原型的对比困惑度目标微调模型,减少有毒生成并保持常识推理与阅读理解表现。
- 会议论文ACL 2025
让机器去拟人化:缓解文本生成系统的拟人行为
针对拟人输出可能引发的过度依赖和情感依赖,结合文献与众包编辑整理干预措施,并提出分类与评估干预的概念框架。
- 会议论文ACL 2025
HumT DumT:测量与控制大语言模型的拟人语言
提出拟人语气指标 HumT,发现用户在许多情境中偏好较少拟人的输出,并以 DumT 在保持性能的同时降低拟人语气。
- 会议论文ACL 2025
MTSA:通过多轮红队实现大语言模型多轮安全对齐
提出多轮安全对齐框架,以思路引导攻击学习、攻防迭代和未来奖励强化学习训练模型,同时提升红队攻击能力与目标模型安全表现。
- 会议论文ACL 2025
风暴中的沙堡:重新审视强水印的可能性
通过大规模实验与人工审核检验随机游走去水印攻击,发现混合缓慢且质量判别不可靠,人工审核后的去除成功率仅为10%。
- 会议论文ACL 2025
大语言模型的集成水印
将藏头、感觉运动规范与红绿水印组合,检测率达到98%,改写攻击后仍为95%,高于单独红绿水印的49%。
- 会议论文ACL 2025
以攻促防:通过对抗训练保护机器生成文本检测器
提出同步更新攻击器与检测器的GREATER框架,在十种文本扰动和六类对抗攻击中提升检测防御,并增强攻击生成效率。
- 会议论文ACL 2025
感到不安全就拒答:通过解耦拒答训练提升大模型安全性
针对拒答位置偏差,训练模型在生成任意位置从有害内容转向拒答,在两类模型的六种攻击场景中改善安全性且不损害性能。
- 会议论文ACL 2025
定位安全关键奇异向量,改进大语言模型安全训练
定位安全关键奇异向量并据此初始化LoRA,将训练更新限制在安全相关参数中,实验表明可保持防御效果并减轻通用能力损失。
- 会议论文ACL 2025
高效识别混合来源文本中的水印片段
为识别合成文本滥用,提出几何覆盖检测与自适应在线定位方法,在三种水印技术上更准确地检测并定位混合文本中的水印片段。
- 会议论文ACL 2025
学习改写:可泛化的大语言模型生成文本检测
通过训练放大模型改写人类与机器文本时的编辑距离差异,实现生成文本检测,并在跨域及对抗攻击测试中优于现有检测方法。
- 会议论文ACL 2025
大语言模型水印:一种无偏且低风险的方法
提出STA-1水印,在期望上保持原始词元分布,降低低熵场景的输出质量风险,并实现无需提示或白盒模型、对多种攻击稳健的高效检测。
- 会议论文ACL 2025
利用大语言模型重排序减少社交平台有害内容暴露
利用大模型零样本与少样本重排序降低有害内容暴露,并提出两项评测指标,在三个数据集上的实验优于现有专有审核方法。
- 会议论文ACL 2025
DiffuseDef:通过迭代去噪增强对抗攻击鲁棒性
在编码器与分类器之间加入扩散去噪层,结合对抗训练、迭代去噪和集成,在常见黑盒与白盒文本攻击下取得领先防御表现。