全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2026
VOID:击败潜在扩散模型中的未授权模仿
通过放大潜在编码误差并抵消目标引导信号,使受保护图像在扩散生成中语义被破坏,在24种防御、10种模仿攻击上显著优于现有方法。
- 会议论文USENIX Security 2026
提升深度伪造图像检测器的鲁棒性
利用高阶频域统计、噪声残差与补丁级语义破坏,无需对抗训练数据即可提升检测器抗攻击能力;召回下降最多减少 88.9%。
- 会议论文USENIX Security 2026
SafeAdapt:面向大型推理模型的自适应思考分配安全对齐
发现安全思考并非越长越安全,过度与不足思考都会增加风险;提出按提示难度动态分配思考预算的 SafeAdapt,在多个对抗基准上提升安全性。
- 会议论文USENIX Security 2026
通过上下文知识注入保护检索增强代码生成:以嵌入式 IoT 应用为例
IoTRAGuarder 构建版本感知的安全知识库并在生成时注入约束,在 44 个 Zephyr 任务上将安全成功率从 5.11% 提升到 78.41%。
- 会议论文USENIX Security 2026
GoodVibe:面向 LLM 代码生成的默认安全
通过梯度归因定位安全相关神经元并只微调这一子空间;在六个 LLM 上安全性最高提升 2.5 倍,可训练参数比全量微调少 4700 倍以上。
- 会议论文USENIX Security 2026
APEX:零样本、与补丁无关的对抗补丁防御框架
通过定位补丁区域并用结构引导修复还原图像;在多数据集及物理场景中可防御多种对抗补丁,且对光照等环境保持鲁棒。
- 会议论文USENIX Security 2026
基于 LDPC 的伪随机纠错码密码分析
首次对用于生成模型不可检测水印的 PRC 做密码分析,提出三种攻击并在 DeepSeek、Stable Diffusion 上验证,同时给出三项防御建议。
- 会议论文USENIX Security 2026
ORPHEUS:抗音源分离的歌声转换主动防御
针对攻击者先分离人声再做歌声转换的场景,联合干扰分离模型与说话人编码器;比最佳基线进一步降低身份相似度 5.61%–8.02%。
- 会议论文USENIX Security 2026
面向大语言模型的失真最小化水印框架:更大容量、更强鲁棒、更高质量
将鲁棒性与质量建模为失真代价,用 PO-STC 统一优化水印;在强改写攻击下匹配率比最佳基线最高提升 46.35%。
- 会议论文USENIX Security 2026
通过流形轨迹动力学防御 LLM 越狱攻击
提出 MTK,跟踪提示邻域结构随层深的演化来检测越狱,在四个 LLM、十种攻击上有效,自适应攻击下平均 TPR 为 85%。
- 会议论文ACL 2025
改进大语言模型的无偏水印
提出多通道无偏水印MCmark,在保持原始生成分布的同时提升鲁棒性,实验中可检测性较现有最佳无偏水印提高超过10%。
- 会议论文ACL 2025
K/DA:韩语隐性冒犯语言去毒的自动数据生成流程
提出自动生成含隐性冒犯与流行俚语的配对数据流程,生成数据具有较高配对一致性,并支持通过简单指令微调训练高性能去毒模型。
- 会议论文ACL 2025
LED-Merging:缓解模型合并中的安全与效用冲突
通过神经元定位、筛选与冲突更新隔离改进模型合并,在Llama-3-8B-Instruct上将有害响应率降低31.4%,保留95%的效用表现。
- 会议论文ACL 2025
XDAC:可解释AI驱动的韩语模型生成新闻评论检测与归因
为防范舆论操纵,构建大规模韩语评论数据集并提出可解释检测框架,模型生成评论检测与来源归因的F1分别达98.5%和84.3%。
- 会议论文ACL 2025
WET:用线性变换水印抵御嵌入服务中的改写攻击
发现攻击者克隆嵌入服务时可通过改写移除现有水印,提出线性变换水印,并从理论和实验上验证其对改写攻击的鲁棒性。
- 会议论文ACL 2025
通过表征弯折提升大语言模型安全性
提出RepBend,将激活引导融入微调损失以破坏有害行为表征,在多种越狱基准上将攻击成功率最高降低95%,通用能力损失可忽略。
- 会议论文ACL 2025
塑造安全边界:理解并防御大语言模型越狱
发现越狱使有害激活越出安全边界,并提出激活边界防御 ABD,平均防御成功率超过98%,通用能力影响低于2%。
- 会议论文ACL 2025
通过受约束知识遗忘实现安全对齐
提出 CKU,定位并保护有用知识相关神经元,在遗忘有害知识时裁剪其梯度,实验显示可在保持总体性能的同时提升安全性。
- 会议论文ACL 2025
用于可控生成的对比困惑度:大语言模型去毒应用
通过对抗改写构造有毒难负例,以基于原型的对比困惑度目标微调模型,减少有毒生成并保持常识推理与阅读理解表现。
- 会议论文ACL 2025
让机器去拟人化:缓解文本生成系统的拟人行为
针对拟人输出可能引发的过度依赖和情感依赖,结合文献与众包编辑整理干预措施,并提出分类与评估干预的概念框架。
- 会议论文ACL 2025
HumT DumT:测量与控制大语言模型的拟人语言
提出拟人语气指标 HumT,发现用户在许多情境中偏好较少拟人的输出,并以 DumT 在保持性能的同时降低拟人语气。
- 会议论文ACL 2025
MTSA:通过多轮红队实现大语言模型多轮安全对齐
提出多轮安全对齐框架,以思路引导攻击学习、攻防迭代和未来奖励强化学习训练模型,同时提升红队攻击能力与目标模型安全表现。
- 会议论文ACL 2025
风暴中的沙堡:重新审视强水印的可能性
通过大规模实验与人工审核检验随机游走去水印攻击,发现混合缓慢且质量判别不可靠,人工审核后的去除成功率仅为10%。
- 会议论文ACL 2025
大语言模型的集成水印
将藏头、感觉运动规范与红绿水印组合,检测率达到98%,改写攻击后仍为95%,高于单独红绿水印的49%。