全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NDSS 2025
THEMIS:约束 Textual Inversion 以实现个性化概念审查
向 Textual Inversion 嵌入注入正向后门,使敏感词与嵌入组合时输出预设图像而非有害内容,并可抵御自适应攻击。
- 会议论文NDSS 2025
理解不安全视频生成
构建首个视频生成模型的不安全视频数据集并归纳 5 类不安全内容,提出在采样过程内部工作的防御方法,准确率达 0.90 且资源开销降低 10 倍。
- 会议论文NDSS 2025
VoiceRadar:基于微频率与组成分析的语音深度伪造检测
用多普勒效应和鼓面振动物理模型提取微频率并融入损失函数,在新构建数据集上优于现有方法,可识别 AI 生成语音。
- 会议论文NeurIPS 2025
通过嵌入扭曲缓解文生图扩散模型的色情内容生成
提出 DES,将不安全嵌入映向安全区域并中和 nudity 嵌入,在 FLUX.1 上攻击成功率降至 9.47%,同时保持图像质量。
- 会议论文NeurIPS 2025
人类文本是离群点:用分布外检测识别 LLM 生成文本
将 LLM 生成文本检测重构为 OOD 检测,用单类学习和能量方法,在 DeepFake 数据集达 98.3% AUROC,并在多语言和受攻击场景保持稳健。
- 会议论文NeurIPS 2025
带回溯反馈的强化学习(RLBF)
用 RL 训练 LLM 在发生安全违规时输出“回退 x 个 token”信号并重新生成,降低 GCG 等攻击的成功率且保持模型效用。
- 会议论文NeurIPS 2025
通过拟合自然图像分布检测生成图像
利用自然与生成图像数据流形的几何差异,借助自监督模型损失变化检测生成图像,并用 normalizing flow 放大差异。
- 会议论文NeurIPS 2025
推理作为安全的自适应防御
提出 TARS,用强化学习训练模型以思维链推理安全问题,在歧义查询上多花算力,改善安全与拒答权衡,并增强对 GCG、PAIR 攻击的鲁棒性。
- 会议论文NeurIPS 2025
Semantic Surgery:扩散模型的零样本概念擦除
在扩散前对文本嵌入做校准的向量减法以擦除有害概念,无需重训,在显式内容、风格等擦除任务上优于现有方法,并可兼作威胁检测。
- 会议论文NeurIPS 2025
RespoDiff:面向负责任且忠实的文生图双模块瓶颈变换
在扩散模型瓶颈表示上加入双模块变换,分别负责公平与安全概念和语义对齐,负责任生成效果提升约20%,可用于 SDXL。
- 会议论文NeurIPS 2025
OVERT:文生图模型过度拒答评测基准
构建含 4600 条看似有害实为良性提示的基准,发现主流文生图模型普遍存在过度拒答,提示改写虽可缓解但会损害语义忠实度。
- 会议论文NeurIPS 2025
对抗攻击下鲁棒的神经网络动态低秩压缩
提出带谱正则项的动态低秩训练,在压缩超过 94 的同时恢复或提升对抗精度,不损失干净精度。
- 会议论文NeurIPS 2025
FrameShield:对抗鲁棒的视频异常检测
针对弱监督视频异常检测易受对抗攻击的问题,提出 SRD 伪异常生成方法以降低伪标签噪声,使对抗训练有效,多个基准上平均 AUROC 比现有方法高 71.0%。
- 会议论文NeurIPS 2025
从自然隐空间学习鲁棒的视觉语言模型
提出 CoAPT 协同对抗提示调优,用全变分去除高频扰动并借助预训练 VLM 隐空间恢复特征,在自然泛化、对抗鲁棒性与任务适配间取得更好平衡。
- 会议论文NeurIPS 2025
短长度对抗训练可帮助 LLM 防御长长度越狱攻击
针对对抗后缀越狱,证明用长度 Θ(√M) 的对抗后缀做对抗训练即可防御长度 Θ(M) 的攻击,并在开源 LLM 上实验证实攻击成功率与长度比相关。
- 会议论文NeurIPS 2025
安全预训练:迈向下一代安全 AI
以数据为中心在预训练阶段加入安全过滤、改写、原生拒答和有害标签,使攻击成功率从 38.8% 降至 8.4%,通用任务性能无损。
- 会议论文NeurIPS 2025
语言模型的终身安全对齐
让 Meta-Attacker 持续发现新越狱策略、Defender 对抗训练,Defender 最终将 Meta-Attacker 的成功率压到 7%。
- 会议论文NeurIPS 2025
FALCON:面向 LLM 的对比正交去对齐细粒度激活操控遗忘
提出表示引导的遗忘方法,用对比机制与正交梯度投影去除 LLM 中敏感或有害知识,兼顾遗忘效果与模型效用,并抵抗知识恢复。
- 会议论文NeurIPS 2025
E2E-VGuard:面向生产级 LLM 端到端语音合成的对抗式防护
用编码器集成保护音色、ASR 对抗样本干扰发音,抵御声音克隆欺诈,在 16 个开源合成器和 3 个商业 API 上验证有效。
- 会议论文NeurIPS 2025
有理论保证的 LLM 水印框架:分布自适应方法
联合优化水印方案与检测器,给出最优解并提出无失真的分布自适应算法 DAWA,在极低误报率下检测效果良好。
- 会议论文NeurIPS 2025
大语言模型的可扩展指纹技术
提出 Perinucleus sampling,在 Llama-3.1-8B 中嵌入 24,576 条指纹且不损害效用,微调后仍保留,并缓解指纹泄露等安全风险。
- 会议论文NeurIPS 2025
CARE:通过回滚与自省干预实现解码时安全对齐
结合守卫模型实时监控、token 缓冲回滚与自省式批评干预,在解码时纠正不安全输出,兼顾低有害率与回答质量。
- 会议论文NeurIPS 2025
T2SMark:在扩散模型 Noise-as-Watermark 中平衡鲁棒性与多样性
提出基于尾部截断采样的两阶段水印方案,在 U-Net 与 DiT 扩散模型上兼顾水印鲁棒性与生成多样性,用于内容溯源与防滥用。
- 会议论文NeurIPS 2025
LLM 的个性化安全:基准与基于规划的 Agent 方法
提出个性化安全概念与 PENGUIN 基准(14000 个场景),发现用户背景信息可使安全分提升 43.2%,并提出免训练的 RAISE 框架,平均仅需 2.7 次提问即可提升最多 31.6%。