全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
通过拟合自然图像分布检测生成图像
利用自然与生成图像数据流形的几何差异,借助自监督模型损失变化检测生成图像,并用 normalizing flow 放大差异。
- 会议论文NeurIPS 2025
推理作为安全的自适应防御
提出 TARS,用强化学习训练模型以思维链推理安全问题,在歧义查询上多花算力,改善安全与拒答权衡,并增强对 GCG、PAIR 攻击的鲁棒性。
- 会议论文NeurIPS 2025
Semantic Surgery:扩散模型的零样本概念擦除
在扩散前对文本嵌入做校准的向量减法以擦除有害概念,无需重训,在显式内容、风格等擦除任务上优于现有方法,并可兼作威胁检测。
- 会议论文NeurIPS 2025
RespoDiff:面向负责任且忠实的文生图双模块瓶颈变换
在扩散模型瓶颈表示上加入双模块变换,分别负责公平与安全概念和语义对齐,负责任生成效果提升约20%,可用于 SDXL。
- 会议论文NeurIPS 2025
OVERT:文生图模型过度拒答评测基准
构建含 4600 条看似有害实为良性提示的基准,发现主流文生图模型普遍存在过度拒答,提示改写虽可缓解但会损害语义忠实度。
- 会议论文NeurIPS 2025
对抗攻击下鲁棒的神经网络动态低秩压缩
提出带谱正则项的动态低秩训练,在压缩超过 94 的同时恢复或提升对抗精度,不损失干净精度。
- 会议论文NeurIPS 2025
FrameShield:对抗鲁棒的视频异常检测
针对弱监督视频异常检测易受对抗攻击的问题,提出 SRD 伪异常生成方法以降低伪标签噪声,使对抗训练有效,多个基准上平均 AUROC 比现有方法高 71.0%。
- 会议论文NeurIPS 2025
从自然隐空间学习鲁棒的视觉语言模型
提出 CoAPT 协同对抗提示调优,用全变分去除高频扰动并借助预训练 VLM 隐空间恢复特征,在自然泛化、对抗鲁棒性与任务适配间取得更好平衡。
- 会议论文NeurIPS 2025
短长度对抗训练可帮助 LLM 防御长长度越狱攻击
针对对抗后缀越狱,证明用长度 Θ(√M) 的对抗后缀做对抗训练即可防御长度 Θ(M) 的攻击,并在开源 LLM 上实验证实攻击成功率与长度比相关。
- 会议论文NeurIPS 2025
安全预训练:迈向下一代安全 AI
以数据为中心在预训练阶段加入安全过滤、改写、原生拒答和有害标签,使攻击成功率从 38.8% 降至 8.4%,通用任务性能无损。
- 会议论文NeurIPS 2025
语言模型的终身安全对齐
让 Meta-Attacker 持续发现新越狱策略、Defender 对抗训练,Defender 最终将 Meta-Attacker 的成功率压到 7%。
- 会议论文NeurIPS 2025
FALCON:面向 LLM 的对比正交去对齐细粒度激活操控遗忘
提出表示引导的遗忘方法,用对比机制与正交梯度投影去除 LLM 中敏感或有害知识,兼顾遗忘效果与模型效用,并抵抗知识恢复。
- 会议论文NeurIPS 2025
E2E-VGuard:面向生产级 LLM 端到端语音合成的对抗式防护
用编码器集成保护音色、ASR 对抗样本干扰发音,抵御声音克隆欺诈,在 16 个开源合成器和 3 个商业 API 上验证有效。
- 会议论文NeurIPS 2025
有理论保证的 LLM 水印框架:分布自适应方法
联合优化水印方案与检测器,给出最优解并提出无失真的分布自适应算法 DAWA,在极低误报率下检测效果良好。
- 会议论文NeurIPS 2025
大语言模型的可扩展指纹技术
提出 Perinucleus sampling,在 Llama-3.1-8B 中嵌入 24,576 条指纹且不损害效用,微调后仍保留,并缓解指纹泄露等安全风险。
- 会议论文NeurIPS 2025
CARE:通过回滚与自省干预实现解码时安全对齐
结合守卫模型实时监控、token 缓冲回滚与自省式批评干预,在解码时纠正不安全输出,兼顾低有害率与回答质量。
- 会议论文NeurIPS 2025
T2SMark:在扩散模型 Noise-as-Watermark 中平衡鲁棒性与多样性
提出基于尾部截断采样的两阶段水印方案,在 U-Net 与 DiT 扩散模型上兼顾水印鲁棒性与生成多样性,用于内容溯源与防滥用。
- 会议论文NeurIPS 2025
LLM 的个性化安全:基准与基于规划的 Agent 方法
提出个性化安全概念与 PENGUIN 基准(14000 个场景),发现用户背景信息可使安全分提升 43.2%,并提出免训练的 RAISE 框架,平均仅需 2.7 次提问即可提升最多 31.6%。
- 会议论文NeurIPS 2025
用追问预测黑盒语言模型的表现
以追问回答的概率训练线性预测器,可预测黑盒模型正确性,并检测被系统提示对抗操纵或被冒充的模型。
- 会议论文NeurIPS 2025
LORE:面向视觉编码器的拉格朗日优化鲁棒嵌入
提出基于约束优化的无监督对抗微调框架 LORE,稳定训练并显著提升零样本对抗鲁棒性,干净数据精度损失很小。
- 会议论文NeurIPS 2025
超越 Oracle:面向指令层级的验证器监督
用带可执行验证器的指令冲突样本微调模型,提升指令层级遵循,并泛化提升对抗性安全基准上的鲁棒性。
- 会议论文NeurIPS 2025
基于自回归奖励引导表征编辑的 LLM 去毒
提出 ARGRE,在表征空间建模毒性过渡并训练奖励模型指导推理时编辑,在 8 个 LLM 上毒性降低 62.21%、推理时间减少 47.58%。
- 会议论文NeurIPS 2025
简单取胜:重新思考用于 LLM 遗忘的 Negative Preference Optimization
指出 NPO 存在参考模型偏差,提出去除参考模型的 SimNPO 遗忘框架,在 TOFU、MUSE、WMDP 上验证有效。
- 会议论文NeurIPS 2025
理解并纠正 VLM 中的安全感知失真
发现视觉模态引入使激活偏向“更安全”方向、导致 VLM 高估有害输入安全性,提出免训练的 ShiftDC 校准,恢复对齐且不损害能力。