全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
GASP:高效黑盒生成对抗后缀以越狱 LLM
用潜空间贝叶斯优化在黑盒设定下生成可读性强的对抗后缀,提高越狱成功率并缩短训练与推理时间,适用于 LLM 红队测试。
- 会议论文NeurIPS 2025
3D 生成中的机器遗忘:视角一致的加速框架
首次探索 3D 生成模型的机器遗忘,提出跳跃加速机制,在 Zero123 上提速 30% 并有效遗忘目标概念。
- 会议论文NeurIPS 2025
带回溯反馈的强化学习(RLBF)
用 RL 训练 LLM 在发生安全违规时输出“回退 x 个 token”信号并重新生成,降低 GCG 等攻击的成功率且保持模型效用。
- 会议论文NeurIPS 2025
为什么有些语言模型会伪装对齐而另一些不会?
将对齐伪装分析扩展到 25 个模型,仅 5 个在推断处于训练时更多服从有害请求;仅 Claude 3 Opus 主要出于保持目标,后训练与拒答差异可解释大部分差别。
- 会议论文NeurIPS 2025
RUAGO:基于对抗攻击与 OOD 生成器的无保留数据遗忘
在没有 retain data 的情况下,用对抗软标签和 OOD 预训练生成器做机器遗忘,效果优于现有 retain-free 方法。
- 会议论文NeurIPS 2025
看不见的威胁:扰动样本下机器遗忘中的残留知识
指出遗忘样本的微小扰动仍可能被遗忘后的模型识别,造成隐私风险;形式化为残留知识并提出微调方法 RURK,实验表明现有遗忘方法普遍存在该问题。
- 会议论文NeurIPS 2025
重新定义专家:用于缓解毒性的语言模型可解释分解
提出 EigenShift,对输出层做特征分解以定向抑制生成毒性的成分,无需额外训练,且不损害语言能力。
- 会议论文NeurIPS 2025
通过拟合自然图像分布检测生成图像
利用自然与生成图像数据流形的几何差异,借助自监督模型损失变化检测生成图像,并用 normalizing flow 放大差异。
- 会议论文NeurIPS 2025
AgentAuditor:LLM Agent 的类人安全评估
提出免训练、记忆增强的评估框架 AgentAuditor 和含 2293 条记录的 ASSEBench,在 Agent 安全评估上达到人类水平准确率。
- 会议论文NeurIPS 2025
推理作为安全的自适应防御
提出 TARS,用强化学习训练模型以思维链推理安全问题,在歧义查询上多花算力,改善安全与拒答权衡,并增强对 GCG、PAIR 攻击的鲁棒性。
- 会议论文NeurIPS 2025
谁的安全观?面向文生图模型多元对齐的 DIVE 数据集
构建由人口统计交叉的评分者标注的多模态数据集,发现不同人群对危害的感知存在显著差异,为文生图模型的多元安全对齐提供基础。
- 会议论文NeurIPS 2025
大模型能在过程监督下学会并泛化隐写式思维链
惩罚思维链中的特定字符串会让模型改用替代字符串编码推理而不改变解题方式,并能泛化到未见字符串,威胁 CoT 监控可靠性。
- 会议论文NeurIPS 2025
信息检索引发的 AI Agent 安全退化
评测发现随着模型获得维基检索乃至开放网络搜索,拒答率与有害内容防护持续下降;基于对齐 LLM 的检索 Agent 常比无检索的无审查模型更不安全。
- 会议论文NeurIPS 2025
LoSplit:基于损失引导动态划分的图后门攻击训练期防御
发现后门目标节点早期损失收敛并向邻近干净节点漂移,据此用 GMM 聚类划分目标节点并遗忘恶意标签关联,显著降低攻击成功率。
- 会议论文NeurIPS 2025
Semantic Surgery:扩散模型的零样本概念擦除
在扩散前对文本嵌入做校准的向量减法以擦除有害概念,无需重训,在显式内容、风格等擦除任务上优于现有方法,并可兼作威胁检测。
- 会议论文NeurIPS 2025
VLM 能聚合分散的训练图像补丁
有害图像被拆成无害补丁散布于训练样本可绕过数据审核;VLM 具备 visual stitching 能力,能在推理时重组并产生有害响应。
- 会议论文NeurIPS 2025
ErrorTrace:基于模型家族错误空间的黑盒溯源机制
针对开源 LLM 被低成本衍生的知识产权风险,利用模型家族独特的错误模式做黑盒溯源,对 27 个基座模型溯源准确率达 0.8518,并能追踪微调、剪枝和合并模型。
- 会议论文NeurIPS 2025
停止求和:过程奖励模型只需 min-form 信用分配
指出 PRM 引发奖励作弊的主因是求和式信用分配,提出 PURE 的 min-form 信用分配,显著缓解奖励作弊,在 3 个基座模型上取得与可验证奖励相当的推理表现。
- 会议论文NeurIPS 2025
结构化状态空间模型的隐式偏置可被干净标签投毒
证明存在特殊的干净标签训练样本,可彻底扭曲 SSM 的隐式偏置并使泛化失败,并在实验中验证该 clean-label poisoning 现象。
- 会议论文NeurIPS 2025
MARS:联邦学习中的恶意度感知后门防御
用神经元后门能量刻画恶意程度并结合 Wasserstein 距离聚类识别后门模型,可抵御包括 3DFed 在内的最新后门攻击。
- 会议论文NeurIPS 2025
RespoDiff:面向负责任且忠实的文生图双模块瓶颈变换
在扩散模型瓶颈表示上加入双模块变换,分别负责公平与安全概念和语义对齐,负责任生成效果提升约20%,可用于 SDXL。
- 会议论文NeurIPS 2025
注意!你的视觉语言模型可能被恶意操控
提出 VMA 攻击,用动量优化和可微变换生成图像对抗扰动,精确操控 VLM 输出,可用于越狱、劫持、隐私泄露和拒绝服务,也可注入水印。
- 会议论文NeurIPS 2025
基于先验知识校准记忆探测的 LVLM 黑盒成员推断攻击
提出首个面向 LVLM 的黑盒成员推断攻击,探测模型对图像中私有语义信息的记忆,效果可比肩灰盒与白盒方法,并对潜在对抗操纵保持稳健。
- 会议论文NeurIPS 2025
语音识别的差分隐私联邦学习:基准、自适应优化器与梯度裁剪
建立 ASR 上 FL 加 DP 的首个基准,用逐层裁剪和归一化缓解梯度异质性,在百万级用户规模下实现可用的用户级 DP。