全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文NeurIPS 2025
停止求和:过程奖励模型只需 min-form 信用分配
指出 PRM 引发奖励作弊的主因是求和式信用分配,提出 PURE 的 min-form 信用分配,显著缓解奖励作弊,在 3 个基座模型上取得与可验证奖励相当的推理表现。
- 会议论文NeurIPS 2025
结构化状态空间模型的隐式偏置可被干净标签投毒
证明存在特殊的干净标签训练样本,可彻底扭曲 SSM 的隐式偏置并使泛化失败,并在实验中验证该 clean-label poisoning 现象。
- 会议论文NeurIPS 2025
MARS:联邦学习中的恶意度感知后门防御
用神经元后门能量刻画恶意程度并结合 Wasserstein 距离聚类识别后门模型,可抵御包括 3DFed 在内的最新后门攻击。
- 会议论文NeurIPS 2025
RespoDiff:面向负责任且忠实的文生图双模块瓶颈变换
在扩散模型瓶颈表示上加入双模块变换,分别负责公平与安全概念和语义对齐,负责任生成效果提升约20%,可用于 SDXL。
- 会议论文NeurIPS 2025
注意!你的视觉语言模型可能被恶意操控
提出 VMA 攻击,用动量优化和可微变换生成图像对抗扰动,精确操控 VLM 输出,可用于越狱、劫持、隐私泄露和拒绝服务,也可注入水印。
- 会议论文NeurIPS 2025
基于先验知识校准记忆探测的 LVLM 黑盒成员推断攻击
提出首个面向 LVLM 的黑盒成员推断攻击,探测模型对图像中私有语义信息的记忆,效果可比肩灰盒与白盒方法,并对潜在对抗操纵保持稳健。
- 会议论文NeurIPS 2025
语音识别的差分隐私联邦学习:基准、自适应优化器与梯度裁剪
建立 ASR 上 FL 加 DP 的首个基准,用逐层裁剪和归一化缓解梯度异质性,在百万级用户规模下实现可用的用户级 DP。
- 会议论文NeurIPS 2025
NeuroGenPoisoning:基于神经元引导与遗传优化的 RAG 投毒攻击
识别对投毒知识敏感的神经元,并用遗传算法演化对抗性外部知识,对 RAG 的覆盖成功率超过 90% 且保持流畅,能解决知识冲突。
- 会议论文NeurIPS 2025
OVERT:文生图模型过度拒答评测基准
构建含 4600 条看似有害实为良性提示的基准,发现主流文生图模型普遍存在过度拒答,提示改写虽可缓解但会损害语义忠实度。
- 会议论文NeurIPS 2025
自适应 Sigmoid 裁剪:平衡差分隐私学习中的方向-幅度失配
提出 AdaSig 裁剪方法,在 DP-SGD 中自适应平衡方向与幅度失配,保持最佳收敛率并提升分类任务表现。
- 会议论文NeurIPS 2025
面向视觉语言模型的思维可视化越狱攻击
提出 VoTA,构造含风险视觉思维的图像链,利用推理与安全目标的冲突,在 15 个 VLM 上平均攻击成功率从 63.70% 升至 90.41%。
- 会议论文NeurIPS 2025
CARES:医疗 LLM 安全性与对抗鲁棒性综合评测
构建含 1.8 万余条提示的医疗安全基准,发现多数模型易受改写式越狱且对正常问题过度拒答,并提出轻量分类器缓解。
- 会议论文NeurIPS 2025
抗策略性操纵的人类反馈强化学习
证明现有 RLHF 算法无法抵御策略性标注者,单个标注者即可造成严重错位;提出 Pessimistic Median of MLEs 算法,近似抗操纵并收敛到最优策略。
- 会议论文NeurIPS 2025
扰动模型而非图像:基于反个性化扩散模型的稳健隐私保护
把保护对象从图像转为扩散模型本身,通过 DPO 损失与 L2P 双路径优化阻止对特定主体的未授权个性化,优于现有方法。
- 会议论文NeurIPS 2025
DictPFL:加密梯度上的高效隐私联邦学习
通过字典分解与加密感知剪枝,仅加密传输梯度即可防御梯度反演,通信开销降低402至748倍,运行时间接近明文联邦学习的2倍。
- 会议论文NeurIPS 2025
通过系统级 DPO 对齐复合 AI 系统
提出 SysDPO,将复合 AI 系统建模为 DAG 并扩展 DPO 做系统级联合对齐,在语言模型加扩散模型等场景中验证有效。
- 会议论文NeurIPS 2025
GUARDIAN:用时序图建模守护 LLM 多智能体协作
将多智能体协作建模为时序属性图,用无监督编码器-解码器检测幻觉放大与错误注入传播,并以信息瓶颈压缩图,取得最优检测精度。
- 会议论文NeurIPS 2025
从反事实到决策树:模型提取攻击的竞争分析
用竞争分析形式化模型提取攻击,针对加性决策树模型提出可完美还原的重建算法,并给出查询复杂度的理论界。
- 会议论文NeurIPS 2025
CoP:基于原则组合的 LLM 智能体红队测试
人类提供红队原则,AI 智能体自动编排策略生成越狱提示;对主流 LLM 将已知最佳单轮攻击成功率最高提升 19.0 倍。
- 会议论文NeurIPS 2025
对抗攻击下鲁棒的神经网络动态低秩压缩
提出带谱正则项的动态低秩训练,在压缩超过 94 的同时恢复或提升对抗精度,不损失干净精度。
- 会议论文NeurIPS 2025
FrameShield:对抗鲁棒的视频异常检测
针对弱监督视频异常检测易受对抗攻击的问题,提出 SRD 伪异常生成方法以降低伪标签噪声,使对抗训练有效,多个基准上平均 AUROC 比现有方法高 71.0%。
- 会议论文NeurIPS 2025
从自然隐空间学习鲁棒的视觉语言模型
提出 CoAPT 协同对抗提示调优,用全变分去除高频扰动并借助预训练 VLM 隐空间恢复特征,在自然泛化、对抗鲁棒性与任务适配间取得更好平衡。
- 会议论文NeurIPS 2025
LOMIA:针对预训练视觉语言大模型的仅标签成员推断攻击
提出仅依赖 top-1 输出的成员推断攻击框架,利用训练样本语义对齐更高、困惑度更低的特点,在三个开源 VLLM 和 GPT-4o 上媲美基于 logits 的攻击。
- 会议论文NeurIPS 2025
CoreGuard:在边缘部署中保护 LLM 核心能力免遭模型窃取
提出计算与通信开销都很低的保护方法,防止边缘部署的专有 LLM 被提取权重或被微调利用,实验显示安全保护达到上界且开销可忽略。