全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
MLLM 微调中无需外部指导的后门清除
发现后门触发器会导致注意力塌缩,据此提出 BYE,用注意力熵无监督过滤后门样本,攻击成功率接近零且保持任务性能。
- 会议论文NeurIPS 2025
LLM 口头置信度在对抗攻击下的鲁棒性
用扰动和越狱式方法攻击口头置信度,发现置信度估计和答案都易被改变,常见防御大多无效甚至适得其反。
- 会议论文NeurIPS 2025
ALMGuard:为音频语言模型寻找安全捷径作为护栏
提出首个面向 ALM 的防御框架,用通用 Shortcut Activation Perturbations 激活安全捷径,将越狱攻击平均成功率降至 4.6% 且保持良性任务效用。
- 会议论文NeurIPS 2025
发现并重新激活后训练 LLM 中被隐藏的安全机制
发现后训练会掩盖基座模型的安全机制但并未删除,提出 SafeReAct 用少数层的 LoRA 恢复安全行为,且不损害推理性能。
- 会议论文NeurIPS 2025
通用可迁移的不可学习样本生成器
提出 VTG 生成器,通过对抗域增强与扰动-标签耦合,使不可学习样本在不同风格、分辨率、类别和架构下仍能防止未授权训练。
- 会议论文NeurIPS 2025
基于任务单纯形算术的机器遗忘
针对 VLM 的免重训遗忘,发现 task vector 对微调配置敏感,提出在单纯形内对无限多函数做闭式集成,提升遗忘效果与稳定性,服务于隐私与合规。
- 会议论文NeurIPS 2025
完全动态数据流上的差分隐私
在数据可插入删除的动态场景下,给出从静态差分隐私机制到动态机制的黑盒构造,效用仅有多对数级损失。
- 会议论文NeurIPS 2025
通过解耦层间依赖加速纵向联邦对抗学习
提出 DecVFAL 框架,通过双层解耦加速纵向联邦学习中的对抗训练,在保持鲁棒性的同时实现约 3 到 10 倍加速,并给出收敛分析。
- 会议论文NeurIPS 2025
一头定乾坤:用单个关键注意力头增强 LVLM 安全性
发现 LVLM 的安全能力集中在特定注意力头,提出免训练的 Oh Defense,对不安全输入防御成功率超 98%,误报率低于 5%。
- 会议论文NeurIPS 2025
语言模型能够对自身内部激活进行元认知监控与控制
用 neurofeedback 范式量化 LLM 报告和控制自身激活的能力,发现其只能监控神经空间的一小部分,并指出模型可能规避激活层面的安全检测。
- 会议论文NeurIPS 2025
AgentDAM:自主网页智能体的隐私泄露评测
提出衡量网页智能体是否遵循数据最小化原则的基准,发现基于 GPT-4、Llama-3、Claude 的智能体易不当使用敏感信息,并给出提示式防御。
- 会议论文NeurIPS 2025
PREAMBLE:基于块稀疏向量的私有高效聚合
用块稀疏分布式点函数实现高维向量安全聚合,在隐私-效用权衡接近最优的同时大幅降低通信开销。
- 会议论文NeurIPS 2025
为数据投毒攻击提供可证明的水印
针对看似无害的数据投毒,提出投毒后与投毒并行两种可证明水印方案,在给定水印长度下同时保证可检测性与投毒效用。
- 会议论文NeurIPS 2025
通过修正策略优化增强 RLHF 中的安全性
指出期望安全约束会导致“安全补偿”,提出 RePO 对每个提示施加关键安全约束,显著提升 LLM 安全对齐。
- 会议论文NeurIPS 2025
协同样本选择与触发器的通用组件:高效的仅投毒干净标签后门攻击
提出一组可集成到多种干净标签后门攻击中的组件,通过协同选择样本与优化触发器,同时提升攻击成功率与隐蔽性。
- 会议论文NeurIPS 2025
BadVLA:通过目标解耦优化对视觉-语言-动作模型实施后门攻击
提出两阶段后门攻击,在多个 VLA 基准上攻击成功率近 100%,对干净任务影响很小,并对微调等扰动保持鲁棒。
- 会议论文NeurIPS 2025
Robust SuperAlignment:视觉语言模型的弱到强鲁棒性泛化
提出弱到强对抗鲁棒性泛化方法,用无监督方式把对抗鲁棒性从弱模型迁移到强 VLM,缓解其面对对抗攻击的脆弱性。
- 会议论文NeurIPS 2025
理解并提升神经概率电路的对抗鲁棒性
证明 NPC 的对抗鲁棒性只取决于属性识别模块,并提出 RNPC,用类别级整合获得可证明更强的鲁棒性且保持良性精度。
- 会议论文NeurIPS 2025
统一差分隐私下的重识别、属性推断与数据重建风险
基于 f-DP 给出三类攻击成功率的统一可调上界,比既有方法更紧,校准噪声可减少约 20%。
- 会议论文NeurIPS 2025
PolyJuice:针对合成图像检测器的黑盒通用红队方法
利用文生图潜空间中检测器正误分类样本的分布偏移方向,黑盒、与图像无关地引导生成图像欺骗检测器,欺骗率最高达 84%,用其增强数据微调检测器可提升最多 30%。
- 会议论文NeurIPS 2025
Panacea:通过微调后扰动缓解 LLM 有害微调
发现随机扰动即可恢复安全性,进而优化自适应扰动,在不损失下游性能的前提下将平均有害分数最多降低 21.2%。
- 会议论文NeurIPS 2025
打破检测器中的潜在先验偏差:实现可泛化的 AIGC 图像检测
发现 AIGC 检测器会学到与初始噪声相关的捷径,提出 On-Manifold 对抗训练并构建 GenImage++ 基准,显著提升对未见生成器的跨生成器检测性能。
- 会议论文NeurIPS 2025
BackdoorLLM:大语言模型后门攻击与防御综合基准
首个文本生成 LLM 后门基准,涵盖数据投毒、权重投毒、隐状态操纵和思维链劫持等攻击,含 200 余项实验与 7 种防御。
- 会议论文NeurIPS 2025
用空间对抗对齐提升对抗样本迁移性
提出 SAA,用 witness 模型对齐微调代理模型的全局与局部特征,并引入自对抗约束,使对抗样本在 CNN 到 ViT 等跨架构场景下迁移性更高。