全部动态
论文与会议论文
本页材料
24 条- 会议论文NeurIPS 2025
BridgePure:有限的保护泄露即可攻破黑盒数据保护
提出保护泄露威胁模型,用少量未保护数据训练扩散桥模型,可去除黑盒不可学习样本的保护,暴露其漏洞。
- 会议论文NeurIPS 2025
带差分隐私的多类支持向量机
提出 PMSVM,通过权重和梯度扰动让多类 SVM 只访问每个样本一次,在多类场景下优于现有 DP-SVM 方法。
- 会议论文NeurIPS 2025
理解并纠正 VLM 中的安全感知失真
发现视觉模态引入使激活偏向“更安全”方向、导致 VLM 高估有害输入安全性,提出免训练的 ShiftDC 校准,恢复对齐且不损害能力。
- 会议论文NeurIPS 2025
通过排斥式视觉提示调优防御多模态后门模型
提出 RVPT,仅调 0.27% 参数并用特征排斥损失,将 CLIP 后门攻击成功率从 89.70% 降到 2.76%。
- 会议论文NeurIPS 2025
GuardReasoner-VL:通过强化推理守护 VLM
构建推理型 VLM 护栏模型,经 SFT 冷启动与在线 RL 训练,在多模态内容审核上平均 F1 比次优方法高 19.27%,并开源数据与模型。
- 会议论文NeurIPS 2025
智者知所不言:基于注意力转移的无幻觉 LLM 遗忘
提出 Attention-Shifting 遗忘框架,抑制事实 token 注意力并抑制编造回答,在 ToFU 与 TDEC 上准确率最高提升 15%、10%。
- 会议论文NeurIPS 2025
HQA-VLAttack:针对视觉语言预训练模型的高质量对抗攻击
提出黑盒框架,文本端用反拟合词向量替换,图像端用对比学习优化扰动,在三个基准上攻击成功率显著优于基线。
- 会议论文NeurIPS 2025
消失于无形:针对 SAM2 的跨提示通用对抗攻击
提出首个针对 SAM2 的跨提示通用对抗攻击 UAP-SAM2,通过双重语义偏移扰动,在六个数据集上大幅超越现有攻击。
- 会议论文NeurIPS 2025
DEGauss:防御针对高斯泼溅的恶意 3D 编辑
针对 3D 高斯泼溅被恶意编辑的滥用风险,提出多视角扰动防御,通过视角聚焦梯度融合与双重偏差优化破坏编辑轨迹,并能泛化到多种 3D 编辑流程。
- 会议论文NeurIPS 2025
VMDT:解码视频基础模型的可信性
提出首个视频模态可信性评测平台,覆盖安全、幻觉、公平、隐私与对抗鲁棒性;评测发现开源 T2V 模型普遍无法识别有害请求,且安全性与模型规模无关。
- 会议论文NeurIPS 2025
MIBP-Cert:基于混合整数双线性规划的抗数据扰动认证训练
针对训练数据错误、损坏与投毒攻击,用混合整数双线性规划计算可达参数集合,给出确定性的可证明鲁棒性,并适用于多种威胁模型。
- 会议论文NeurIPS 2025
UMU-Bench:弥合多模态遗忘评测中的模态差距
针对多模态大模型的隐私遗忘提出基准,发现现有遗忘方法普遍存在单模态与多模态知识移除不一致的问题。
- 会议论文NeurIPS 2025
残差流分析:过拟合与结构破坏
发现重复的安全数据导致残差流方差集中和误拒增多,提出 VCL 正则,使误拒率降低 35 个百分点以上且通用性能不降。
- 会议论文NeurIPS 2025
SafePTR:多模态大模型中基于先剪枝后恢复的 token 级越狱防御
发现早中层不到 1% 的有害 token 触发越狱,据此提出免训练的剪枝再恢复防御,在三个 MLLM、五个基准上提升安全且不损效用。
- 会议论文NeurIPS 2025
具有实体级隐私保证的差分隐私关系学习
针对关系数据提出带实体级 DP 保证的 DP-SGD 变体,含敏感度分析、按实体出现频率自适应裁剪,并扩展隐私放大分析,在文本编码器微调上取得较好隐私-效用权衡。
- 会议论文NeurIPS 2025
基于规则偏好建模的文生图系统红队测试
提出 RPG-RT,用 LLM 迭代改写提示并根据系统反馈微调,借助规则偏好建模适应未知防御,在 19 个 T2I 系统和 3 个商业 API 上验证有效。
- 会议论文NeurIPS 2025
留意 LLM 遗忘学习:隐藏风险与对策
揭示基于微调的遗忘学习可被恶意遗忘请求隐蔽破坏良性用户体验,并提出 Scope-aware Unlearning 增强鲁棒性。
- 会议论文NeurIPS 2025
随机分配带来的隐私放大
给出随机 k-out-of-t 分配采样方案的首个理论隐私保证与数值估计算法,其保证可由 Poisson 子采样的保证上界。
- 会议论文NeurIPS 2025
GeoClip:差分隐私 SGD 的几何感知裁剪
提出 GeoClip,在与梯度分布几何对齐的变换基下裁剪并加噪,无需额外隐私开销,给出收敛保证,在相同隐私预算下优于现有自适应裁剪方法。
- 会议论文NeurIPS 2025
ICLScan:通过定向上下文学习检测黑盒大语言模型中的后门
发现已含后门的 LLM 极易经 ICL 植入新触发器,据此仅靠多次查询统计成功率即可检测黑盒后门,各项指标接近 1。
- 会议论文NeurIPS 2025
从语言模型中擦除概念知识
提出 ELM,用模型自身的内省分类能力做低秩更新,在生物安全、网络安全等领域擦除目标概念,同时保持通用能力,并对对抗攻击保持较强鲁棒性。
- 会议论文NeurIPS 2025
通过参数与表示扰动实现共识鲁棒的迁移攻击
将迁移攻击建模为共识鲁棒优化,提出 CORTA,在单一代理模型下对 CNN 与 ViT 目标迁移成功率比最佳既有方法高 19.1 个百分点。
- 会议论文NeurIPS 2025
MixAT:结合连续与离散对抗训练的 LLM 防御
结合更强的离散攻击与更快的连续攻击做对抗训练,最坏情况攻击成功率(ALO-ASR)低于 20%,优于先前防御的 50% 以上,且开销相近。
- 会议论文NeurIPS 2025
医疗基础模型的记忆化风险调查
提出一套黑盒评测,在嵌入和生成层面探测基于 EHR 的基础模型对患者信息的记忆,并开源工具包。