全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
用信息量更大的触发器提升神经网络指纹的唯一性
从信息论角度研究黑盒模型指纹,选取边际互信息最大的触发器,使版权溯源更准确高效,并可接入现有指纹方案。
- 会议论文NeurIPS 2025
超越期望:面向风险校准语言模型的分位数引导对齐
提出 Quantile-Guided Alignment,在 RLHF 中施加分位数约束以控制有害输出等尾部风险,在对话和代码生成上提升目标尾部质量。
- 会议论文NeurIPS 2025
度量并引导单义性:Guided Sparse Autoencoders
提出特征单义性分数 FMS 与带概念标签训练的 G-SAE,在毒性检测、隐私属性识别等任务上提升单义性,并实现更精细的 steering。
- 会议论文NeurIPS 2025
增强 LLM 水印对擦除与伪造攻击的双重鲁棒性
提出 SEEK 水印方案,借助等价纹理密钥让窗口内多个 token 独立支持检测,在不牺牲抗伪造能力的同时提升对擦除攻击的鲁棒性。
- 会议论文NeurIPS 2025
IMPACT:基于两阶段优化的不规则多补丁对抗组合
提出无梯度的对抗补丁攻击框架,联合优化补丁形状、位置、数量与内容,并生成连续不规则补丁,效果优于多种现有方法。
- 会议论文NeurIPS 2025
基于类比的多轮 LLM 越狱
先用良性任务让模型学会目标响应结构,再在最后一轮做受控语义替换,在六个模型上平均攻击成功率 93.3%。
- 会议论文NeurIPS 2025
数据集属性对深度迁移学习成员推断脆弱性的影响
理论与实证分析微调模型的 MIA 脆弱性,发现攻击者优势随每类样本数按幂律下降,但保护最脆弱样本所需数据量仍非常大。
- 会议论文NeurIPS 2025
SafeVid:面向安全对齐的视频大型多模态模型
以文本视频描述为桥梁迁移文本安全对齐,构建 35 万对偏好数据并用 DPO 对齐,在 SafeVidBench 上最高提升 42.39%。
- 会议论文NeurIPS 2025
荧光面纱:针对交通标志识别的隐蔽高效物理对抗补丁
用荧光墨水设计物理对抗补丁 FIPatch,紫外光触发后使交通标志识别出错,低光下成功率 98.31%,并绕过五种常见防御。
- 会议论文NeurIPS 2025
用于隐藏状态差分隐私的两层 ReLU 网络凸近似
通过对偶形式的随机近似把两层 ReLU 问题转为强凸问题,使隐藏状态隐私分析适用,NoisyCGD 的隐私-效用权衡与 DP-SGD 相当。
- 会议论文NeurIPS 2025
面向经验性机器遗忘评估的可靠密码学框架
将基于 MIA 的遗忘评估建模为密码学博弈,得到有可证明保证的数据移除评估指标,并给出高效近似。
- 会议论文NeurIPS 2025
WMCopier:在任意图像上伪造不可见水印
提出无需目标水印算法先验的伪造攻击,用扩散模型建模水印分布并嵌入,成功欺骗包括 Amazon 在内的开源与闭源水印系统。
- 会议论文NeurIPS 2025
超越固定矩阵的差分隐私联邦 LoRA
提出 FedASK,通过双重 sketching 同时更新两个 LoRA 矩阵并保证差分隐私,实验在多种隐私设置下优于基线。
- 会议论文NeurIPS 2025
用 Gradient Slingshots 操纵特征可视化
提出 Gradient Slingshots,可在不改架构下让特征可视化收敛到任意预设图像,暴露审计风险,并给出简单防御。
- 会议论文NeurIPS 2025
MIP against Agent:恶意图像补丁劫持多模态 OS Agent
提出对抗扰动的屏幕区域(MIP),被 OS Agent 截屏后诱导其调用 API 执行有害操作如外泄数据,可跨提示与屏幕配置泛化并劫持多个 Agent。
- 会议论文NeurIPS 2025
构建可跨模型与提示迁移的大视觉语言模型攻击器
从信息论角度,通过调节输出与对抗/良性图像模式间的互信息生成更通用的扰动,提升对黑盒 LVLM 及不同提示的迁移攻击效果。
- 会议论文NeurIPS 2025
探索 RLHF 中的数据扩展趋势与效应
针对 RLHF 的奖励作弊与回答多样性下降,提出推理验证器加生成式奖励模型的混合奖励和 Pre-PPO 选题,其中验证器抗奖励作弊最强。
- 会议论文NeurIPS 2025
蒸馏使遗忘更稳健
发现少量微调即可恢复被遗忘能力,提出 UNDO 将遗忘后的模型蒸馏到加噪副本,在 WMDP 上实现更稳健的能力移除。
- 会议论文NeurIPS 2025
AI Agent 部署中的安全挑战:大规模公开竞赛的启示
为期一个月的红队竞赛对 22 个前沿 LLM 驱动的 Agent 收集 180 万次提示注入攻击,产生 6 万余次策略违规,攻击迁移性强,且鲁棒性与模型能力、规模、推理算力几乎无相关。
- 会议论文NeurIPS 2025
逐点防御 LLM 微调 API 的根本局限
证明检测单个有害样本的逐点防御存在根本局限,用全为良性样本的攻击在 OpenAI 微调 API 上套取有害知识,并绕过增强监控。
- 会议论文NeurIPS 2025
IF-Guide:基于影响函数的 LLM 去毒化
用影响函数在 token 级定位训练数据中的有害内容并在预训练或微调中抑制,显式与隐式毒性最多降低 10 倍,且无需人类偏好数据。
- 会议论文NeurIPS 2025
非自适应对抗人脸生成
利用人脸识别特征空间的属性子球面结构,仅用一次含 100 张图的非自适应查询,对 AWS CompareFaces 攻击成功率超 93%。
- 会议论文NeurIPS 2025
对抗感知优化:基于扩散先验的鲁棒防御
提出基于优化的对抗扰动净化框架,结合预训练扩散先验与针对对抗扰动空间的似然项,在 CIFAR-10/100 上对多种常见攻击取得较强鲁棒准确率。
- 会议论文NeurIPS 2025
基于 Palimpsestic 成员推断的黑盒模型溯源
利用模型更易记住训练后期数据的特性,检验黑盒衍生模型或文本与原模型训练顺序的相关性,对 40 多个微调模型在查询设定下多数 p 值至多约 1e-8。