全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文NeurIPS 2025
荧光面纱:针对交通标志识别的隐蔽高效物理对抗补丁
用荧光墨水设计物理对抗补丁 FIPatch,紫外光触发后使交通标志识别出错,低光下成功率 98.31%,并绕过五种常见防御。
- 会议论文NeurIPS 2025
用于隐藏状态差分隐私的两层 ReLU 网络凸近似
通过对偶形式的随机近似把两层 ReLU 问题转为强凸问题,使隐藏状态隐私分析适用,NoisyCGD 的隐私-效用权衡与 DP-SGD 相当。
- 会议论文NeurIPS 2025
面向经验性机器遗忘评估的可靠密码学框架
将基于 MIA 的遗忘评估建模为密码学博弈,得到有可证明保证的数据移除评估指标,并给出高效近似。
- 会议论文NeurIPS 2025
WMCopier:在任意图像上伪造不可见水印
提出无需目标水印算法先验的伪造攻击,用扩散模型建模水印分布并嵌入,成功欺骗包括 Amazon 在内的开源与闭源水印系统。
- 会议论文NeurIPS 2025
超越固定矩阵的差分隐私联邦 LoRA
提出 FedASK,通过双重 sketching 同时更新两个 LoRA 矩阵并保证差分隐私,实验在多种隐私设置下优于基线。
- 会议论文NeurIPS 2025
用 Gradient Slingshots 操纵特征可视化
提出 Gradient Slingshots,可在不改架构下让特征可视化收敛到任意预设图像,暴露审计风险,并给出简单防御。
- 会议论文NeurIPS 2025
MIP against Agent:恶意图像补丁劫持多模态 OS Agent
提出对抗扰动的屏幕区域(MIP),被 OS Agent 截屏后诱导其调用 API 执行有害操作如外泄数据,可跨提示与屏幕配置泛化并劫持多个 Agent。
- 会议论文NeurIPS 2025
构建可跨模型与提示迁移的大视觉语言模型攻击器
从信息论角度,通过调节输出与对抗/良性图像模式间的互信息生成更通用的扰动,提升对黑盒 LVLM 及不同提示的迁移攻击效果。
- 会议论文NeurIPS 2025
探索 RLHF 中的数据扩展趋势与效应
针对 RLHF 的奖励作弊与回答多样性下降,提出推理验证器加生成式奖励模型的混合奖励和 Pre-PPO 选题,其中验证器抗奖励作弊最强。
- 会议论文NeurIPS 2025
蒸馏使遗忘更稳健
发现少量微调即可恢复被遗忘能力,提出 UNDO 将遗忘后的模型蒸馏到加噪副本,在 WMDP 上实现更稳健的能力移除。
- 会议论文NeurIPS 2025
AI Agent 部署中的安全挑战:大规模公开竞赛的启示
为期一个月的红队竞赛对 22 个前沿 LLM 驱动的 Agent 收集 180 万次提示注入攻击,产生 6 万余次策略违规,攻击迁移性强,且鲁棒性与模型能力、规模、推理算力几乎无相关。
- 会议论文NeurIPS 2025
逐点防御 LLM 微调 API 的根本局限
证明检测单个有害样本的逐点防御存在根本局限,用全为良性样本的攻击在 OpenAI 微调 API 上套取有害知识,并绕过增强监控。
- 会议论文NeurIPS 2025
IF-Guide:基于影响函数的 LLM 去毒化
用影响函数在 token 级定位训练数据中的有害内容并在预训练或微调中抑制,显式与隐式毒性最多降低 10 倍,且无需人类偏好数据。
- 会议论文NeurIPS 2025
非自适应对抗人脸生成
利用人脸识别特征空间的属性子球面结构,仅用一次含 100 张图的非自适应查询,对 AWS CompareFaces 攻击成功率超 93%。
- 会议论文NeurIPS 2025
对抗感知优化:基于扩散先验的鲁棒防御
提出基于优化的对抗扰动净化框架,结合预训练扩散先验与针对对抗扰动空间的似然项,在 CIFAR-10/100 上对多种常见攻击取得较强鲁棒准确率。
- 会议论文NeurIPS 2025
基于 Palimpsestic 成员推断的黑盒模型溯源
利用模型更易记住训练后期数据的特性,检验黑盒衍生模型或文本与原模型训练顺序的相关性,对 40 多个微调模型在查询设定下多数 p 值至多约 1e-8。
- 会议论文NeurIPS 2025
PurpCode:通过推理实现更安全的代码生成
提出 PurpCode 后训练方案,先学习网络安全规则再用多目标强化学习,训练出 PurpCode-32B,生成无漏洞代码并抵御恶意网络活动,同时降低过度拒答。
- 会议论文NeurIPS 2025
基于 Hölder 优化的可扩展神经网络几何鲁棒性验证
提出 H²V,用 Hilbert 空间填充与 Hölder 优化验证神经网络对几何扰动的局部鲁棒性,可扩展到 ResNet152、ViT 及视频 3D 网络。
- 会议论文NeurIPS 2025
反蒸馏采样(Antidistillation Sampling)
通过调整下一 token 概率分布来毒化推理轨迹,使其难以用于模型蒸馏,同时保持模型效用。
- 会议论文NeurIPS 2025
大语言模型中特定知识的弹性鲁棒遗忘
提出 ERU,用弹性奖励与拒答特征消融增强偏好优化式遗忘的效果与鲁棒性,在 WMDP-Bio 上提升 9%,重训练攻击下仍保持 83%。
- 会议论文NeurIPS 2025
SAFEx:通过稳定的安全关键专家识别分析 MoE 大模型漏洞
识别 MoE 模型中承担安全行为的专家并分组;屏蔽 12 个专家使 Qwen3-30B-A3B 拒答率降 22%,并用 LoRA 与负权重合并提升拒答。
- 会议论文NeurIPS 2025
展开网络(基于模型)的对抗泛化
推导展开网络在 l2 约束 FGSM 攻击下的对抗 Rademacher 复杂度与泛化界,并发现过参数化可提升对抗鲁棒性。
- 会议论文NeurIPS 2025
揭穿操纵者:利用生物特征泄露识别 AI 视频会议中的冒充
针对 AI 说话人视频会议中的 puppeteering 冒充攻击,用度量学习从潜在表示中解耦身份线索以检测未授权替换,可在消费级 GPU 上实时运行,优于已有防御。
- 会议论文NeurIPS 2025
ObCLIP:保护隐私的云端-设备混合图像生成
把用户提示转为仅敏感属性不同的候选提示集,云端无法分辨真实提示,设备端选取对应隐变量完成去噪,在保证隐私的同时效用接近大型云端模型。