全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
构建可跨模型与提示迁移的大视觉语言模型攻击器
从信息论角度,通过调节输出与对抗/良性图像模式间的互信息生成更通用的扰动,提升对黑盒 LVLM 及不同提示的迁移攻击效果。
- 会议论文NeurIPS 2025
探索 RLHF 中的数据扩展趋势与效应
针对 RLHF 的奖励作弊与回答多样性下降,提出推理验证器加生成式奖励模型的混合奖励和 Pre-PPO 选题,其中验证器抗奖励作弊最强。
- 会议论文NeurIPS 2025
蒸馏使遗忘更稳健
发现少量微调即可恢复被遗忘能力,提出 UNDO 将遗忘后的模型蒸馏到加噪副本,在 WMDP 上实现更稳健的能力移除。
- 会议论文NeurIPS 2025
AI Agent 部署中的安全挑战:大规模公开竞赛的启示
为期一个月的红队竞赛对 22 个前沿 LLM 驱动的 Agent 收集 180 万次提示注入攻击,产生 6 万余次策略违规,攻击迁移性强,且鲁棒性与模型能力、规模、推理算力几乎无相关。
- 会议论文NeurIPS 2025
逐点防御 LLM 微调 API 的根本局限
证明检测单个有害样本的逐点防御存在根本局限,用全为良性样本的攻击在 OpenAI 微调 API 上套取有害知识,并绕过增强监控。
- 会议论文NeurIPS 2025
IF-Guide:基于影响函数的 LLM 去毒化
用影响函数在 token 级定位训练数据中的有害内容并在预训练或微调中抑制,显式与隐式毒性最多降低 10 倍,且无需人类偏好数据。
- 会议论文NeurIPS 2025
非自适应对抗人脸生成
利用人脸识别特征空间的属性子球面结构,仅用一次含 100 张图的非自适应查询,对 AWS CompareFaces 攻击成功率超 93%。
- 会议论文NeurIPS 2025
对抗感知优化:基于扩散先验的鲁棒防御
提出基于优化的对抗扰动净化框架,结合预训练扩散先验与针对对抗扰动空间的似然项,在 CIFAR-10/100 上对多种常见攻击取得较强鲁棒准确率。
- 会议论文NeurIPS 2025
基于 Palimpsestic 成员推断的黑盒模型溯源
利用模型更易记住训练后期数据的特性,检验黑盒衍生模型或文本与原模型训练顺序的相关性,对 40 多个微调模型在查询设定下多数 p 值至多约 1e-8。
- 会议论文NeurIPS 2025
PurpCode:通过推理实现更安全的代码生成
提出 PurpCode 后训练方案,先学习网络安全规则再用多目标强化学习,训练出 PurpCode-32B,生成无漏洞代码并抵御恶意网络活动,同时降低过度拒答。
- 会议论文NeurIPS 2025
基于 Hölder 优化的可扩展神经网络几何鲁棒性验证
提出 H²V,用 Hilbert 空间填充与 Hölder 优化验证神经网络对几何扰动的局部鲁棒性,可扩展到 ResNet152、ViT 及视频 3D 网络。
- 会议论文NeurIPS 2025
反蒸馏采样(Antidistillation Sampling)
通过调整下一 token 概率分布来毒化推理轨迹,使其难以用于模型蒸馏,同时保持模型效用。
- 会议论文NeurIPS 2025
大语言模型中特定知识的弹性鲁棒遗忘
提出 ERU,用弹性奖励与拒答特征消融增强偏好优化式遗忘的效果与鲁棒性,在 WMDP-Bio 上提升 9%,重训练攻击下仍保持 83%。
- 会议论文NeurIPS 2025
SAFEx:通过稳定的安全关键专家识别分析 MoE 大模型漏洞
识别 MoE 模型中承担安全行为的专家并分组;屏蔽 12 个专家使 Qwen3-30B-A3B 拒答率降 22%,并用 LoRA 与负权重合并提升拒答。
- 会议论文NeurIPS 2025
展开网络(基于模型)的对抗泛化
推导展开网络在 l2 约束 FGSM 攻击下的对抗 Rademacher 复杂度与泛化界,并发现过参数化可提升对抗鲁棒性。
- 会议论文NeurIPS 2025
揭穿操纵者:利用生物特征泄露识别 AI 视频会议中的冒充
针对 AI 说话人视频会议中的 puppeteering 冒充攻击,用度量学习从潜在表示中解耦身份线索以检测未授权替换,可在消费级 GPU 上实时运行,优于已有防御。
- 会议论文NeurIPS 2025
ObCLIP:保护隐私的云端-设备混合图像生成
把用户提示转为仅敏感属性不同的候选提示集,云端无法分辨真实提示,设备端选取对应隐变量完成去噪,在保证隐私的同时效用接近大型云端模型。
- 会议论文NeurIPS 2025
TRAP:定向重定向智能体偏好
用扩散模型生成视觉自然的语义注入图像,无需模型内部访问即可让 VLM 智能体在多候选决策中稳定偏向攻击者目标,对 GPT-4o 等模型有效。
- 会议论文NeurIPS 2025
VERA:大语言模型越狱的变分推断框架
把黑盒越狱建模为变分推断,训练小型攻击 LLM 逼近目标模型的对抗提示后验,训练后无需重新优化即可生成多样、流畅的越狱提示,对多种目标模型有效。
- 会议论文NeurIPS 2025
CTRL-ALT-DECEIT:自动化 AI 研发中的破坏评测
在 MLE-Bench 上评测 agent 植入后门、故意降低性能(sandbagging)等破坏行为,LM 监控能检出代码破坏,但 sandbagging 更难检测。
- 会议论文NeurIPS 2025
DPO 能学习多样的人类价值观吗?一个理论缩放律
建立理论框架分析 DPO 泛化如何随价值多样性与样本量缩放,给出泛化误差界,说明学习广泛价值观的困难,并在 LLM 上验证。
- 会议论文NeurIPS 2025
Among Us:衡量与检测 Agent 欺骗的沙盒
用社交推理游戏评测 18 个 LLM,发现 RL 训练模型更擅长欺骗而非识破;基于激活的探针检测欺骗 AUROC 超 95%。
- 会议论文NeurIPS 2025
Jailbreak-AudioBench:大型音频语言模型越狱威胁评测
提出含工具箱、数据集和基准的音频越狱评测体系,评估多个 LALM,并支持音频编辑等更强攻击与防御研究。
- 会议论文NeurIPS 2025
通过推理与强化学习实现 LLM 的情境完整性
用显式推理加 RL 框架训练模型判断何时该披露信息,仅用约 700 条合成数据即显著减少不当披露,并迁移到 PrivacyLens 基准。