全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
VERA:大语言模型越狱的变分推断框架
把黑盒越狱建模为变分推断,训练小型攻击 LLM 逼近目标模型的对抗提示后验,训练后无需重新优化即可生成多样、流畅的越狱提示,对多种目标模型有效。
- 会议论文NeurIPS 2025
CTRL-ALT-DECEIT:自动化 AI 研发中的破坏评测
在 MLE-Bench 上评测 agent 植入后门、故意降低性能(sandbagging)等破坏行为,LM 监控能检出代码破坏,但 sandbagging 更难检测。
- 会议论文NeurIPS 2025
DPO 能学习多样的人类价值观吗?一个理论缩放律
建立理论框架分析 DPO 泛化如何随价值多样性与样本量缩放,给出泛化误差界,说明学习广泛价值观的困难,并在 LLM 上验证。
- 会议论文NeurIPS 2025
Among Us:衡量与检测 Agent 欺骗的沙盒
用社交推理游戏评测 18 个 LLM,发现 RL 训练模型更擅长欺骗而非识破;基于激活的探针检测欺骗 AUROC 超 95%。
- 会议论文NeurIPS 2025
Jailbreak-AudioBench:大型音频语言模型越狱威胁评测
提出含工具箱、数据集和基准的音频越狱评测体系,评估多个 LALM,并支持音频编辑等更强攻击与防御研究。
- 会议论文NeurIPS 2025
通过推理与强化学习实现 LLM 的情境完整性
用显式推理加 RL 框架训练模型判断何时该披露信息,仅用约 700 条合成数据即显著减少不当披露,并迁移到 PrivacyLens 基准。
- 会议论文NeurIPS 2025
重新审视逐字记忆在 LLM 隐私中的作用
在含 PII 的合成传记上微调并经聊天提取,发现更好的逐字记忆未必增加泄露,而知识处理能力更强的模型更易被提取,孤立看记忆会误导。
- 会议论文NeurIPS 2025
T2V-OptJail:面向文生视频越狱攻击的离散提示词优化
首次将文生视频越狱形式化为离散优化问题,在 Open-Sora 及 Pika、Luma、Kling 等商用模型上,攻击成功率比现有 SoTA 提升约 10–11 个百分点。
- 会议论文NeurIPS 2025
通过 f-差分隐私缓解去中心化联邦学习的隐私-效用权衡
提出 PN-f-DP 与 Sec-f-LDP 两种隐私核算方法,比 Rényi DP 给出更紧的 (ε, δ) 界和更好的效用。
- 会议论文NeurIPS 2025
面向自回归音频生成模型的鲁棒无失真水印
针对音频重新分词不匹配问题提出 Aligned-IS 无失真水印,通过 token 聚类在保持音质的同时显著提升水印检测率。
- 会议论文NeurIPS 2025
理解并改进针对 l0 有界扰动的快速对抗训练
分析 l0 对抗训练中 catastrophic overfitting 源于单步攻击扰动位置次优,并用 soft labels 与 trade-off loss 平滑损失面,缩小单步与多步训练差距。
- 会议论文NeurIPS 2025
SNEAKDOOR:针对分布匹配式数据集浓缩的隐蔽后门攻击
利用类决策边界的脆弱性,用生成模块构造与局部特征几何对齐的输入感知触发器,在保持攻击成功率与干净精度的同时显著提升合成数据与触发样本的隐蔽性。
- 会议论文NeurIPS 2025
从流形假设视角看生成式模型反演
发现生成式模型反演攻击实质是把噪声梯度投影到生成器流形切空间,并验证梯度与流形越对齐模型越易受攻击,进而提出提升反演效果的免训练方法。
- 会议论文NeurIPS 2025
DiffBreak:基于扩散的对抗净化真的鲁棒吗?
理论与实验表明扩散净化的鲁棒性因梯度不准和评估协议缺陷被高估,提出 DiffBreak 工具包,并设计针对多数投票防御的攻击,使其失效。
- 会议论文NeurIPS 2025
利用 ViT 的计算冗余提升对抗迁移性
发现 ViT 的数据级与模型级冗余可放大攻击效果,设计一套技术显著提升对抗样本在多种 ViT 及视觉大模型上的迁移性。
- 会议论文NeurIPS 2025
从休眠到删除:基于权重空间正则化的抗篡改遗忘
发现遗忘方法易受再学习攻击,仅在保留集上微调即可恢复遗忘知识;据权重空间性质提出新方法,提升抗再学习攻击能力。
- 会议论文NeurIPS 2025
约束熵遗忘:面向 LLM 的原始-对偶框架
将 LLM 遗忘学习表述为约束优化问题,用 logit-margin flattening 损失和原始-对偶算法,在 TOFU 与 MUSE 上有效移除敏感信息并保持效用。
- 会议论文NeurIPS 2025
RiOSWorld:多模态计算机使用 Agent 的风险评测基准
构建含 492 个风险任务的真实环境基准,评估用户与环境来源风险,发现现有计算机使用 Agent 面临显著安全风险。
- 会议论文NeurIPS 2025
LLM 安全对齐本质上是散度估计
证明 RLHF 等对齐方法可视为安全与有害分布间的散度估计,据此提出 KLDO 方法,并给出衡量表示空间分离度的安全指标。
- 会议论文NeurIPS 2025
迈向高效推断攻击:基于 Mixture-of-Experts 的影子模型共享
提出 SHAPOOL,用 MoE 让多个影子模型共享子网络并联合训练,在保持成员推断攻击效果的同时显著降低影子模型构建成本。
- 会议论文NeurIPS 2025
AC-LoRA:近乎免训练的访问控制感知多模态 LLM
为企业 LLM 聊天机器人设计按权限隔离的 LoRA 适配器检索与合并方案,提供信息隔离保证,性能匹配或超过现有 LoRA 混合方法。
- 会议论文NeurIPS 2025
视觉语言模型中的跨模态记忆量化
构建合成人物数据集,量化 VLM 的跨模态记忆与迁移,发现一种模态学到的事实可迁移到另一模态但存在明显差距,并提出缓解基线。
- 会议论文NeurIPS 2025
Deep Value Benchmark:衡量模型泛化的是深层价值还是浅层偏好
通过控制深层价值与浅层特征的混淆来测 DVGR,9 个模型平均仅 0.30,均低于随机水平,且更大模型略低。
- 会议论文NeurIPS 2025
推理模型中的霍桑效应:评测并操控测试感知
用白盒探针识别并操控推理模型的测试感知,发现它会显著影响有害请求的服从等安全对齐表现,且影响方向与幅度因模型而异。