全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
重新审视逐字记忆在 LLM 隐私中的作用
在含 PII 的合成传记上微调并经聊天提取,发现更好的逐字记忆未必增加泄露,而知识处理能力更强的模型更易被提取,孤立看记忆会误导。
- 会议论文NeurIPS 2025
T2V-OptJail:面向文生视频越狱攻击的离散提示词优化
首次将文生视频越狱形式化为离散优化问题,在 Open-Sora 及 Pika、Luma、Kling 等商用模型上,攻击成功率比现有 SoTA 提升约 10–11 个百分点。
- 会议论文NeurIPS 2025
通过 f-差分隐私缓解去中心化联邦学习的隐私-效用权衡
提出 PN-f-DP 与 Sec-f-LDP 两种隐私核算方法,比 Rényi DP 给出更紧的 (ε, δ) 界和更好的效用。
- 会议论文NeurIPS 2025
面向自回归音频生成模型的鲁棒无失真水印
针对音频重新分词不匹配问题提出 Aligned-IS 无失真水印,通过 token 聚类在保持音质的同时显著提升水印检测率。
- 会议论文NeurIPS 2025
理解并改进针对 l0 有界扰动的快速对抗训练
分析 l0 对抗训练中 catastrophic overfitting 源于单步攻击扰动位置次优,并用 soft labels 与 trade-off loss 平滑损失面,缩小单步与多步训练差距。
- 会议论文NeurIPS 2025
SNEAKDOOR:针对分布匹配式数据集浓缩的隐蔽后门攻击
利用类决策边界的脆弱性,用生成模块构造与局部特征几何对齐的输入感知触发器,在保持攻击成功率与干净精度的同时显著提升合成数据与触发样本的隐蔽性。
- 会议论文NeurIPS 2025
从流形假设视角看生成式模型反演
发现生成式模型反演攻击实质是把噪声梯度投影到生成器流形切空间,并验证梯度与流形越对齐模型越易受攻击,进而提出提升反演效果的免训练方法。
- 会议论文NeurIPS 2025
DiffBreak:基于扩散的对抗净化真的鲁棒吗?
理论与实验表明扩散净化的鲁棒性因梯度不准和评估协议缺陷被高估,提出 DiffBreak 工具包,并设计针对多数投票防御的攻击,使其失效。
- 会议论文NeurIPS 2025
利用 ViT 的计算冗余提升对抗迁移性
发现 ViT 的数据级与模型级冗余可放大攻击效果,设计一套技术显著提升对抗样本在多种 ViT 及视觉大模型上的迁移性。
- 会议论文NeurIPS 2025
从休眠到删除:基于权重空间正则化的抗篡改遗忘
发现遗忘方法易受再学习攻击,仅在保留集上微调即可恢复遗忘知识;据权重空间性质提出新方法,提升抗再学习攻击能力。
- 会议论文NeurIPS 2025
约束熵遗忘:面向 LLM 的原始-对偶框架
将 LLM 遗忘学习表述为约束优化问题,用 logit-margin flattening 损失和原始-对偶算法,在 TOFU 与 MUSE 上有效移除敏感信息并保持效用。
- 会议论文NeurIPS 2025
RiOSWorld:多模态计算机使用 Agent 的风险评测基准
构建含 492 个风险任务的真实环境基准,评估用户与环境来源风险,发现现有计算机使用 Agent 面临显著安全风险。
- 会议论文NeurIPS 2025
LLM 安全对齐本质上是散度估计
证明 RLHF 等对齐方法可视为安全与有害分布间的散度估计,据此提出 KLDO 方法,并给出衡量表示空间分离度的安全指标。
- 会议论文NeurIPS 2025
迈向高效推断攻击:基于 Mixture-of-Experts 的影子模型共享
提出 SHAPOOL,用 MoE 让多个影子模型共享子网络并联合训练,在保持成员推断攻击效果的同时显著降低影子模型构建成本。
- 会议论文NeurIPS 2025
AC-LoRA:近乎免训练的访问控制感知多模态 LLM
为企业 LLM 聊天机器人设计按权限隔离的 LoRA 适配器检索与合并方案,提供信息隔离保证,性能匹配或超过现有 LoRA 混合方法。
- 会议论文NeurIPS 2025
视觉语言模型中的跨模态记忆量化
构建合成人物数据集,量化 VLM 的跨模态记忆与迁移,发现一种模态学到的事实可迁移到另一模态但存在明显差距,并提出缓解基线。
- 会议论文NeurIPS 2025
Deep Value Benchmark:衡量模型泛化的是深层价值还是浅层偏好
通过控制深层价值与浅层特征的混淆来测 DVGR,9 个模型平均仅 0.30,均低于随机水平,且更大模型略低。
- 会议论文NeurIPS 2025
推理模型中的霍桑效应:评测并操控测试感知
用白盒探针识别并操控推理模型的测试感知,发现它会显著影响有害请求的服从等安全对齐表现,且影响方向与幅度因模型而异。
- 会议论文NeurIPS 2025
Angular Steering:通过激活空间旋转控制行为
将 steering 表述为固定二维子空间内的几何旋转,对拒答与顺从等行为实现连续细粒度控制,并保持通用语言建模性能。
- 会议论文NeurIPS 2025
文生图扩散模型 NSFW 内容擦除的综合评估与分析
提出概念擦除全流程工具包,对 NSFW 概念擦除方法做首次系统研究,并给出实际应用指导。
- 会议论文NeurIPS 2025
LARGO:基于梯度优化的潜空间对抗反思越狱 LLM
在 LLM 连续潜空间优化对抗向量再解码为自然语言,生成流畅隐蔽的越狱提示,在 AdvBench 与 JailbreakBench 上攻击成功率比 AutoDAN 等高 44 点。
- 会议论文NeurIPS 2025
Conformal Arbitrage:语言模型中竞争目标的风险受控平衡
用 conformal risk control 校准阈值,在主模型与保守 Guardian 之间切换,使事实错误或安全违规频率有分布无关的有限样本保证。
- 会议论文NeurIPS 2025
EVOREFUSE:评估并缓解 LLM 对伪恶意指令过度拒答的进化式提示优化
用进化算法生成诱发过度拒答的伪恶意指令,构建评测集与对齐数据;微调后 Llama3.1-8B 过度拒答最多减少 29.85% 且不损安全。
- 会议论文NeurIPS 2025
LoRO:基于 TEE 低秩混淆的 LLM 端侧实时安全推理
发现现有 TEE 保护方法存在统计漏洞并提出带先验的模型窃取攻击,LoRO 用低秩稠密掩码混淆参数,窃取精度远低于现有方法,推理延迟仅 1.49 倍。