全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
语言模型的终身安全对齐
让 Meta-Attacker 持续发现新越狱策略、Defender 对抗训练,Defender 最终将 Meta-Attacker 的成功率压到 7%。
- 会议论文NeurIPS 2025
极简高效的攻击基线:对 GPT-4.5/4o/o1 等黑盒模型成功率超 90%
通过局部裁剪并在嵌入空间对齐目标图像,在语义丰富区域集中扰动,对商业 LVLM 的迁移式定向攻击成功率超 90%。
- 会议论文NeurIPS 2025
针对去中心化联邦学习的竞争优势攻击
提出 SelfishAttack,自私客户端向其他客户端发送精心构造的本地模型,使自己的最终模型比其余客户端更准确,且效果优于投毒攻击。
- 会议论文NeurIPS 2025
理解安全对齐:从安全神经元看机制可解释性
用激活对比定位约 5% 的安全神经元,仅修补其激活即可恢复超过 90% 的安全表现,并解释对齐税,还可在生成前检测不安全输出。
- 会议论文NeurIPS 2025
个性化本地差分隐私下的求和估计
针对各用户隐私参数不同的个性化 LDP,提出两种分别基于数据半径和直径的求和/均值估计协议,精度显著优于现有方法。
- 会议论文NeurIPS 2025
InvisibleInk:高效用低成本的差分隐私文本生成
把 LLM 采样视为对 logits 的指数机制,仅裁剪敏感信息并从 top-k 超集免费采样,达到同等效用时计算成本降低 8 倍以上。
- 会议论文NeurIPS 2025
FALCON:面向 LLM 的对比正交去对齐细粒度激活操控遗忘
提出表示引导的遗忘方法,用对比机制与正交梯度投影去除 LLM 中敏感或有害知识,兼顾遗忘效果与模型效用,并抵抗知识恢复。
- 会议论文NeurIPS 2025
“Erasing the Invisible”技术报告:2024 NeurIPS 图像水印压力测试竞赛
组织水印攻击竞赛并发布基准,前五名团队平均可去除至少 89% 图像的水印且保持画质,暴露了现有水印方法的脆弱性。
- 会议论文NeurIPS 2025
LLM 真的遗忘了吗?基于知识关联与置信度的遗忘评测
用带置信度的知识图谱和 LLM 评判构建遗忘评测框架,发现被认为已遗忘的事实可通过关联信息隐式保留,现有评测高估了遗忘效果。
- 会议论文NeurIPS 2025
遗忘了但没忘干净:精确遗忘后 LLM 的数据提取攻击
在暴露遗忘前后 logits 的场景下,用前模型引导后模型提取被删数据,在 MUSE、TOFU、WMDP 上成功率最高翻倍,表明精确遗忘反而可能增加泄露风险。
- 会议论文NeurIPS 2025
真的需要公开数据吗?表格数据差分隐私的替代公开数据
用 LLM 仅凭 schema 生成替代公开表格数据,可在不消耗隐私预算的情况下替代公开数据,用于差分隐私分类器预训练。
- 会议论文NeurIPS 2025
衡量 AI 完成长软件任务的能力
提出 50% 任务完成时间跨度指标,o3 约 110 分钟,前沿模型时间跨度约每七个月翻倍,并讨论自主性提升对危险能力的影响。
- 会议论文NeurIPS 2025
E2E-VGuard:面向生产级 LLM 端到端语音合成的对抗式防护
用编码器集成保护音色、ASR 对抗样本干扰发音,抵御声音克隆欺诈,在 16 个开源合成器和 3 个商业 API 上验证有效。
- 会议论文NeurIPS 2025
有理论保证的 LLM 水印框架:分布自适应方法
联合优化水印方案与检测器,给出最优解并提出无失真的分布自适应算法 DAWA,在极低误报率下检测效果良好。
- 会议论文NeurIPS 2025
大语言模型的可扩展指纹技术
提出 Perinucleus sampling,在 Llama-3.1-8B 中嵌入 24,576 条指纹且不损害效用,微调后仍保留,并缓解指纹泄露等安全风险。
- 会议论文NeurIPS 2025
ReliabilityRAG:面向 RAG 网页搜索的可证明鲁棒防御
利用文档可靠性信号,通过在矛盾图上求最大独立集筛除恶意文档,并给出可证明鲁棒性保证;对检索语料攻击的鲁棒性优于已有方法且保持良性准确率。
- 会议论文NeurIPS 2025
OS-Harm:计算机使用智能体安全性评测基准
基于 OSWorld 构建 150 个任务,覆盖用户恶意使用、提示注入和模型失当行为;前沿模型常直接服从滥用请求,且易受静态提示注入影响。
- 会议论文NeurIPS 2025
每次查询泄露的比特数:LLM 对抗攻击的信息论界
以观测信号与目标属性的互信息衡量泄露量,推出攻击所需查询数下界;在七个 LLM 上,仅答案约千次查询,加 logits 约百次,披露思考过程仅需数十次。
- 会议论文NeurIPS 2025
LinEAS:基于分布损失的端到端激活 steering 学习
用全局分布损失端到端训练线性激活 steering,仅需少量无配对样本即可缓解语言模型毒性,效果接近依赖强监督的方法。
- 会议论文NeurIPS 2025
CARE:通过回滚与自省干预实现解码时安全对齐
结合守卫模型实时监控、token 缓冲回滚与自省式批评干预,在解码时纠正不安全输出,兼顾低有害率与回答质量。
- 会议论文NeurIPS 2025
T2SMark:在扩散模型 Noise-as-Watermark 中平衡鲁棒性与多样性
提出基于尾部截断采样的两阶段水印方案,在 U-Net 与 DiT 扩散模型上兼顾水印鲁棒性与生成多样性,用于内容溯源与防滥用。
- 会议论文NeurIPS 2025
通过可证明鲁棒的模型对齐实现人类反馈的可扩展估值
提出具有可证明 redescending 性质的 Hölder-DPO,可在噪声偏好标签下鲁棒对齐,并检测错标样本;清除 HH-RLHF 中的噪声后对齐效果提升。
- 会议论文NeurIPS 2025
隐蔽而有效:保持分布的图分类后门攻击
提出 DPSBA 干净标签后门框架,通过对抗训练学习分布内触发器,抑制结构和语义异常,在攻击成功率与隐蔽性间取得更好平衡。
- 会议论文NeurIPS 2025
Generative RLHF-V:从多模态人类偏好中学习原则
提出将生成式奖励模型与多模态 RLHF 结合的对齐框架,在 7 个基准上使 4 个 MLLM 平均提升 18.1%,而基线 RLHF 仅提升 5.3%。