全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
LLM 真的遗忘了吗?基于知识关联与置信度的遗忘评测
用带置信度的知识图谱和 LLM 评判构建遗忘评测框架,发现被认为已遗忘的事实可通过关联信息隐式保留,现有评测高估了遗忘效果。
- 会议论文NeurIPS 2025
遗忘了但没忘干净:精确遗忘后 LLM 的数据提取攻击
在暴露遗忘前后 logits 的场景下,用前模型引导后模型提取被删数据,在 MUSE、TOFU、WMDP 上成功率最高翻倍,表明精确遗忘反而可能增加泄露风险。
- 会议论文NeurIPS 2025
真的需要公开数据吗?表格数据差分隐私的替代公开数据
用 LLM 仅凭 schema 生成替代公开表格数据,可在不消耗隐私预算的情况下替代公开数据,用于差分隐私分类器预训练。
- 会议论文NeurIPS 2025
衡量 AI 完成长软件任务的能力
提出 50% 任务完成时间跨度指标,o3 约 110 分钟,前沿模型时间跨度约每七个月翻倍,并讨论自主性提升对危险能力的影响。
- 会议论文NeurIPS 2025
E2E-VGuard:面向生产级 LLM 端到端语音合成的对抗式防护
用编码器集成保护音色、ASR 对抗样本干扰发音,抵御声音克隆欺诈,在 16 个开源合成器和 3 个商业 API 上验证有效。
- 会议论文NeurIPS 2025
有理论保证的 LLM 水印框架:分布自适应方法
联合优化水印方案与检测器,给出最优解并提出无失真的分布自适应算法 DAWA,在极低误报率下检测效果良好。
- 会议论文NeurIPS 2025
大语言模型的可扩展指纹技术
提出 Perinucleus sampling,在 Llama-3.1-8B 中嵌入 24,576 条指纹且不损害效用,微调后仍保留,并缓解指纹泄露等安全风险。
- 会议论文NeurIPS 2025
ReliabilityRAG:面向 RAG 网页搜索的可证明鲁棒防御
利用文档可靠性信号,通过在矛盾图上求最大独立集筛除恶意文档,并给出可证明鲁棒性保证;对检索语料攻击的鲁棒性优于已有方法且保持良性准确率。
- 会议论文NeurIPS 2025
OS-Harm:计算机使用智能体安全性评测基准
基于 OSWorld 构建 150 个任务,覆盖用户恶意使用、提示注入和模型失当行为;前沿模型常直接服从滥用请求,且易受静态提示注入影响。
- 会议论文NeurIPS 2025
每次查询泄露的比特数:LLM 对抗攻击的信息论界
以观测信号与目标属性的互信息衡量泄露量,推出攻击所需查询数下界;在七个 LLM 上,仅答案约千次查询,加 logits 约百次,披露思考过程仅需数十次。
- 会议论文NeurIPS 2025
LinEAS:基于分布损失的端到端激活 steering 学习
用全局分布损失端到端训练线性激活 steering,仅需少量无配对样本即可缓解语言模型毒性,效果接近依赖强监督的方法。
- 会议论文NeurIPS 2025
CARE:通过回滚与自省干预实现解码时安全对齐
结合守卫模型实时监控、token 缓冲回滚与自省式批评干预,在解码时纠正不安全输出,兼顾低有害率与回答质量。
- 会议论文NeurIPS 2025
T2SMark:在扩散模型 Noise-as-Watermark 中平衡鲁棒性与多样性
提出基于尾部截断采样的两阶段水印方案,在 U-Net 与 DiT 扩散模型上兼顾水印鲁棒性与生成多样性,用于内容溯源与防滥用。
- 会议论文NeurIPS 2025
通过可证明鲁棒的模型对齐实现人类反馈的可扩展估值
提出具有可证明 redescending 性质的 Hölder-DPO,可在噪声偏好标签下鲁棒对齐,并检测错标样本;清除 HH-RLHF 中的噪声后对齐效果提升。
- 会议论文NeurIPS 2025
隐蔽而有效:保持分布的图分类后门攻击
提出 DPSBA 干净标签后门框架,通过对抗训练学习分布内触发器,抑制结构和语义异常,在攻击成功率与隐蔽性间取得更好平衡。
- 会议论文NeurIPS 2025
Generative RLHF-V:从多模态人类偏好中学习原则
提出将生成式奖励模型与多模态 RLHF 结合的对齐框架,在 7 个基准上使 4 个 MLLM 平均提升 18.1%,而基线 RLHF 仅提升 5.3%。
- 会议论文NeurIPS 2025
相邻词语,分歧意图:通过任务并发越狱大语言模型
提出词级任务并发方法并构建 JAIL-CON 迭代攻击框架,将有害任务与良性任务并发,能越狱主流 LLM,且比顺序式攻击更难被护栏检测。
- 会议论文NeurIPS 2025
TAI3:测试 Agent 对用户意图解释的完整性
提出 API 为中心的压力测试框架,通过语义分区和定向变异发现 LLM Agent 误解用户意图的错误,在 80 个工具 API 上优于基线。
- 会议论文NeurIPS 2025
基于二元询问的在线局部差分隐私共形预测
在局部差分隐私下构造流式数据的无模型预测集,单遍在线、O(1) 空间,并给出长期覆盖率的理论保证。
- 会议论文NeurIPS 2025
LLM 的个性化安全:基准与基于规划的 Agent 方法
提出个性化安全概念与 PENGUIN 基准(14000 个场景),发现用户背景信息可使安全分提升 43.2%,并提出免训练的 RAISE 框架,平均仅需 2.7 次提问即可提升最多 31.6%。
- 会议论文NeurIPS 2025
OpenUnlearning:统一方法与指标基准以加速 LLM 遗忘研究
标准化框架集成 13 种遗忘算法与 16 项评测,覆盖 TOFU、MUSE、WMDP,并提出评估指标忠实性与鲁棒性的元评测基准。
- 会议论文NeurIPS 2025
Permissioned LLMs:在大语言模型中强制执行访问控制
提出 PermLLM,让微调后的 LLM 回答遵循组织数据访问权限,给出形式化定义、基于 PEFT 的三种机制,以及基于成员推断的 access advantage 评测指标。
- 会议论文NeurIPS 2025
用追问预测黑盒语言模型的表现
以追问回答的概率训练线性预测器,可预测黑盒模型正确性,并检测被系统提示对抗操纵或被冒充的模型。
- 会议论文NeurIPS 2025
教得好学得坏:蒸馏条件式后门攻击
提出 DCBA:教师模型中的休眠后门在知识蒸馏后于学生模型中被激活,用双层优化方法 SCAR 实现,并能躲过现有后门检测。