全部动态
论文与会议论文
本页材料
24 条- 会议论文NeurIPS 2025
OS-Harm:计算机使用智能体安全性评测基准
基于 OSWorld 构建 150 个任务,覆盖用户恶意使用、提示注入和模型失当行为;前沿模型常直接服从滥用请求,且易受静态提示注入影响。
- 会议论文NeurIPS 2025
每次查询泄露的比特数:LLM 对抗攻击的信息论界
以观测信号与目标属性的互信息衡量泄露量,推出攻击所需查询数下界;在七个 LLM 上,仅答案约千次查询,加 logits 约百次,披露思考过程仅需数十次。
- 会议论文NeurIPS 2025
LinEAS:基于分布损失的端到端激活 steering 学习
用全局分布损失端到端训练线性激活 steering,仅需少量无配对样本即可缓解语言模型毒性,效果接近依赖强监督的方法。
- 会议论文NeurIPS 2025
CARE:通过回滚与自省干预实现解码时安全对齐
结合守卫模型实时监控、token 缓冲回滚与自省式批评干预,在解码时纠正不安全输出,兼顾低有害率与回答质量。
- 会议论文NeurIPS 2025
T2SMark:在扩散模型 Noise-as-Watermark 中平衡鲁棒性与多样性
提出基于尾部截断采样的两阶段水印方案,在 U-Net 与 DiT 扩散模型上兼顾水印鲁棒性与生成多样性,用于内容溯源与防滥用。
- 会议论文NeurIPS 2025
通过可证明鲁棒的模型对齐实现人类反馈的可扩展估值
提出具有可证明 redescending 性质的 Hölder-DPO,可在噪声偏好标签下鲁棒对齐,并检测错标样本;清除 HH-RLHF 中的噪声后对齐效果提升。
- 会议论文NeurIPS 2025
隐蔽而有效:保持分布的图分类后门攻击
提出 DPSBA 干净标签后门框架,通过对抗训练学习分布内触发器,抑制结构和语义异常,在攻击成功率与隐蔽性间取得更好平衡。
- 会议论文NeurIPS 2025
Generative RLHF-V:从多模态人类偏好中学习原则
提出将生成式奖励模型与多模态 RLHF 结合的对齐框架,在 7 个基准上使 4 个 MLLM 平均提升 18.1%,而基线 RLHF 仅提升 5.3%。
- 会议论文NeurIPS 2025
相邻词语,分歧意图:通过任务并发越狱大语言模型
提出词级任务并发方法并构建 JAIL-CON 迭代攻击框架,将有害任务与良性任务并发,能越狱主流 LLM,且比顺序式攻击更难被护栏检测。
- 会议论文NeurIPS 2025
TAI3:测试 Agent 对用户意图解释的完整性
提出 API 为中心的压力测试框架,通过语义分区和定向变异发现 LLM Agent 误解用户意图的错误,在 80 个工具 API 上优于基线。
- 会议论文NeurIPS 2025
基于二元询问的在线局部差分隐私共形预测
在局部差分隐私下构造流式数据的无模型预测集,单遍在线、O(1) 空间,并给出长期覆盖率的理论保证。
- 会议论文NeurIPS 2025
LLM 的个性化安全:基准与基于规划的 Agent 方法
提出个性化安全概念与 PENGUIN 基准(14000 个场景),发现用户背景信息可使安全分提升 43.2%,并提出免训练的 RAISE 框架,平均仅需 2.7 次提问即可提升最多 31.6%。
- 会议论文NeurIPS 2025
OpenUnlearning:统一方法与指标基准以加速 LLM 遗忘研究
标准化框架集成 13 种遗忘算法与 16 项评测,覆盖 TOFU、MUSE、WMDP,并提出评估指标忠实性与鲁棒性的元评测基准。
- 会议论文NeurIPS 2025
Permissioned LLMs:在大语言模型中强制执行访问控制
提出 PermLLM,让微调后的 LLM 回答遵循组织数据访问权限,给出形式化定义、基于 PEFT 的三种机制,以及基于成员推断的 access advantage 评测指标。
- 会议论文NeurIPS 2025
用追问预测黑盒语言模型的表现
以追问回答的概率训练线性预测器,可预测黑盒模型正确性,并检测被系统提示对抗操纵或被冒充的模型。
- 会议论文NeurIPS 2025
教得好学得坏:蒸馏条件式后门攻击
提出 DCBA:教师模型中的休眠后门在知识蒸馏后于学生模型中被激活,用双层优化方法 SCAR 实现,并能躲过现有后门检测。
- 会议论文NeurIPS 2025
LORE:面向视觉编码器的拉格朗日优化鲁棒嵌入
提出基于约束优化的无监督对抗微调框架 LORE,稳定训练并显著提升零样本对抗鲁棒性,干净数据精度损失很小。
- 会议论文NeurIPS 2025
超越 Oracle:面向指令层级的验证器监督
用带可执行验证器的指令冲突样本微调模型,提升指令层级遵循,并泛化提升对抗性安全基准上的鲁棒性。
- 会议论文NeurIPS 2025
基于自回归奖励引导表征编辑的 LLM 去毒
提出 ARGRE,在表征空间建模毒性过渡并训练奖励模型指导推理时编辑,在 8 个 LLM 上毒性降低 62.21%、推理时间减少 47.58%。
- 会议论文NeurIPS 2025
WASP:Web Agent 抗提示注入安全基准
提出端到端评测基准 WASP,发现顶级模型也会被简单人工注入欺骗,攻击部分成功率高达 86%,但完整达成攻击目标的情况较少。
- 会议论文NeurIPS 2025
强化学习中扩散模型引导的对抗状态扰动
提出基于扩散模型的 SHIFT 攻击,生成语义不同但逼真的扰动状态,能突破现有 RL 防御并优于已有攻击。
- 会议论文NeurIPS 2025
跨层对抗攻击:攻破文生图模型的多层防御
提出黑盒 TAA 框架,同时绕过提示过滤、概念擦除和图像过滤,在 14 个 T2I 模型上平均攻击成功率 85.6%。
- 会议论文NeurIPS 2025
成员究竟是什么?通过投毒使成员推断失信
证明可通过污染训练集让成员推断测试对目标样本给出错误预测,并给出准确率与抗投毒性的理论权衡,现有测试性能可降至随机以下。
- 会议论文NeurIPS 2025
简单取胜:重新思考用于 LLM 遗忘的 Negative Preference Optimization
指出 NPO 存在参考模型偏差,提出去除参考模型的 SimNPO 遗忘框架,在 TOFU、MUSE、WMDP 上验证有效。