全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
相邻词语,分歧意图:通过任务并发越狱大语言模型
提出词级任务并发方法并构建 JAIL-CON 迭代攻击框架,将有害任务与良性任务并发,能越狱主流 LLM,且比顺序式攻击更难被护栏检测。
- 会议论文NeurIPS 2025
TAI3:测试 Agent 对用户意图解释的完整性
提出 API 为中心的压力测试框架,通过语义分区和定向变异发现 LLM Agent 误解用户意图的错误,在 80 个工具 API 上优于基线。
- 会议论文NeurIPS 2025
基于二元询问的在线局部差分隐私共形预测
在局部差分隐私下构造流式数据的无模型预测集,单遍在线、O(1) 空间,并给出长期覆盖率的理论保证。
- 会议论文NeurIPS 2025
LLM 的个性化安全:基准与基于规划的 Agent 方法
提出个性化安全概念与 PENGUIN 基准(14000 个场景),发现用户背景信息可使安全分提升 43.2%,并提出免训练的 RAISE 框架,平均仅需 2.7 次提问即可提升最多 31.6%。
- 会议论文NeurIPS 2025
OpenUnlearning:统一方法与指标基准以加速 LLM 遗忘研究
标准化框架集成 13 种遗忘算法与 16 项评测,覆盖 TOFU、MUSE、WMDP,并提出评估指标忠实性与鲁棒性的元评测基准。
- 会议论文NeurIPS 2025
Permissioned LLMs:在大语言模型中强制执行访问控制
提出 PermLLM,让微调后的 LLM 回答遵循组织数据访问权限,给出形式化定义、基于 PEFT 的三种机制,以及基于成员推断的 access advantage 评测指标。
- 会议论文NeurIPS 2025
用追问预测黑盒语言模型的表现
以追问回答的概率训练线性预测器,可预测黑盒模型正确性,并检测被系统提示对抗操纵或被冒充的模型。
- 会议论文NeurIPS 2025
教得好学得坏:蒸馏条件式后门攻击
提出 DCBA:教师模型中的休眠后门在知识蒸馏后于学生模型中被激活,用双层优化方法 SCAR 实现,并能躲过现有后门检测。
- 会议论文NeurIPS 2025
LORE:面向视觉编码器的拉格朗日优化鲁棒嵌入
提出基于约束优化的无监督对抗微调框架 LORE,稳定训练并显著提升零样本对抗鲁棒性,干净数据精度损失很小。
- 会议论文NeurIPS 2025
超越 Oracle:面向指令层级的验证器监督
用带可执行验证器的指令冲突样本微调模型,提升指令层级遵循,并泛化提升对抗性安全基准上的鲁棒性。
- 会议论文NeurIPS 2025
基于自回归奖励引导表征编辑的 LLM 去毒
提出 ARGRE,在表征空间建模毒性过渡并训练奖励模型指导推理时编辑,在 8 个 LLM 上毒性降低 62.21%、推理时间减少 47.58%。
- 会议论文NeurIPS 2025
WASP:Web Agent 抗提示注入安全基准
提出端到端评测基准 WASP,发现顶级模型也会被简单人工注入欺骗,攻击部分成功率高达 86%,但完整达成攻击目标的情况较少。
- 会议论文NeurIPS 2025
强化学习中扩散模型引导的对抗状态扰动
提出基于扩散模型的 SHIFT 攻击,生成语义不同但逼真的扰动状态,能突破现有 RL 防御并优于已有攻击。
- 会议论文NeurIPS 2025
跨层对抗攻击:攻破文生图模型的多层防御
提出黑盒 TAA 框架,同时绕过提示过滤、概念擦除和图像过滤,在 14 个 T2I 模型上平均攻击成功率 85.6%。
- 会议论文NeurIPS 2025
成员究竟是什么?通过投毒使成员推断失信
证明可通过污染训练集让成员推断测试对目标样本给出错误预测,并给出准确率与抗投毒性的理论权衡,现有测试性能可降至随机以下。
- 会议论文NeurIPS 2025
简单取胜:重新思考用于 LLM 遗忘的 Negative Preference Optimization
指出 NPO 存在参考模型偏差,提出去除参考模型的 SimNPO 遗忘框架,在 TOFU、MUSE、WMDP 上验证有效。
- 会议论文NeurIPS 2025
BridgePure:有限的保护泄露即可攻破黑盒数据保护
提出保护泄露威胁模型,用少量未保护数据训练扩散桥模型,可去除黑盒不可学习样本的保护,暴露其漏洞。
- 会议论文NeurIPS 2025
带差分隐私的多类支持向量机
提出 PMSVM,通过权重和梯度扰动让多类 SVM 只访问每个样本一次,在多类场景下优于现有 DP-SVM 方法。
- 会议论文NeurIPS 2025
理解并纠正 VLM 中的安全感知失真
发现视觉模态引入使激活偏向“更安全”方向、导致 VLM 高估有害输入安全性,提出免训练的 ShiftDC 校准,恢复对齐且不损害能力。
- 会议论文NeurIPS 2025
通过排斥式视觉提示调优防御多模态后门模型
提出 RVPT,仅调 0.27% 参数并用特征排斥损失,将 CLIP 后门攻击成功率从 89.70% 降到 2.76%。
- 会议论文NeurIPS 2025
GuardReasoner-VL:通过强化推理守护 VLM
构建推理型 VLM 护栏模型,经 SFT 冷启动与在线 RL 训练,在多模态内容审核上平均 F1 比次优方法高 19.27%,并开源数据与模型。
- 会议论文NeurIPS 2025
智者知所不言:基于注意力转移的无幻觉 LLM 遗忘
提出 Attention-Shifting 遗忘框架,抑制事实 token 注意力并抑制编造回答,在 ToFU 与 TDEC 上准确率最高提升 15%、10%。
- 会议论文NeurIPS 2025
HQA-VLAttack:针对视觉语言预训练模型的高质量对抗攻击
提出黑盒框架,文本端用反拟合词向量替换,图像端用对比学习优化扰动,在三个基准上攻击成功率显著优于基线。
- 会议论文NeurIPS 2025
消失于无形:针对 SAM2 的跨提示通用对抗攻击
提出首个针对 SAM2 的跨提示通用对抗攻击 UAP-SAM2,通过双重语义偏移扰动,在六个数据集上大幅超越现有攻击。