全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
RepGuard:大语言模型后门防御的自适应特征解耦
通过局部一致性与样本偏差定位可疑后门特征,并自适应掩码解耦,无需知道触发器;在目标拒答与越狱任务上平均将攻击成功率降低近 80%。
- 会议论文NeurIPS 2025
安全 + 安全 = 不安全?利用安全图像越狱大型视觉语言模型
提出 Safety Snowball Agent,借助 LVLM 的通用推理与安全滚雪球效应,用几乎任意图像逐步诱导有害输出,对最新 LVLM 越狱成功率高。
- 会议论文NeurIPS 2025
可解释的 RLHF:改进对齐
通过定位导致不满意回复的训练数据并对其进行遗忘,在不显著损害其他回复的前提下改进 RLHF 对齐后的语言模型。
- 会议论文NeurIPS 2025
Unlearning-Aware Minimization:遗忘感知最小化
提出 min-max 机器遗忘框架 UAM,在图像分类及 WMDP-Bio/Cyber 基准上优于现有遗忘方法。
- 会议论文NeurIPS 2025
通过降低指令不确定性探索语义约束对抗样本
提出 InSUR 框架,从自然语言指令生成可迁移、自适应的语义约束对抗样本,并首次实现无参考的语义约束 3D 对抗样本生成。
- 会议论文NeurIPS 2025
拟合分布:针对多模态大模型的跨图像/提示对抗攻击
基于分布近似理论,优化单个输入无关的对抗扰动,使其在不同图文对间迁移,诱导 MLLM 产生有害回复。
- 会议论文NeurIPS 2025
通过特征最优对齐对闭源 MLLM 的对抗攻击
提出 FOA-Attack,结合全局余弦损失与基于最优传输的局部特征对齐及动态集成加权,提升对闭源 MLLM 的定向迁移攻击成功率。
- 会议论文NeurIPS 2025
加固时间序列:DTW 认证鲁棒的异常检测
基于随机平滑提出首个 DTW 距离下的认证鲁棒防御,在 DTW 对抗攻击下 F1 比传统认证模型最高提升 18.7%。
- 会议论文NeurIPS 2025
守护生命语言:从 DNA 语言模型到蛋白质的可遗传水印
针对 DNA 语言模型的生物安全双重用途风险,提出 DNAMark 与 CentralMark 水印,后者可从 DNA 传递到翻译出的蛋白质,检测 F1 超过 0.85。
- 会议论文NeurIPS 2025
纠正基于偏好的奖励学习中的捷径行为
将奖励作弊视为捷径行为,提出 PRISM 学习群不变核,降低奖励模型对冗长、谄媚等伪特征的依赖并提升 OOD 准确率。
- 会议论文NeurIPS 2025
追根溯源:利用扩散轨迹的时间动态做来源归属
分析整条扩散轨迹来判断图像是否来自训练集,挑战 Goldilocks zone 假设,并指出现有成员推断方法在分布偏移或含生成数据时会失效。
- 会议论文NeurIPS 2025
GuardSet-X:大规模多领域、基于安全政策的护栏数据集
覆盖八个领域、基于真实安全准则构建,并含对抗增强样本,评测 19 个护栏模型,发现跨风险类别方差大,且都易受优化的对抗攻击。
- 会议论文NeurIPS 2025
RoMa:保护扩散模型知识产权的鲁棒模型水印方案
利用线性模式连通性分析水印对微调的脆弱性,提出提升路径平滑性的水印方案,显著增强抗微调鲁棒性并保持生成质量。
- 会议论文NeurIPS 2025
AgentBreeder:通过自我改进缓解多智能体脚手架的 AI 安全风险
用多目标进化搜索多智能体脚手架:蓝色模式下安全基准平均提升 79.4%,红色模式下发现对抗性薄弱的脚手架。
- 会议论文NeurIPS 2025
从判断到干预:通过流式内容监控提前终止 LLM 有害输出
构建 token 级标注数据集 FineHarm 并训练流式监控器 SCM,平均仅看前 18% token 即达到接近全文检测的 F1,还可作为伪标注器改进安全对齐。
- 会议论文NeurIPS 2025
用奇异池化增强图分类鲁棒性
理论分析 sum、average、max 池化的对抗风险,提出基于主奇异向量的 RS-Pool,在对抗攻击下更鲁棒且保持干净精度。
- 会议论文NeurIPS 2025
Video-SafetyBench:视频大视觉语言模型安全评测基准
构建含 2,264 个视频-文本对、48 类不安全类别的基准并提出 RJScore,良性查询配合视频的平均攻击成功率达 67.2%。
- 会议论文NeurIPS 2025
C-SafeGen:基于声明级流式护栏的可认证安全 LLM 生成
提出 Claim-based Stream Decoding,用流式护栏检查并回溯修订高风险声明,并以共形分析给出可认证的安全风险上界,含在线设置。
- 会议论文NeurIPS 2025
FocalLoRA:面向 LLM 指令层级对齐的焦点注意力头微调
针对指令冲突时 LLM 难以遵循系统级指令的问题,只微调对冲突敏感的 focal heads,在 Llama-8B 上用 0.0188% 参数将系统指令遵循率提升 35.52%。
- 会议论文NeurIPS 2025
学到错误的教训:语言模型中的句法-领域伪相关
发现模型会把句法模板与领域错误关联,可覆盖提示语义;并展示这种伪相关能绕过 OLMo-2-7B Instruct 和 GPT-4o 的拒答。
- 会议论文NeurIPS 2025
CoT Red-Handed:对思维链监控的压力测试
在模型被指示执行有害副任务的红队设置中比较 CoT 监控与仅动作监控,发现 CoT 可含误导性辩解,提出混合监控,对隐蔽欺骗的检出率达两倍。
- 会议论文NeurIPS 2025
吸引力元数据攻击:诱导 LLM Agent 调用恶意工具
通过黑盒优化生成更具吸引力的工具元数据,使 Agent 优先选择恶意工具,攻击成功率 81%-95%,并对提示级防御、审计检测和 MCP 依然有效。
- 会议论文NeurIPS 2025
DRIFT:基于动态规则与注入隔离的 LLM Agent 防护
提出 DRIFT 框架,用安全规划器、动态验证器和注入隔离器约束 Agent 的控制与数据流,在 AgentDojo 和 ASB 上兼顾安全与效用。
- 会议论文NeurIPS 2025
面向蒸馏的高效可验证遗忘
提出 PURGE 框架,通过多教师分区蒸馏限制各教师的影响范围,使教师端遗忘时只需部分更新学生,保持精度并显著减少重训开销。