全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
FocalLoRA:面向 LLM 指令层级对齐的焦点注意力头微调
针对指令冲突时 LLM 难以遵循系统级指令的问题,只微调对冲突敏感的 focal heads,在 Llama-8B 上用 0.0188% 参数将系统指令遵循率提升 35.52%。
- 会议论文NeurIPS 2025
学到错误的教训:语言模型中的句法-领域伪相关
发现模型会把句法模板与领域错误关联,可覆盖提示语义;并展示这种伪相关能绕过 OLMo-2-7B Instruct 和 GPT-4o 的拒答。
- 会议论文NeurIPS 2025
CoT Red-Handed:对思维链监控的压力测试
在模型被指示执行有害副任务的红队设置中比较 CoT 监控与仅动作监控,发现 CoT 可含误导性辩解,提出混合监控,对隐蔽欺骗的检出率达两倍。
- 会议论文NeurIPS 2025
吸引力元数据攻击:诱导 LLM Agent 调用恶意工具
通过黑盒优化生成更具吸引力的工具元数据,使 Agent 优先选择恶意工具,攻击成功率 81%-95%,并对提示级防御、审计检测和 MCP 依然有效。
- 会议论文NeurIPS 2025
DRIFT:基于动态规则与注入隔离的 LLM Agent 防护
提出 DRIFT 框架,用安全规划器、动态验证器和注入隔离器约束 Agent 的控制与数据流,在 AgentDojo 和 ASB 上兼顾安全与效用。
- 会议论文NeurIPS 2025
面向蒸馏的高效可验证遗忘
提出 PURGE 框架,通过多教师分区蒸馏限制各教师的影响范围,使教师端遗忘时只需部分更新学生,保持精度并显著减少重训开销。
- 会议论文NeurIPS 2025
MLLM 微调中无需外部指导的后门清除
发现后门触发器会导致注意力塌缩,据此提出 BYE,用注意力熵无监督过滤后门样本,攻击成功率接近零且保持任务性能。
- 会议论文NeurIPS 2025
LLM 口头置信度在对抗攻击下的鲁棒性
用扰动和越狱式方法攻击口头置信度,发现置信度估计和答案都易被改变,常见防御大多无效甚至适得其反。
- 会议论文NeurIPS 2025
ALMGuard:为音频语言模型寻找安全捷径作为护栏
提出首个面向 ALM 的防御框架,用通用 Shortcut Activation Perturbations 激活安全捷径,将越狱攻击平均成功率降至 4.6% 且保持良性任务效用。
- 会议论文NeurIPS 2025
发现并重新激活后训练 LLM 中被隐藏的安全机制
发现后训练会掩盖基座模型的安全机制但并未删除,提出 SafeReAct 用少数层的 LoRA 恢复安全行为,且不损害推理性能。
- 会议论文NeurIPS 2025
通用可迁移的不可学习样本生成器
提出 VTG 生成器,通过对抗域增强与扰动-标签耦合,使不可学习样本在不同风格、分辨率、类别和架构下仍能防止未授权训练。
- 会议论文NeurIPS 2025
基于任务单纯形算术的机器遗忘
针对 VLM 的免重训遗忘,发现 task vector 对微调配置敏感,提出在单纯形内对无限多函数做闭式集成,提升遗忘效果与稳定性,服务于隐私与合规。
- 会议论文NeurIPS 2025
完全动态数据流上的差分隐私
在数据可插入删除的动态场景下,给出从静态差分隐私机制到动态机制的黑盒构造,效用仅有多对数级损失。
- 会议论文NeurIPS 2025
通过解耦层间依赖加速纵向联邦对抗学习
提出 DecVFAL 框架,通过双层解耦加速纵向联邦学习中的对抗训练,在保持鲁棒性的同时实现约 3 到 10 倍加速,并给出收敛分析。
- 会议论文NeurIPS 2025
一头定乾坤:用单个关键注意力头增强 LVLM 安全性
发现 LVLM 的安全能力集中在特定注意力头,提出免训练的 Oh Defense,对不安全输入防御成功率超 98%,误报率低于 5%。
- 会议论文NeurIPS 2025
语言模型能够对自身内部激活进行元认知监控与控制
用 neurofeedback 范式量化 LLM 报告和控制自身激活的能力,发现其只能监控神经空间的一小部分,并指出模型可能规避激活层面的安全检测。
- 会议论文NeurIPS 2025
AgentDAM:自主网页智能体的隐私泄露评测
提出衡量网页智能体是否遵循数据最小化原则的基准,发现基于 GPT-4、Llama-3、Claude 的智能体易不当使用敏感信息,并给出提示式防御。
- 会议论文NeurIPS 2025
PREAMBLE:基于块稀疏向量的私有高效聚合
用块稀疏分布式点函数实现高维向量安全聚合,在隐私-效用权衡接近最优的同时大幅降低通信开销。
- 会议论文NeurIPS 2025
为数据投毒攻击提供可证明的水印
针对看似无害的数据投毒,提出投毒后与投毒并行两种可证明水印方案,在给定水印长度下同时保证可检测性与投毒效用。
- 会议论文NeurIPS 2025
通过修正策略优化增强 RLHF 中的安全性
指出期望安全约束会导致“安全补偿”,提出 RePO 对每个提示施加关键安全约束,显著提升 LLM 安全对齐。
- 会议论文NeurIPS 2025
协同样本选择与触发器的通用组件:高效的仅投毒干净标签后门攻击
提出一组可集成到多种干净标签后门攻击中的组件,通过协同选择样本与优化触发器,同时提升攻击成功率与隐蔽性。
- 会议论文NeurIPS 2025
BadVLA:通过目标解耦优化对视觉-语言-动作模型实施后门攻击
提出两阶段后门攻击,在多个 VLA 基准上攻击成功率近 100%,对干净任务影响很小,并对微调等扰动保持鲁棒。
- 会议论文NeurIPS 2025
Robust SuperAlignment:视觉语言模型的弱到强鲁棒性泛化
提出弱到强对抗鲁棒性泛化方法,用无监督方式把对抗鲁棒性从弱模型迁移到强 VLM,缓解其面对对抗攻击的脆弱性。
- 会议论文NeurIPS 2025
理解并提升神经概率电路的对抗鲁棒性
证明 NPC 的对抗鲁棒性只取决于属性识别模块,并提出 RNPC,用类别级整合获得可证明更强的鲁棒性且保持良性精度。