全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
基于贝叶斯数据调度器的 LLM 有害微调自适应防御
提出 BDS,把有害微调防御建模为贝叶斯推断,学习每个数据点的安全属性后加权微调,无需攻击模拟即可自适应防御,效果达到 SOTA。
- 会议论文NeurIPS 2025
通过跨模态对齐增强 CLIP 的对抗鲁棒性
提出免训练的 COLA,用最优传输恢复对抗扰动下的图文对齐,在 14 个零样本基准上,PGD 攻击下 ImageNet 平均提升 6.7%。
- 会议论文NeurIPS 2025
SeCon-RAG:面向可信 RAG 的两阶段语义过滤与无冲突框架
针对 RAG 语料投毒与污染攻击,提出两阶段语义过滤与冲突过滤防御,在保留有用知识的同时提升鲁棒性,优于现有防御。
- 会议论文NeurIPS 2025
具有合理可否认性的深度学习
提出 PD-SGD,用拒绝采样阻止无法合理否认的小批量更新参数,在理论上缓解个体数据泄露,隐私-效用权衡优于现有防御。
- 会议论文NeurIPS 2025
通过神经激活重定向实现 LLM 遗忘
提出 LUNAR,将待遗忘数据的表示重定向到表达无法回答的激活区域,遗忘效果与模型效用综合得分提升2.9至11.7倍,并能抵抗白盒对抗攻击。
- 会议论文NeurIPS 2025
差分隐私的序贯审计
提出面向黑盒机制的序贯检验来审计差分隐私保证,样本量从约5万降到数百,并能在不到一次训练内发现 DP-SGD 的隐私违规。
- 会议论文NeurIPS 2025
大语言模型的安全深度:马尔可夫链视角
提出安全深度概念,用马尔可夫链推导最优安全深度,并以循环群增强提升六个 LLM 的安全分数,发现更大集成宽度可弥补较浅对齐。
- 会议论文NeurIPS 2025
可扩展监督的缩放律
提出以监督者与被监督系统能力差建模监督成功率的框架,在 Mafia、Debate、Backdoor Code、Wargames 上拟合缩放律,并分析嵌套式可扩展监督(NSO)的成功率随能力差增大而下降。
- 会议论文NeurIPS 2025
进攻性网络安全智能体的动态风险评估
主张评估应考虑攻击者的自由度;仅用 8 个 H100 GPU 小时,攻击者即可将智能体在 InterCode CTF 上的能力相对提升超 40%。
- 会议论文NeurIPS 2025
TransferBench:基于集成的黑盒迁移攻击基准
提出 TransferBench,在 17 种更现实的设置下评测集成式黑盒迁移攻击,发现现有方法难以泛化,查询式优化几乎没有收益。
- 会议论文NeurIPS 2025
噪声注入揭示 sandbagging 语言模型的隐藏能力
向模型权重注入噪声检测 sandbagging:普通模型性能随噪声下降,而故意藏拙的模型会异常提升,并能激发 Mistral Large 120B 的完整表现。
- 会议论文NeurIPS 2025
过拟合攻击:仅用 10 条良性样本微调即可越狱 LLM
先用相同拒答的良性样本使模型过拟合,再用普通良性回答微调使其遗忘拒答,在十个 LLM 上攻击效果与隐蔽性均优于五个基线。
- 会议论文NeurIPS 2025
迈向不可逆攻击:基于多种群协同进化搜索欺骗场景文本识别
提出 MPCS 方法对场景文本识别模型逐字符攻击,解决扰动像素集中问题,使攻击结果难以被词典或语言模型纠正。
- 会议论文NeurIPS 2025
通过缓解分类复杂度实现鲁棒图凝聚
发现图凝聚在原图受污染时性能显著下降,提出 MRGC,用流形约束使凝聚图保持低分类复杂度,在多种对抗攻击下保持鲁棒。
- 会议论文NeurIPS 2025
SAFEPATH:通过早期对齐防止思维链中的有害推理
微调推理模型在推理开头输出 8 token 安全引导语,在 R1-Distill-Llama-8B 上最多减少 90% 有害回答、拦截 83.3% 越狱,计算量远低于基线。
- 会议论文NeurIPS 2025
基于可逆剪枝掩码的后门缓解
提出带可逆剪枝掩码的双层优化方法,识别并剪除后门相关参数,在少量数据下优于现有剪枝式后门防御,并可比肩微调类方法。
- 会议论文NeurIPS 2025
基于谱方法的子图联邦学习
提出 FedLap,通过谱域拉普拉斯平滑捕获跨客户端节点依赖,避免交换敏感节点嵌入,并给出隐私分析;效用与现有方法相当或更优。
- 会议论文NeurIPS 2025
仅用负样本从文生图模型中移除概念
Clipout 随机裁剪嵌入单元并用对比目标,仅凭自举生成的负样本,无需重训即可移除隐私、版权或有害概念,效果优于现有方法。
- 会议论文NeurIPS 2025
BlurGuard:增强图像保护以抵御 AI 编辑的简单方法
对保护性对抗噪声施加自适应分区域高斯模糊,使其更难被 JPEG 压缩等噪声还原技术消除,提升图像抗 AI 编辑的最差情况保护效果。
- 会议论文NeurIPS 2025
Attack by Yourself:基于子图触发器池的多类别图后门攻击
用被攻击图自身的子图构建类别感知触发器池,实现有效且不易察觉的多类别 GNN 后门攻击,对多种模型与防御均有效。
- 会议论文NeurIPS 2025
SAGE-Eval:评测大模型对安全常识的系统性泛化
基于 104 条权威安全事实生成逾万场景,最佳模型 Claude-3.7-sonnet 仅通过 58%,且规模与表现相关性弱。
- 会议论文NeurIPS 2025
基于隐式梯度手术的高效保效用机器遗忘
将遗忘建模为效用损失有界的约束优化,提出只需一次反向传播的隐式梯度手术方法,取得更好的遗忘与效用权衡。
- 会议论文NeurIPS 2025
推理模型有时会输出难以阅读的思维链
评估 14 个推理模型思维链的可读性:R1、QwQ 常出现乱码式思维链,Claude 更清晰;模型越大、题目越难越不可读,可能削弱 CoT 监控。
- 会议论文NeurIPS 2025
谁为触发器发声?MoE Transformer 后门中的动态专家路由
提出 BadSwitch,利用 MoE 专家路由偏好植入后门,在三种 MoE 架构上攻击成功率最高达 100%,且保持干净准确率并抵御多种防御。