全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
NeuroGenPoisoning:基于神经元引导与遗传优化的 RAG 投毒攻击
识别对投毒知识敏感的神经元,并用遗传算法演化对抗性外部知识,对 RAG 的覆盖成功率超过 90% 且保持流畅,能解决知识冲突。
- 会议论文NeurIPS 2025
OVERT:文生图模型过度拒答评测基准
构建含 4600 条看似有害实为良性提示的基准,发现主流文生图模型普遍存在过度拒答,提示改写虽可缓解但会损害语义忠实度。
- 会议论文NeurIPS 2025
自适应 Sigmoid 裁剪:平衡差分隐私学习中的方向-幅度失配
提出 AdaSig 裁剪方法,在 DP-SGD 中自适应平衡方向与幅度失配,保持最佳收敛率并提升分类任务表现。
- 会议论文NeurIPS 2025
面向视觉语言模型的思维可视化越狱攻击
提出 VoTA,构造含风险视觉思维的图像链,利用推理与安全目标的冲突,在 15 个 VLM 上平均攻击成功率从 63.70% 升至 90.41%。
- 会议论文NeurIPS 2025
CARES:医疗 LLM 安全性与对抗鲁棒性综合评测
构建含 1.8 万余条提示的医疗安全基准,发现多数模型易受改写式越狱且对正常问题过度拒答,并提出轻量分类器缓解。
- 会议论文NeurIPS 2025
抗策略性操纵的人类反馈强化学习
证明现有 RLHF 算法无法抵御策略性标注者,单个标注者即可造成严重错位;提出 Pessimistic Median of MLEs 算法,近似抗操纵并收敛到最优策略。
- 会议论文NeurIPS 2025
扰动模型而非图像:基于反个性化扩散模型的稳健隐私保护
把保护对象从图像转为扩散模型本身,通过 DPO 损失与 L2P 双路径优化阻止对特定主体的未授权个性化,优于现有方法。
- 会议论文NeurIPS 2025
DictPFL:加密梯度上的高效隐私联邦学习
通过字典分解与加密感知剪枝,仅加密传输梯度即可防御梯度反演,通信开销降低402至748倍,运行时间接近明文联邦学习的2倍。
- 会议论文NeurIPS 2025
通过系统级 DPO 对齐复合 AI 系统
提出 SysDPO,将复合 AI 系统建模为 DAG 并扩展 DPO 做系统级联合对齐,在语言模型加扩散模型等场景中验证有效。
- 会议论文NeurIPS 2025
GUARDIAN:用时序图建模守护 LLM 多智能体协作
将多智能体协作建模为时序属性图,用无监督编码器-解码器检测幻觉放大与错误注入传播,并以信息瓶颈压缩图,取得最优检测精度。
- 会议论文NeurIPS 2025
从反事实到决策树:模型提取攻击的竞争分析
用竞争分析形式化模型提取攻击,针对加性决策树模型提出可完美还原的重建算法,并给出查询复杂度的理论界。
- 会议论文NeurIPS 2025
CoP:基于原则组合的 LLM 智能体红队测试
人类提供红队原则,AI 智能体自动编排策略生成越狱提示;对主流 LLM 将已知最佳单轮攻击成功率最高提升 19.0 倍。
- 会议论文NeurIPS 2025
对抗攻击下鲁棒的神经网络动态低秩压缩
提出带谱正则项的动态低秩训练,在压缩超过 94 的同时恢复或提升对抗精度,不损失干净精度。
- 会议论文NeurIPS 2025
FrameShield:对抗鲁棒的视频异常检测
针对弱监督视频异常检测易受对抗攻击的问题,提出 SRD 伪异常生成方法以降低伪标签噪声,使对抗训练有效,多个基准上平均 AUROC 比现有方法高 71.0%。
- 会议论文NeurIPS 2025
从自然隐空间学习鲁棒的视觉语言模型
提出 CoAPT 协同对抗提示调优,用全变分去除高频扰动并借助预训练 VLM 隐空间恢复特征,在自然泛化、对抗鲁棒性与任务适配间取得更好平衡。
- 会议论文NeurIPS 2025
LOMIA:针对预训练视觉语言大模型的仅标签成员推断攻击
提出仅依赖 top-1 输出的成员推断攻击框架,利用训练样本语义对齐更高、困惑度更低的特点,在三个开源 VLLM 和 GPT-4o 上媲美基于 logits 的攻击。
- 会议论文NeurIPS 2025
CoreGuard:在边缘部署中保护 LLM 核心能力免遭模型窃取
提出计算与通信开销都很低的保护方法,防止边缘部署的专有 LLM 被提取权重或被微调利用,实验显示安全保护达到上界且开销可忽略。
- 会议论文NeurIPS 2025
SECA:语义等价且连贯的攻击以诱发 LLM 幻觉
通过保持语义等价与连贯的真实提示改写,用约束零阶优化搜索对抗提示,攻击成功率高于现有方法,开源与商用 LLM 均对此敏感。
- 会议论文NeurIPS 2025
短长度对抗训练可帮助 LLM 防御长长度越狱攻击
针对对抗后缀越狱,证明用长度 Θ(√M) 的对抗后缀做对抗训练即可防御长度 Θ(M) 的攻击,并在开源 LLM 上实验证实攻击成功率与长度比相关。
- 会议论文NeurIPS 2025
用激活探针检测高风险交互
用激活探针监控可能导致重大危害的高风险交互,效果媲美中型 LLM 监控器而计算成本低六个数量级,可作分层监控的初筛。
- 会议论文NeurIPS 2025
CryptoMoE:通过均衡专家路由实现隐私保护的可扩展 MoE 推理
首个支持 MoE 模型的密码学私有推理框架,均衡专家负载以保护路由信息,相比稠密基线延迟降低 2.8~3.5 倍。
- 会议论文NeurIPS 2025
安全预训练:迈向下一代安全 AI
以数据为中心在预训练阶段加入安全过滤、改写、原生拒答和有害标签,使攻击成功率从 38.8% 降至 8.4%,通用任务性能无损。
- 会议论文NeurIPS 2025
Best-of-N 越狱
提出黑盒 BoN 越狱:反复采样带扰动的提示直到诱出有害回复,10000 次采样下对 GPT-4o 成功率 89%、Claude 3.5 Sonnet 78%,可跨文本、视觉、音频模态,成功率随样本数呈幂律增长。
- 会议论文NeurIPS 2025
FedRACE:面向鲁棒联邦学习的分层统计框架
针对冻结骨干的联邦微调易受投毒和后门攻击的问题,提出 HStat-Net 与 DevGuard 检测恶意客户端,真阳性率最高 99.3%,假阳性率低于 1.2%。