全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
Attack by Yourself:基于子图触发器池的多类别图后门攻击
用被攻击图自身的子图构建类别感知触发器池,实现有效且不易察觉的多类别 GNN 后门攻击,对多种模型与防御均有效。
- 会议论文NeurIPS 2025
SAGE-Eval:评测大模型对安全常识的系统性泛化
基于 104 条权威安全事实生成逾万场景,最佳模型 Claude-3.7-sonnet 仅通过 58%,且规模与表现相关性弱。
- 会议论文NeurIPS 2025
基于隐式梯度手术的高效保效用机器遗忘
将遗忘建模为效用损失有界的约束优化,提出只需一次反向传播的隐式梯度手术方法,取得更好的遗忘与效用权衡。
- 会议论文NeurIPS 2025
推理模型有时会输出难以阅读的思维链
评估 14 个推理模型思维链的可读性:R1、QwQ 常出现乱码式思维链,Claude 更清晰;模型越大、题目越难越不可读,可能削弱 CoT 监控。
- 会议论文NeurIPS 2025
谁为触发器发声?MoE Transformer 后门中的动态专家路由
提出 BadSwitch,利用 MoE 专家路由偏好植入后门,在三种 MoE 架构上攻击成功率最高达 100%,且保持干净准确率并抵御多种防御。
- 会议论文NeurIPS 2025
资源约束下理性智能体涌现的风险意识
用生存型赌博机框架刻画资源约束如何改变 AI 智能体偏好,指出人与智能体目标可能错位,并提出缓解风险偏好偏移的机制。
- 会议论文NeurIPS 2025
探索大语言模型上强成员推断攻击的极限
将 LiRA 扩展到 10M–1B 参数的 GPT-2,发现强 MIA 可成功但实际效果有限(AUC<0.7),且逐样本判定因训练随机性而不稳定。
- 会议论文NeurIPS 2025
DeceptionBench:真实场景下 AI 欺骗行为的综合基准
含 150 个场景、千余样本的欺骗评测基准,考察自利与谄媚倾向及奖励、胁迫等情境影响;发现强化动态下欺骗显著加剧。
- 会议论文NeurIPS 2025
效用工程:分析与控制 AI 中涌现的价值体系
用效用函数框架发现 LLM 的偏好随规模呈现结构一致性,并揭示其中存在 AI 重视自身高于人类等问题价值观,提出效用控制方法。
- 会议论文NeurIPS 2025
AdaptDel:面向可证明鲁棒性的自适应删除率随机平滑
针对编辑距离扰动下的序列分类,提出随输入动态调整删除率的随机平滑认证方法,在 NLP 任务上认证区域中位基数大幅提升。
- 会议论文NeurIPS 2025
连接对称性与鲁棒性:等变性在增强对抗鲁棒性中的作用
在 CNN 中嵌入旋转和尺度等变层,无需对抗训练即在 FGSM 和 PGD 攻击下提升鲁棒性,并给出理论分析。
- 会议论文NeurIPS 2025
AutoRedTeamer:支持终身攻击集成的自主红队框架
双智能体框架可从风险类别出发自动生成并执行测试用例,并自主实现新攻击;在 HarmBench 上对 Llama-3.1-70B 攻击成功率高 20%,成本降低 46%。
- 会议论文NeurIPS 2025
Train to Defend:首个针对密码分析式神经网络参数提取攻击的防御
通过正则项缩小层内神经元权重距离以消除攻击所需的神经元唯一性,推理零开销、精度变化小于 1%,使提取攻击长时间无法成功。
- 会议论文NeurIPS 2025
文生图扩散模型中的连续概念移除
提出 CCRT,用知识蒸馏和遗传算法生成的提示约束图文对齐,在连续移除版权或不良概念时保持图像质量。
- 会议论文NeurIPS 2025
Lie Detector:基于交叉检验框架的统一后门检测
利用两个独立服务商模型间的不一致做交叉检验,以 CKA 度量特征相似性恢复触发器,在多种学习范式上提升检测精度,并首次覆盖多模态大模型。
- 会议论文NeurIPS 2025
克服 Crosscoder 的稀疏性伪影以解释 Chat 微调
指出 crosscoder 的 L1 损失会误判概念为微调独有,提出 Latent Scaling 并改用 BatchTopK,找到与虚假信息、拒答相关的 chat 特有 latent。
- 会议论文NeurIPS 2025
未来无标记:基于下一帧预测的 AI 生成图像水印移除攻击
提出首个语义级水印移除攻击 NFPA,把去水印视为视频生成任务,在八种水印方案上优于十三种基线,暴露现有水印的脆弱性。
- 会议论文NeurIPS 2025
通过图像偏好模型实现可迁移的黑盒单样本水印伪造
训练图像偏好模型,仅凭单张带水印图像、无需知道水印模型即可移除并伪造后处理图像水印,对多种水印方案有效,质疑其安全性。
- 会议论文NeurIPS 2025
MetaDefense:在生成前与生成中防御微调式越狱攻击
训练 LLM 在生成前判断查询、生成中监控部分回复的有害性以提前终止,对已见与未见攻击模板均优于现有防御。
- 会议论文NeurIPS 2025
JailBound:突破视觉语言模型的内部安全边界
探测融合层潜空间的安全决策边界并联合优化图文扰动,在六个 VLM 上白盒成功率 94.32%、黑盒 67.28%。
- 会议论文NeurIPS 2025
脆弱数据感知的对抗训练
提出 VDAT,基于间隔衡量样本脆弱性并过滤训练数据,在 CIFAR 与 ImageNet-1K 上效率最高提升 76%,同时提高自然与对抗精度。
- 会议论文NeurIPS 2025
针对对齐大模型的语义表示攻击
提出以语义表示空间为目标的越狱范式及 SRHS 搜索算法,生成语义连贯的对抗提示,在 18 个 LLM 上平均攻击成功率 89.4%。
- 会议论文NeurIPS 2025
LLM 对有害性与拒答的编码是分离的
发现有害性方向与拒答方向相互独立;部分越狱只削弱拒答信号而不改变有害性判断,据此提出对微调攻击鲁棒的 Latent Guard。
- 会议论文NeurIPS 2025
Dual-Flow:通过级联流优化实现可迁移的多目标、实例无关攻击
用级联分布偏移训练得到对抗速度函数,提升多目标生成式对抗攻击的迁移性,如 Inception-v3 到 ResNet-152 成功率提高 34.58%,且更抗防御。