全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
资源约束下理性智能体涌现的风险意识
用生存型赌博机框架刻画资源约束如何改变 AI 智能体偏好,指出人与智能体目标可能错位,并提出缓解风险偏好偏移的机制。
- 会议论文NeurIPS 2025
探索大语言模型上强成员推断攻击的极限
将 LiRA 扩展到 10M–1B 参数的 GPT-2,发现强 MIA 可成功但实际效果有限(AUC<0.7),且逐样本判定因训练随机性而不稳定。
- 会议论文NeurIPS 2025
DeceptionBench:真实场景下 AI 欺骗行为的综合基准
含 150 个场景、千余样本的欺骗评测基准,考察自利与谄媚倾向及奖励、胁迫等情境影响;发现强化动态下欺骗显著加剧。
- 会议论文NeurIPS 2025
效用工程:分析与控制 AI 中涌现的价值体系
用效用函数框架发现 LLM 的偏好随规模呈现结构一致性,并揭示其中存在 AI 重视自身高于人类等问题价值观,提出效用控制方法。
- 会议论文NeurIPS 2025
AdaptDel:面向可证明鲁棒性的自适应删除率随机平滑
针对编辑距离扰动下的序列分类,提出随输入动态调整删除率的随机平滑认证方法,在 NLP 任务上认证区域中位基数大幅提升。
- 会议论文NeurIPS 2025
连接对称性与鲁棒性:等变性在增强对抗鲁棒性中的作用
在 CNN 中嵌入旋转和尺度等变层,无需对抗训练即在 FGSM 和 PGD 攻击下提升鲁棒性,并给出理论分析。
- 会议论文NeurIPS 2025
AutoRedTeamer:支持终身攻击集成的自主红队框架
双智能体框架可从风险类别出发自动生成并执行测试用例,并自主实现新攻击;在 HarmBench 上对 Llama-3.1-70B 攻击成功率高 20%,成本降低 46%。
- 会议论文NeurIPS 2025
Train to Defend:首个针对密码分析式神经网络参数提取攻击的防御
通过正则项缩小层内神经元权重距离以消除攻击所需的神经元唯一性,推理零开销、精度变化小于 1%,使提取攻击长时间无法成功。
- 会议论文NeurIPS 2025
文生图扩散模型中的连续概念移除
提出 CCRT,用知识蒸馏和遗传算法生成的提示约束图文对齐,在连续移除版权或不良概念时保持图像质量。
- 会议论文NeurIPS 2025
Lie Detector:基于交叉检验框架的统一后门检测
利用两个独立服务商模型间的不一致做交叉检验,以 CKA 度量特征相似性恢复触发器,在多种学习范式上提升检测精度,并首次覆盖多模态大模型。
- 会议论文NeurIPS 2025
克服 Crosscoder 的稀疏性伪影以解释 Chat 微调
指出 crosscoder 的 L1 损失会误判概念为微调独有,提出 Latent Scaling 并改用 BatchTopK,找到与虚假信息、拒答相关的 chat 特有 latent。
- 会议论文NeurIPS 2025
未来无标记:基于下一帧预测的 AI 生成图像水印移除攻击
提出首个语义级水印移除攻击 NFPA,把去水印视为视频生成任务,在八种水印方案上优于十三种基线,暴露现有水印的脆弱性。
- 会议论文NeurIPS 2025
通过图像偏好模型实现可迁移的黑盒单样本水印伪造
训练图像偏好模型,仅凭单张带水印图像、无需知道水印模型即可移除并伪造后处理图像水印,对多种水印方案有效,质疑其安全性。
- 会议论文NeurIPS 2025
MetaDefense:在生成前与生成中防御微调式越狱攻击
训练 LLM 在生成前判断查询、生成中监控部分回复的有害性以提前终止,对已见与未见攻击模板均优于现有防御。
- 会议论文NeurIPS 2025
JailBound:突破视觉语言模型的内部安全边界
探测融合层潜空间的安全决策边界并联合优化图文扰动,在六个 VLM 上白盒成功率 94.32%、黑盒 67.28%。
- 会议论文NeurIPS 2025
脆弱数据感知的对抗训练
提出 VDAT,基于间隔衡量样本脆弱性并过滤训练数据,在 CIFAR 与 ImageNet-1K 上效率最高提升 76%,同时提高自然与对抗精度。
- 会议论文NeurIPS 2025
针对对齐大模型的语义表示攻击
提出以语义表示空间为目标的越狱范式及 SRHS 搜索算法,生成语义连贯的对抗提示,在 18 个 LLM 上平均攻击成功率 89.4%。
- 会议论文NeurIPS 2025
LLM 对有害性与拒答的编码是分离的
发现有害性方向与拒答方向相互独立;部分越狱只削弱拒答信号而不改变有害性判断,据此提出对微调攻击鲁棒的 Latent Guard。
- 会议论文NeurIPS 2025
Dual-Flow:通过级联流优化实现可迁移的多目标、实例无关攻击
用级联分布偏移训练得到对抗速度函数,提升多目标生成式对抗攻击的迁移性,如 Inception-v3 到 ResNet-152 成功率提高 34.58%,且更抗防御。
- 会议论文NeurIPS 2025
CURE:基于正交表示编辑的扩散模型概念遗忘
提出免训练的权重空间概念遗忘方法,用 SVD 谱擦除器在 2 秒内移除不安全、版权或身份概念,并对红队攻击更稳健。
- 会议论文NeurIPS 2025
利用公开数据的私有零阶优化
提出 PAZO,用公开数据引导差分隐私零阶梯度估计,在视觉与文本任务上隐私-效用权衡更优,运行最多快 16 倍。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
虚假隐私的生成数据:用生成数据微调 LLM 的隐藏风险
实证发现用 LLM 生成数据微调并不更私密:Pythia 的 PII 提取成功率上升超 20%,自指令微调后 MIA 的 ROC-AUC 提升超 40%。
- 会议论文USENIX Security 2025
Cloak, Honey, Trap:针对 LLM Agent 的主动防御
利用 LLM 的偏差、记忆限制等弱点,以伪装、蜜罐 token 和陷阱对抗自动渗透测试 Agent,在 11 台 CTF 机器上 100% 成功,并开源 CHeaT 工具。