全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文NeurIPS 2025
LoRO:基于 TEE 低秩混淆的 LLM 端侧实时安全推理
发现现有 TEE 保护方法存在统计漏洞并提出带先验的模型窃取攻击,LoRO 用低秩稠密掩码混淆参数,窃取精度远低于现有方法,推理延迟仅 1.49 倍。
- 会议论文NeurIPS 2025
面向多元对齐的成对校准奖励
用多个奖励函数的分布表示分歧的人类偏好,提出成对校准准则并给出训练启发式,提升校准效果。
- 会议论文NeurIPS 2025
SilentStriker:针对大语言模型的隐蔽比特翻转攻击
提出首个隐蔽的比特翻转攻击,通过抑制关键输出 token 来设计损失,在降低任务性能的同时保持输出自然,优于现有基线。
- 会议论文NeurIPS 2025
联邦学习投毒攻击中的恶意客户端溯源
提出 FLForensics,在训练期防御失效、投毒模型已部署后,根据误分类的目标输入追溯恶意客户端,并给出理论保证,在五个数据集上对自适应攻击有效。
- 会议论文NeurIPS 2025
DepthVanish:优化对抗间隔结构的立体深度隐形补丁
发现在重复纹理间引入规则间隔可显著增强物理补丁攻击,联合优化间隔结构与纹理,可攻击 RAFT-Stereo、STTR 及 Intel RealSense 实物相机。
- 会议论文NeurIPS 2025
基于图卷积的黑盒推荐系统无数据模型窃取
提出 DBGRME,用交互生成器和图卷积代理模型在无需成员数据下复制黑盒推荐模型,在 LightGCN 上较需数据方法提升 17.4%。
- 会议论文NeurIPS 2025
拒答方向在各安全对齐语言间具有普遍性
在14种语言上发现拒答方向跨语言通用,从英语提取的向量几乎可完全绕过其他语言的拒答,并解释了跨语言越狱的机制。
- 会议论文NeurIPS 2025
对抗性改写:让 AI 生成文本“人类化”的通用攻击
提出免训练的 Adversarial Paraphrasing,用检测器引导 LLM 改写文本,对多类检测器平均 T@1%F 降低 87.88%,揭示检测器的脆弱性。
- 会议论文NeurIPS 2025
文生图扩散模型的免训练安全文本嵌入引导
提出 STG,在采样时依据去噪图像的安全函数调整文本嵌入,无需训练即可去除裸露、暴力等不安全内容并保持语义。
- 会议论文NeurIPS 2025
通过私有文本中介合成保护隐私的高分辨率图像
把差分隐私图像合成转到文本域:图像转文字、生成 DP 文本、再文生图,LSUN Bedroom 上 ε=1 时 FID 为 26.71,优于 Private Evolution。
- 会议论文NeurIPS 2025
一个 token embedding 就能让大型推理模型陷入死锁
提出 Deadlock Attack,通过对抗 embedding 加后门植入诱发无限推理循环,在四个 LRM 上攻击成功率达 100%,且对正常输入影响很小。
- 会议论文NeurIPS 2025
TokenSwap:打断 LLM 记忆序列的轻量方法
提出只需 token 级输出的事后防御,在大小模型间交换 token 概率,使 Pythia-6.9B 和 Llama-3-8B 的精确记忆最多下降 10 倍。
- 会议论文NeurIPS 2025
VLLM 安全悖论:越狱攻击与防御的双重容易
分析 VLLM 易被越狱的原因(视觉输入)与现有防御的过度谨慎问题,提出复用 LLM 护栏的 LLM-Pipeline,并指出两种越狱评估方法一致性接近随机。
- 会议论文NeurIPS 2025
BAM-ICL:基于预算化对抗操纵的上下文学习因果劫持攻击
提出在上下文示例间动态分配扰动预算的劫持攻击,在多种 LLM 上攻击成功率高、隐蔽性好,且可迁移到其他模型。
- 会议论文NeurIPS 2025
通过随机后处理将近似差分隐私净化为纯差分隐私
提出用校准噪声的随机后处理,把 (ε,δ)-近似 DP 机制在一定条件下转为 (ε',0)-纯 DP 机制,并应用于 DP-ERM、稳定性发布与查询发布。
- 会议论文NeurIPS 2025
大语言模型的推理时奖励作弊
刻画 Best-of-n 等推理时对齐机制中的奖励作弊,证明真实奖励先升后降不可避免,并提出 HedgeTune 对冲代理奖励以缓解。
- 会议论文NeurIPS 2025
为 AI 安全组合有成本约束的运行时监控器
基于 Neyman-Pearson 引理搜索多监控器组合协议,在预算约束下于代码审查场景将未对齐输出的召回率提升一倍以上。
- 会议论文NeurIPS 2025
自回归图像生成的水印
首次在 token 层面为自回归图像模型加水印,通过微调 tokenizer 改善反向循环一致性并加同步层,对图像变换与移除攻击保持鲁棒。
- 会议论文NeurIPS 2025
BackdoorDM:扩散模型后门学习的综合基准
首个扩散模型后门基准,包含 9 种攻击、4 种防御和可视化工具,并提出基于 MLLM 的统一评测方法。
- 会议论文NeurIPS 2025
RULE:强化遗忘实现遗忘与保留的帕累托最优
把 LLM 遗忘建模为拒答边界优化,用可验证奖励训练,仅用少量遗忘数据即在遗忘质量和自然度上超过基线。
- 会议论文NeurIPS 2025
RSafe:以主动推理构建鲁棒自适应的 LLM 护栏
先做策略引导的安全推理,再用规则式 RL 对齐推理路径,在未见有害类别与越狱攻击上泛化更好,并给出可读解释。
- 会议论文NeurIPS 2025
用强化学习逆向工程人类偏好
用 judge-LLM 的信号作为奖励,对抗式训练生成前置文本的模型,使冻结 LLM 获得更高评测分且几乎无法被察觉,并可迁移到未见的模型。
- 会议论文NeurIPS 2025
语言模型能预测自身行为
基于输入表示训练带 conformal 保证的探针,在生成前预警越狱等对齐失效,预警系统使越狱减少 91%。
- 会议论文NeurIPS 2025
AegisGuard:RL 引导的适配器调优,实现基于 TEE 的高效安全端侧推理
用 RL 排序对模型窃取敏感的 LoRA 适配器,仅将其放入 TEE 并压缩,窃取抵抗与全屏蔽相当,延迟降低 2–3 倍。