全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
AC-LoRA:近乎免训练的访问控制感知多模态 LLM
为企业 LLM 聊天机器人设计按权限隔离的 LoRA 适配器检索与合并方案,提供信息隔离保证,性能匹配或超过现有 LoRA 混合方法。
- 会议论文NeurIPS 2025
视觉语言模型中的跨模态记忆量化
构建合成人物数据集,量化 VLM 的跨模态记忆与迁移,发现一种模态学到的事实可迁移到另一模态但存在明显差距,并提出缓解基线。
- 会议论文NeurIPS 2025
Deep Value Benchmark:衡量模型泛化的是深层价值还是浅层偏好
通过控制深层价值与浅层特征的混淆来测 DVGR,9 个模型平均仅 0.30,均低于随机水平,且更大模型略低。
- 会议论文NeurIPS 2025
推理模型中的霍桑效应:评测并操控测试感知
用白盒探针识别并操控推理模型的测试感知,发现它会显著影响有害请求的服从等安全对齐表现,且影响方向与幅度因模型而异。
- 会议论文NeurIPS 2025
Angular Steering:通过激活空间旋转控制行为
将 steering 表述为固定二维子空间内的几何旋转,对拒答与顺从等行为实现连续细粒度控制,并保持通用语言建模性能。
- 会议论文NeurIPS 2025
文生图扩散模型 NSFW 内容擦除的综合评估与分析
提出概念擦除全流程工具包,对 NSFW 概念擦除方法做首次系统研究,并给出实际应用指导。
- 会议论文NeurIPS 2025
LARGO:基于梯度优化的潜空间对抗反思越狱 LLM
在 LLM 连续潜空间优化对抗向量再解码为自然语言,生成流畅隐蔽的越狱提示,在 AdvBench 与 JailbreakBench 上攻击成功率比 AutoDAN 等高 44 点。
- 会议论文NeurIPS 2025
Conformal Arbitrage:语言模型中竞争目标的风险受控平衡
用 conformal risk control 校准阈值,在主模型与保守 Guardian 之间切换,使事实错误或安全违规频率有分布无关的有限样本保证。
- 会议论文NeurIPS 2025
EVOREFUSE:评估并缓解 LLM 对伪恶意指令过度拒答的进化式提示优化
用进化算法生成诱发过度拒答的伪恶意指令,构建评测集与对齐数据;微调后 Llama3.1-8B 过度拒答最多减少 29.85% 且不损安全。
- 会议论文NeurIPS 2025
LoRO:基于 TEE 低秩混淆的 LLM 端侧实时安全推理
发现现有 TEE 保护方法存在统计漏洞并提出带先验的模型窃取攻击,LoRO 用低秩稠密掩码混淆参数,窃取精度远低于现有方法,推理延迟仅 1.49 倍。
- 会议论文NeurIPS 2025
面向多元对齐的成对校准奖励
用多个奖励函数的分布表示分歧的人类偏好,提出成对校准准则并给出训练启发式,提升校准效果。
- 会议论文NeurIPS 2025
SilentStriker:针对大语言模型的隐蔽比特翻转攻击
提出首个隐蔽的比特翻转攻击,通过抑制关键输出 token 来设计损失,在降低任务性能的同时保持输出自然,优于现有基线。
- 会议论文NeurIPS 2025
联邦学习投毒攻击中的恶意客户端溯源
提出 FLForensics,在训练期防御失效、投毒模型已部署后,根据误分类的目标输入追溯恶意客户端,并给出理论保证,在五个数据集上对自适应攻击有效。
- 会议论文NeurIPS 2025
DepthVanish:优化对抗间隔结构的立体深度隐形补丁
发现在重复纹理间引入规则间隔可显著增强物理补丁攻击,联合优化间隔结构与纹理,可攻击 RAFT-Stereo、STTR 及 Intel RealSense 实物相机。
- 会议论文NeurIPS 2025
基于图卷积的黑盒推荐系统无数据模型窃取
提出 DBGRME,用交互生成器和图卷积代理模型在无需成员数据下复制黑盒推荐模型,在 LightGCN 上较需数据方法提升 17.4%。
- 会议论文NeurIPS 2025
拒答方向在各安全对齐语言间具有普遍性
在14种语言上发现拒答方向跨语言通用,从英语提取的向量几乎可完全绕过其他语言的拒答,并解释了跨语言越狱的机制。
- 会议论文NeurIPS 2025
对抗性改写:让 AI 生成文本“人类化”的通用攻击
提出免训练的 Adversarial Paraphrasing,用检测器引导 LLM 改写文本,对多类检测器平均 T@1%F 降低 87.88%,揭示检测器的脆弱性。
- 会议论文NeurIPS 2025
文生图扩散模型的免训练安全文本嵌入引导
提出 STG,在采样时依据去噪图像的安全函数调整文本嵌入,无需训练即可去除裸露、暴力等不安全内容并保持语义。
- 会议论文NeurIPS 2025
通过私有文本中介合成保护隐私的高分辨率图像
把差分隐私图像合成转到文本域:图像转文字、生成 DP 文本、再文生图,LSUN Bedroom 上 ε=1 时 FID 为 26.71,优于 Private Evolution。
- 会议论文NeurIPS 2025
一个 token embedding 就能让大型推理模型陷入死锁
提出 Deadlock Attack,通过对抗 embedding 加后门植入诱发无限推理循环,在四个 LRM 上攻击成功率达 100%,且对正常输入影响很小。
- 会议论文NeurIPS 2025
TokenSwap:打断 LLM 记忆序列的轻量方法
提出只需 token 级输出的事后防御,在大小模型间交换 token 概率,使 Pythia-6.9B 和 Llama-3-8B 的精确记忆最多下降 10 倍。
- 会议论文NeurIPS 2025
VLLM 安全悖论:越狱攻击与防御的双重容易
分析 VLLM 易被越狱的原因(视觉输入)与现有防御的过度谨慎问题,提出复用 LLM 护栏的 LLM-Pipeline,并指出两种越狱评估方法一致性接近随机。
- 会议论文NeurIPS 2025
BAM-ICL:基于预算化对抗操纵的上下文学习因果劫持攻击
提出在上下文示例间动态分配扰动预算的劫持攻击,在多种 LLM 上攻击成功率高、隐蔽性好,且可迁移到其他模型。
- 会议论文NeurIPS 2025
通过随机后处理将近似差分隐私净化为纯差分隐私
提出用校准噪声的随机后处理,把 (ε,δ)-近似 DP 机制在一定条件下转为 (ε',0)-纯 DP 机制,并应用于 DP-ERM、稳定性发布与查询发布。