全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
荧光面纱:针对交通标志识别的隐蔽高效物理对抗补丁
用荧光墨水设计物理对抗补丁 FIPatch,紫外光触发后使交通标志识别出错,低光下成功率 98.31%,并绕过五种常见防御。
- 会议论文NeurIPS 2025
WMCopier:在任意图像上伪造不可见水印
提出无需目标水印算法先验的伪造攻击,用扩散模型建模水印分布并嵌入,成功欺骗包括 Amazon 在内的开源与闭源水印系统。
- 会议论文NeurIPS 2025
构建可跨模型与提示迁移的大视觉语言模型攻击器
从信息论角度,通过调节输出与对抗/良性图像模式间的互信息生成更通用的扰动,提升对黑盒 LVLM 及不同提示的迁移攻击效果。
- 会议论文NeurIPS 2025
非自适应对抗人脸生成
利用人脸识别特征空间的属性子球面结构,仅用一次含 100 张图的非自适应查询,对 AWS CompareFaces 攻击成功率超 93%。
- 会议论文NeurIPS 2025
VERA:大语言模型越狱的变分推断框架
把黑盒越狱建模为变分推断,训练小型攻击 LLM 逼近目标模型的对抗提示后验,训练后无需重新优化即可生成多样、流畅的越狱提示,对多种目标模型有效。
- 会议论文NeurIPS 2025
Jailbreak-AudioBench:大型音频语言模型越狱威胁评测
提出含工具箱、数据集和基准的音频越狱评测体系,评估多个 LALM,并支持音频编辑等更强攻击与防御研究。
- 会议论文NeurIPS 2025
T2V-OptJail:面向文生视频越狱攻击的离散提示词优化
首次将文生视频越狱形式化为离散优化问题,在 Open-Sora 及 Pika、Luma、Kling 等商用模型上,攻击成功率比现有 SoTA 提升约 10–11 个百分点。
- 会议论文NeurIPS 2025
利用 ViT 的计算冗余提升对抗迁移性
发现 ViT 的数据级与模型级冗余可放大攻击效果,设计一套技术显著提升对抗样本在多种 ViT 及视觉大模型上的迁移性。
- 会议论文NeurIPS 2025
LARGO:基于梯度优化的潜空间对抗反思越狱 LLM
在 LLM 连续潜空间优化对抗向量再解码为自然语言,生成流畅隐蔽的越狱提示,在 AdvBench 与 JailbreakBench 上攻击成功率比 AutoDAN 等高 44 点。
- 会议论文NeurIPS 2025
SilentStriker:针对大语言模型的隐蔽比特翻转攻击
提出首个隐蔽的比特翻转攻击,通过抑制关键输出 token 来设计损失,在降低任务性能的同时保持输出自然,优于现有基线。
- 会议论文NeurIPS 2025
DepthVanish:优化对抗间隔结构的立体深度隐形补丁
发现在重复纹理间引入规则间隔可显著增强物理补丁攻击,联合优化间隔结构与纹理,可攻击 RAFT-Stereo、STTR 及 Intel RealSense 实物相机。
- 会议论文NeurIPS 2025
对抗性改写:让 AI 生成文本“人类化”的通用攻击
提出免训练的 Adversarial Paraphrasing,用检测器引导 LLM 改写文本,对多类检测器平均 T@1%F 降低 87.88%,揭示检测器的脆弱性。
- 会议论文NeurIPS 2025
VLLM 安全悖论:越狱攻击与防御的双重容易
分析 VLLM 易被越狱的原因(视觉输入)与现有防御的过度谨慎问题,提出复用 LLM 护栏的 LLM-Pipeline,并指出两种越狱评估方法一致性接近随机。
- 会议论文NeurIPS 2025
BAM-ICL:基于预算化对抗操纵的上下文学习因果劫持攻击
提出在上下文示例间动态分配扰动预算的劫持攻击,在多种 LLM 上攻击成功率高、隐蔽性好,且可迁移到其他模型。
- 会议论文NeurIPS 2025
用强化学习逆向工程人类偏好
用 judge-LLM 的信号作为奖励,对抗式训练生成前置文本的模型,使冻结 LLM 获得更高评测分且几乎无法被察觉,并可迁移到未见的模型。
- 会议论文NeurIPS 2025
安全 + 安全 = 不安全?利用安全图像越狱大型视觉语言模型
提出 Safety Snowball Agent,借助 LVLM 的通用推理与安全滚雪球效应,用几乎任意图像逐步诱导有害输出,对最新 LVLM 越狱成功率高。
- 会议论文NeurIPS 2025
通过降低指令不确定性探索语义约束对抗样本
提出 InSUR 框架,从自然语言指令生成可迁移、自适应的语义约束对抗样本,并首次实现无参考的语义约束 3D 对抗样本生成。
- 会议论文NeurIPS 2025
拟合分布:针对多模态大模型的跨图像/提示对抗攻击
基于分布近似理论,优化单个输入无关的对抗扰动,使其在不同图文对间迁移,诱导 MLLM 产生有害回复。
- 会议论文NeurIPS 2025
通过特征最优对齐对闭源 MLLM 的对抗攻击
提出 FOA-Attack,结合全局余弦损失与基于最优传输的局部特征对齐及动态集成加权,提升对闭源 MLLM 的定向迁移攻击成功率。
- 会议论文NeurIPS 2025
Video-SafetyBench:视频大视觉语言模型安全评测基准
构建含 2,264 个视频-文本对、48 类不安全类别的基准并提出 RJScore,良性查询配合视频的平均攻击成功率达 67.2%。
- 会议论文NeurIPS 2025
学到错误的教训:语言模型中的句法-领域伪相关
发现模型会把句法模板与领域错误关联,可覆盖提示语义;并展示这种伪相关能绕过 OLMo-2-7B Instruct 和 GPT-4o 的拒答。
- 会议论文NeurIPS 2025
DRIFT:基于动态规则与注入隔离的 LLM Agent 防护
提出 DRIFT 框架,用安全规划器、动态验证器和注入隔离器约束 Agent 的控制与数据流,在 AgentDojo 和 ASB 上兼顾安全与效用。
- 会议论文NeurIPS 2025
LLM 口头置信度在对抗攻击下的鲁棒性
用扰动和越狱式方法攻击口头置信度,发现置信度估计和答案都易被改变,常见防御大多无效甚至适得其反。
- 会议论文NeurIPS 2025
用空间对抗对齐提升对抗样本迁移性
提出 SAA,用 witness 模型对齐微调代理模型的全局与局部特征,并引入自对抗约束,使对抗样本在 CNN 到 ViT 等跨架构场景下迁移性更高。