全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
对抗性改写:让 AI 生成文本“人类化”的通用攻击
提出免训练的 Adversarial Paraphrasing,用检测器引导 LLM 改写文本,对多类检测器平均 T@1%F 降低 87.88%,揭示检测器的脆弱性。
- 会议论文NeurIPS 2025
VLLM 安全悖论:越狱攻击与防御的双重容易
分析 VLLM 易被越狱的原因(视觉输入)与现有防御的过度谨慎问题,提出复用 LLM 护栏的 LLM-Pipeline,并指出两种越狱评估方法一致性接近随机。
- 会议论文NeurIPS 2025
BAM-ICL:基于预算化对抗操纵的上下文学习因果劫持攻击
提出在上下文示例间动态分配扰动预算的劫持攻击,在多种 LLM 上攻击成功率高、隐蔽性好,且可迁移到其他模型。
- 会议论文NeurIPS 2025
用强化学习逆向工程人类偏好
用 judge-LLM 的信号作为奖励,对抗式训练生成前置文本的模型,使冻结 LLM 获得更高评测分且几乎无法被察觉,并可迁移到未见的模型。
- 会议论文NeurIPS 2025
安全 + 安全 = 不安全?利用安全图像越狱大型视觉语言模型
提出 Safety Snowball Agent,借助 LVLM 的通用推理与安全滚雪球效应,用几乎任意图像逐步诱导有害输出,对最新 LVLM 越狱成功率高。
- 会议论文NeurIPS 2025
通过降低指令不确定性探索语义约束对抗样本
提出 InSUR 框架,从自然语言指令生成可迁移、自适应的语义约束对抗样本,并首次实现无参考的语义约束 3D 对抗样本生成。
- 会议论文NeurIPS 2025
拟合分布:针对多模态大模型的跨图像/提示对抗攻击
基于分布近似理论,优化单个输入无关的对抗扰动,使其在不同图文对间迁移,诱导 MLLM 产生有害回复。
- 会议论文NeurIPS 2025
通过特征最优对齐对闭源 MLLM 的对抗攻击
提出 FOA-Attack,结合全局余弦损失与基于最优传输的局部特征对齐及动态集成加权,提升对闭源 MLLM 的定向迁移攻击成功率。
- 会议论文NeurIPS 2025
Video-SafetyBench:视频大视觉语言模型安全评测基准
构建含 2,264 个视频-文本对、48 类不安全类别的基准并提出 RJScore,良性查询配合视频的平均攻击成功率达 67.2%。
- 会议论文NeurIPS 2025
学到错误的教训:语言模型中的句法-领域伪相关
发现模型会把句法模板与领域错误关联,可覆盖提示语义;并展示这种伪相关能绕过 OLMo-2-7B Instruct 和 GPT-4o 的拒答。
- 会议论文NeurIPS 2025
LLM 口头置信度在对抗攻击下的鲁棒性
用扰动和越狱式方法攻击口头置信度,发现置信度估计和答案都易被改变,常见防御大多无效甚至适得其反。
- 会议论文NeurIPS 2025
用空间对抗对齐提升对抗样本迁移性
提出 SAA,用 witness 模型对齐微调代理模型的全局与局部特征,并引入自对抗约束,使对抗样本在 CNN 到 ViT 等跨架构场景下迁移性更高。
- 会议论文NeurIPS 2025
TransferBench:基于集成的黑盒迁移攻击基准
提出 TransferBench,在 17 种更现实的设置下评测集成式黑盒迁移攻击,发现现有方法难以泛化,查询式优化几乎没有收益。
- 会议论文NeurIPS 2025
迈向不可逆攻击:基于多种群协同进化搜索欺骗场景文本识别
提出 MPCS 方法对场景文本识别模型逐字符攻击,解决扰动像素集中问题,使攻击结果难以被词典或语言模型纠正。
- 会议论文NeurIPS 2025
未来无标记:基于下一帧预测的 AI 生成图像水印移除攻击
提出首个语义级水印移除攻击 NFPA,把去水印视为视频生成任务,在八种水印方案上优于十三种基线,暴露现有水印的脆弱性。
- 会议论文NeurIPS 2025
通过图像偏好模型实现可迁移的黑盒单样本水印伪造
训练图像偏好模型,仅凭单张带水印图像、无需知道水印模型即可移除并伪造后处理图像水印,对多种水印方案有效,质疑其安全性。
- 会议论文NeurIPS 2025
JailBound:突破视觉语言模型的内部安全边界
探测融合层潜空间的安全决策边界并联合优化图文扰动,在六个 VLM 上白盒成功率 94.32%、黑盒 67.28%。
- 会议论文NeurIPS 2025
针对对齐大模型的语义表示攻击
提出以语义表示空间为目标的越狱范式及 SRHS 搜索算法,生成语义连贯的对抗提示,在 18 个 LLM 上平均攻击成功率 89.4%。
- 会议论文NeurIPS 2025
Dual-Flow:通过级联流优化实现可迁移的多目标、实例无关攻击
用级联分布偏移训练得到对抗速度函数,提升多目标生成式对抗攻击的迁移性,如 Inception-v3 到 ResNet-152 成功率提高 34.58%,且更抗防御。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
PAPILLON:基于模糊测试的高效隐蔽 LLM 越狱
提出从空种子池出发的黑盒模糊测试越狱框架,对 GPT-3.5、GPT-4、Gemini-Pro 成功率超 90%、80%、74%,提示更短且语义连贯。
- 会议论文USENIX Security 2025
ML/AI 会议审稿人分配中文本匹配对串通攻击的脆弱性
证明即使没有竞标,串通的审稿人和作者也能利用基于机器学习的文本匹配分配机制被分到目标论文,并指出具体漏洞与改进建议。
- 会议论文USENIX Security 2025
Red Bleed:针对人脸生物识别认证系统的近红外呈现攻击
用不到 400 美元的定制 LCD 和 VAE 将可见光人脸转为近红外并换脸,成功攻破 Windows Hello 等商用近红外人脸认证,已获微软确认。
- 会议论文USENIX Security 2025
评估基于视觉相似性的钓鱼检测模型的有效性与鲁棒性
在 45.1 万真实钓鱼网站上评估检测模型,发现真实场景表现差,且易被 logo 篡改与对抗扰动规避。