全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
TransferBench:基于集成的黑盒迁移攻击基准
提出 TransferBench,在 17 种更现实的设置下评测集成式黑盒迁移攻击,发现现有方法难以泛化,查询式优化几乎没有收益。
- 会议论文NeurIPS 2025
迈向不可逆攻击:基于多种群协同进化搜索欺骗场景文本识别
提出 MPCS 方法对场景文本识别模型逐字符攻击,解决扰动像素集中问题,使攻击结果难以被词典或语言模型纠正。
- 会议论文NeurIPS 2025
未来无标记:基于下一帧预测的 AI 生成图像水印移除攻击
提出首个语义级水印移除攻击 NFPA,把去水印视为视频生成任务,在八种水印方案上优于十三种基线,暴露现有水印的脆弱性。
- 会议论文NeurIPS 2025
通过图像偏好模型实现可迁移的黑盒单样本水印伪造
训练图像偏好模型,仅凭单张带水印图像、无需知道水印模型即可移除并伪造后处理图像水印,对多种水印方案有效,质疑其安全性。
- 会议论文NeurIPS 2025
JailBound:突破视觉语言模型的内部安全边界
探测融合层潜空间的安全决策边界并联合优化图文扰动,在六个 VLM 上白盒成功率 94.32%、黑盒 67.28%。
- 会议论文NeurIPS 2025
针对对齐大模型的语义表示攻击
提出以语义表示空间为目标的越狱范式及 SRHS 搜索算法,生成语义连贯的对抗提示,在 18 个 LLM 上平均攻击成功率 89.4%。
- 会议论文NeurIPS 2025
Dual-Flow:通过级联流优化实现可迁移的多目标、实例无关攻击
用级联分布偏移训练得到对抗速度函数,提升多目标生成式对抗攻击的迁移性,如 Inception-v3 到 ResNet-152 成功率提高 34.58%,且更抗防御。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
StruQ:用结构化查询防御提示注入
将提示与数据分为两个通道,并微调模型只遵循提示部分的指令,显著提升对提示注入的抵抗力,对效用几乎无影响。
- 会议论文USENIX Security 2025
PAPILLON:基于模糊测试的高效隐蔽 LLM 越狱
提出从空种子池出发的黑盒模糊测试越狱框架,对 GPT-3.5、GPT-4、Gemini-Pro 成功率超 90%、80%、74%,提示更短且语义连贯。
- 会议论文USENIX Security 2025
ML/AI 会议审稿人分配中文本匹配对串通攻击的脆弱性
证明即使没有竞标,串通的审稿人和作者也能利用基于机器学习的文本匹配分配机制被分到目标论文,并指出具体漏洞与改进建议。
- 会议论文USENIX Security 2025
Red Bleed:针对人脸生物识别认证系统的近红外呈现攻击
用不到 400 美元的定制 LCD 和 VAE 将可见光人脸转为近红外并换脸,成功攻破 Windows Hello 等商用近红外人脸认证,已获微软确认。
- 会议论文USENIX Security 2025
评估基于视觉相似性的钓鱼检测模型的有效性与鲁棒性
在 45.1 万真实钓鱼网站上评估检测模型,发现真实场景表现差,且易被 logo 篡改与对抗扰动规避。
- 会议论文USENIX Security 2025
隐形但被检测:LiDAR 目标检测的物理对抗阴影攻击与防御
Shadow Hack 利用物体阴影在 LiDAR 点云中实施攻击,仿真与实物均达到极高成功率;同时提出 BB-Validator 防御。
- 会议论文USENIX Security 2025
TwinBreak:基于孪生提示的 LLM 安全对齐越狱
把安全机制视为嵌入式后门,用结构相似的孪生提示定位并剪枝安全相关参数,在五家厂商 16 个 LLM 上成功率 89% 至 98%。
- 会议论文USENIX Security 2025
树皮上的裂缝:利用公开知识移除 Tree-Ring 水印
仅需公开的 VAE 即可近似潜空间并移除 Tree-Ring 水印,检测 AUC 从 0.993 降至 0.153,且优于需完全访问模型的攻击。
- 会议论文USENIX Security 2025
GradEscape:针对 AI 生成文本检测器的基于梯度的规避攻击
提出首个基于梯度的 AIGT 检测器规避方法,在多个数据集和两个商用检测器上超过现有规避方法,并给出防御思路。
- 会议论文USENIX Security 2025
Chimera:欺骗图像重拍检测器与深度伪造检测器的数字签名伪造照片
提出端到端攻击 Chimera,用硬件感知的 GAN 补偿器生成带数字签名的伪造图像,同时绕过深度伪造检测和重拍检测,攻击成功率高。
- 会议论文USENIX Security 2025
SoK:动态深度学习系统的效率鲁棒性
首次系统梳理针对动态深度学习系统的效率攻击分类,涵盖三类动态行为,并指出现有防御对这类攻击存在局限。
- 会议论文USENIX Security 2025
Crescendo:多轮 LLM 越狱攻击
提出看似无害、逐步升级对话的多轮越狱 Crescendo 及自动化工具,在多个主流模型上成功率高,并可越狱多模态模型。
- 会议论文USENIX Security 2025
Machine Against the RAG:用阻断文档干扰检索增强生成
向知识库加入单个阻断文档即可让 RAG 拒绝回答特定查询,且无需指令注入或知道目标模型;现有安全指标无法衡量此脆弱性。
- 会议论文USENIX Security 2025
拒答并非选项:通过遗忘学习抹除大语言模型的安全对齐
提出两种利用看似合法的 unlearning 请求破坏安全对齐的攻击,使 LLaMA 有害性平均升高 11 倍,对 GPT-4o 微调服务同样有效。
- 会议论文USENIX Security 2025
暴露护栏:逆向并越狱 DALL·E 文生图流水线中的安全过滤器
用计时侧信道逆向 DALL·E 2/3 的级联安全过滤器,并利用否定表达与低资源语言漏洞实现越狱。
- 会议论文USENIX Security 2025
从威胁到信任:利用注意力机制攻防协同感知
SOMBRA 利用注意力融合实施隐蔽的目标移除攻击,成功率达 99%;LUCIA 以可信度感知注意力防御,大幅降低移除率。