顶会安全论文
共 125 篇
越狱与攻击
19- 树皮上的裂缝:利用公开知识移除 Tree-Ring 水印Junhua Lin, Marc Juarez会议页面
- Atkscopes:针对感知哈希的多分辨率对抗扰动统一攻击
- Chimera:欺骗图像重拍检测器与深度伪造检测器的数字签名伪造照片
- 评估基于视觉相似性的钓鱼检测模型的有效性与鲁棒性
- 利用任务级漏洞:LLM 的自动越狱攻击与防御基准Lan Zhang, Xinben Gao, Liuyi Yao 等会议页面
- 暴露护栏:逆向并越狱 DALL·E 文生图流水线中的安全过滤器Corban Villa, Shujaat Mirza, Christina Pöpper会议页面
- 从威胁到信任:利用注意力机制攻防协同感知Chenyi Wang, Raymond Muller, Ruoyu Song 等会议页面
- GradEscape:针对 AI 生成文本检测器的基于梯度的规避攻击Wenlong Meng, Shuguo Fan, Chengkun Wei 等会议页面
- Crescendo:多轮 LLM 越狱攻击Mark Russinovich, Ahmed Salem, Ronen Eldan会议页面
- 隐形但被检测:LiDAR 目标检测的物理对抗阴影攻击与防御Ryunosuke Kobayashi, Kazuki Nomoto, Yuna Tanaka 等会议页面
- 留意不起眼之处:揭示对齐 LLM 拒答边界中的隐藏弱点Jiahao Yu, Haozheng Luo, Jerry Yao-Chieh Hu 等会议页面
- 眼中的幻象:仅利用注意力汇聚对多模态大模型的幻觉攻击Yining Wang, Mi Zhang, Junjie Sun 等会议页面
- PAPILLON:基于模糊测试的高效隐蔽 LLM 越狱Xueluan Gong, Mingzhe Li, Yilin Zhang 等会议页面
- Red Bleed:针对人脸生物识别认证系统的近红外呈现攻击
- 拒答并非选项:通过遗忘学习抹除大语言模型的安全对齐Minkyoo Song, Hanna Kim, Jaehan Kim 等会议页面
- SoK:动态深度学习系统的效率鲁棒性Ravishka Rathnasuriya, Tingxi Li, Zexin Xu 等会议页面
- TwinBreak:基于孪生提示的 LLM 安全对齐越狱Torsten Krauß, Hamid Dashtbani, Alexandra Dmitrienko会议页面
- ML/AI 会议审稿人分配中文本匹配对串通攻击的脆弱性
- 当翻译器拒绝翻译:针对语音翻译系统的新型攻击Haolin Wu, Chang Liu, Jing Chen 等会议页面
提示注入
4- Machine Against the RAG:用阻断文档干扰检索增强生成Avital Shafran, Roei Schuster, Vitaly Shmatikov会议页面
- 自解释对抗图像Tingwei Zhang, Collin Zhang, John X. Morris 等会议页面
- StruQ:用结构化查询防御提示注入Sizhe Chen, Julien Piet, Chawin Sitawarin 等会议页面
- TracLLM:长上下文 LLM 归因的通用框架Yanting Wang, Wei Zou, Runpeng Geng 等会议页面
- 以 Agent 对抗 Agent:自动检测 LLM Agent 中的污点型漏洞Fengyu Liu, Yuan Zhang, Jiaqi Luo 等会议页面
防御与护栏
22- “因违反内容政策无法撰写”:生成式 AI 产品的内容审核政策与用户体验Lan Gao, Oscar Chen, Rachel Lee 等会议页面
- 激活近似会给对齐 LLM 带来安全漏洞:全面分析与防御Jiawen Zhang, Kejia Chen, Lipeng He 等会议页面
- AGNNCert:以确定性认证防御图神经网络的任意扰动Jiate Li, Binghui Wang会议页面
- AudioMarkNet:用于深度伪造语音检测的音频水印Wei Zong, Yang-Wai Chow, Willy Susilo 等会议页面
- CAMP:通过认证半径最大化实现可证明鲁棒的强化学习Derui Wang, Kristen Moore, Diksha Goel 等会议页面
- CertPHash:通过鲁棒训练实现可认证的感知哈希
- CertTA:面向学习型流量分析的实用认证鲁棒性Jinzhu Yan, Zhuotao Liu, Yuyang Xie 等会议页面
- 以火攻火:面向对抗性 Android 恶意软件检测的持续攻击防御
- HateBench:在 LLM 生成内容与仇恨活动上评测仇恨言论检测器Xinyue Shen, Yixin Wu, Yiting Qu 等会议页面
- JBShield:通过激活概念分析与操控防御 LLM 越狱攻击Shenyi Zhang, Yuchen Zhai, Keyan Guo 等会议页面
- Phantom:异构 TEE 与 GPU 系统中保护隐私的 DNN 模型混淆Juyang Bai, Md Hafizul Islam Chowdhuryy, Jingtao Li 等会议页面
- 面向大语言模型的提示混淆David Pape, Sina Mavali, Thorsten Eisenhofer 等会议页面
- 可证明鲁棒的 AI 生成文本多比特水印Wenjie Qu, Wengrui Zheng, Tianyang Tao 等会议页面
- 用 PANTS 增强 ML 网络流量分类器的鲁棒性Minhao Jin, Maria Apostolaki会议页面
- Scoop:缓解基于溯源的媒体认证中的重拍攻击
- SelfDefend:LLM 可实用地自我防御越狱Xunguang Wang, Daoyuan Wu, Zhenlan Ji 等会议页面
- THEMIS:面向部署后端侧深度学习模型的实用知识产权保护Yujin Huang, Zhi Zhang, Qingchuan Zhao 等会议页面
- 理解并增强 DNN 模型所有权验证中训练证明(PoT)的安全性Yijia Chang, Hanrui Jiang, Chao Lin 等会议页面
- 不安全的 LLM 搜索:AI 网页搜索安全风险的量化分析与缓解Zeren Luo, Zifan Peng, Yule Liu 等会议页面
- USD:基于场景图的文生图模型 NSFW 内容检测Yuyang Zhang, Kangjie Chen, Xudong Jiang 等会议页面
- VAPD:具备对抗鲁棒性的 PDF 恶意软件取证异常检测模型
- VoiceWukong:深度伪造语音检测基准Ziwei Yan, Yanjie Zhao, Haoyu Wang会议页面
对齐
1- 弥合视觉语言模型跨模态识别不安全概念的差距Yiting Qu, Michael Backes, Yang Zhang会议页面
后门与投毒
17- AUDIO WATERMARK:面向黑盒语音数据集版权保护的动态无害水印Hanqing Guo, Junfeng Guo, Bocheng Chen 等会议页面
- 向 Stable Diffusion 模型植入偏见后门(B^2)Ali Naseh, Jaechul Roh, Eugene Bagdasarian 等会议页面
- 数据复制:机器遗忘中的一种多用途攻击范式Dayong Ye, Tianqing Zhu, Jiayang Li 等会议页面
- DeBackdoor:数据受限下检测深度模型后门的演绎框架Dorde Popovic, Amin Sadeghi, Ting Yu 等会议页面
- EmbedX:针对大语言模型的基于嵌入的跨触发器后门攻击Nan Yan, Yuqing Li, Xiong Wang 等会议页面
- 从纯净到危险:用“无害”良性组件给合并模型植入后门Lijin Wang, Jingjing Wang, Tianshuo Cong 等会议页面
- GPUHammer:针对 GPU 显存的 Rowhammer 攻击切实可行
- LightShed:击破基于扰动的图像版权保护Hanna Foerster, Sasha Behrouzi, Phillip Rieger 等会议页面
- 神经隐身斗篷:通过被攻陷的 AI 图像信号处理在图像中隐藏攻击者Wenjun Zhu, Xiaoyu Ji, Xinfeng Li 等会议页面
- 利用良性提示从文生图模型主动生成不安全图像Yixin Wu, Ning Yu, Michael Backes 等会议页面
- 持续学习中的持久后门攻击Zhen Guo, Abhinav Kumar, Reza Tourani会议页面
- PoiSAFL:针对拜占庭鲁棒半异步联邦学习的可扩展投毒攻击框架Xiaoyi Pang, Chenxu Zhao, Zhibo Wang 等会议页面
- PoisonedRAG:针对大模型检索增强生成的知识污染攻击Wei Zou, Runpeng Geng, Binghui Wang 等会议页面
- 重新审视后门攻击中训练与推理触发器的强度Chenhao Lin, Chenyang Zhao, Shiwei Wang 等会议页面
- 基于 Rowhammer 的木马注入:翻转一个比特即可给 DNN 植入后门Xiang Li, Ying Meng, Junming Chen 等会议页面
- Topic-FlipRAG:面向 RAG 模型的主题导向对抗性观点操纵攻击Yuyang Gong, Zhuo Chen, Jiawei Liu 等会议页面
- 看好守卫者!增强鲁棒性的扩散模型的安全风险Changjiang Li, Ren Pang, Bochuan Cao 等会议页面
隐私与数据泄露
48- Aion:抵御恶意参与者的多轮单掩码安全聚合Yizhong Liu, Zixiao Jia, Zian Jin 等会议页面
- BarraCUDA:边缘 GPU 确实会泄露 DNN 权重
- 是大帮手还是老大哥?审计生成式 AI 助手的追踪、画像与个性化Yash Vekaria, Aurelio Loris Canino, Jonathan Levitsky 等会议页面
- 增强梯度泄露攻击:真实联邦学习场景下的数据重建Mingyuan Fan, Fuyi Wang, Cen Chen 等会议页面
- Bot 会窥探:群聊中聊天机器人的隐私风险发现与缓解
- 跨模态提示反演:统一针对文本与图像生成模型的威胁Dayong Ye, Tianqing Zhu, Feng He 等会议页面
- 无数据的模型相关攻击:释放生成式 AI 的潜力Dayong Ye, Tianqing Zhu, Shang Wang 等会议页面
- 深度带来虚假的隐私感:LLM 内部状态反演Tian Dong, Yan Meng, Shaofeng Li 等会议页面
- 差异化隐私脆弱性:定向属性推断攻击与防御Ehsanul Kabir, Lucas Craig, Shagufta Mehnaz会议页面
- 图神经网络中的分布式私有聚合
- DP-BREM:基于客户端动量的差分隐私与拜占庭鲁棒联邦学习Xiaolan Gu, Ming Li, Li Xiong会议页面
- 基于增强少样本学习的 LLM PII 高效提取Shuai Cheng, Shu Meng, Haitao Xu 等会议页面
- 更少查询的增强型 label-only 成员推断攻击Hao Li, Zheng Li, Siyuan Wu 等会议页面
- 评估基于 LLM 的个人信息提取及其对策Yupei Liu, Yuqi Jia, Jinyuan Jia 等会议页面
- 用户对通用 LLM 聊天机器人用于心理健康的安全与隐私态度
- 仅供人耳:防止对语音数据的自动化监控Irtaza Shahid, Nirupam Roy会议页面
- 翻译中的发现:用生成式语言模型攻击内存访问模式
- 基于训练产物的免费记录级隐私风险评估Joseph Pollock, Igor Shilov, Euodia Dodd 等会议页面
- 从风险到韧性:评估并缓解联邦学习中的数据重建攻击风险Xiangrui Xu, Zhize Li, Yufei Han 等会议页面
- Game of Arrows:端侧 TEE 保护 LLM 分区方案中权重混淆的(不)安全性Pengli Wang, Bingyou Dong, Yifeng Cai 等会议页面
- 虚假隐私的生成数据:用生成数据微调 LLM 的隐藏风险Atilla Akkus, Masoud Poorghaffar Aghdam, Mingjie Li 等会议页面
- 我知道你说了什么:本地 LLM 推理中的硬件缓存侧信道Zibo Gao, Junjie Hu, Feng Guo 等会议页面
- LLMmap:大语言模型指纹识别Dario Pasquini, Evgenios M. Kornaropoulos, Giuseppe Ateniese会议页面
- 恶意 LLM 对话 AI 诱使用户泄露个人信息
- 针对视觉语言模型的成员推断攻击Yuke Hu, Zheng Li, Zhihao Liu 等会议页面
- NeuroScope:基于动态分析逆向边缘设备上的深度神经网络
- Pretender:针对扩散模型微调攻击的通用主动防御Zekun Sun, Zijian Liu, Shouling Ji 等会议页面
- PrivacyXray:通过语义一致性与概率确定性检测 LLM 隐私泄露Jinwen He, Yiyang Lu, Zijin Lin 等会议页面
- Private Investigator:用优化提示从 LLM 中提取个人身份信息Seongho Keum, Dongwon Shin, Leo Marchyok 等会议页面
- PRSA:针对真实提示服务的提示窃取攻击Yong Yang, Changjiang Li, Qingming Li 等会议页面
- 修正机器遗忘中的隐私与效果度量:一种新的推断攻击视角Nima Naderloui, Shenao Yan, Binghui Wang 等会议页面
- Refiner:抵御联邦学习梯度泄露攻击的数据精炼防御Mingyuan Fan, Cen Chen, Chengyu Wang 等会议页面
- SafeSpeech:针对恶意语音合成的鲁棒通用语音保护Zhisheng Zhang, Derui Wang, Qianyi Yang 等会议页面
- SEAF:面向两方安全推理的动态精度激活函数安全计算
- 锐度感知初始化:从基本原理改进差分隐私机器学习Zihao Wang, Rui Zhu, Dongruo Zhou 等会议页面
- SLOTHE:加密数据上非算术神经网络函数的惰性近似Kevin Nam, Youyeon Joo, Seungjin Ha 等会议页面
- SOFT:选择性数据混淆保护 LLM 微调免受成员推断攻击Kaiyuan Zhang, Siyuan Cheng, Hanxi Guo 等会议页面
- SoK:合成图像能否取代真实数据?合成图像生成的效用与隐私综述
- SoK:针对机器学习模型的数据重建攻击——定义、度量与基准Rui Wen, Yiyong Liu, Michael Backes 等会议页面
- SoK:联邦学习中的梯度反演攻击Vincenzo Carletti, Pasquale Foggia, Carlo Mazzocca 等会议页面
- SoK:联邦学习中的梯度泄露Jiacheng Du, Jiahui Hu, Zhibo Wang 等会议页面
- Suda:面向纵向隐私保护机器学习的高效安全非平衡数据对齐框架
- 面向云端模型训练的任务导向训练数据隐私保护Zhiqiang Wang, Jiahui Hou, Haifeng Sun 等会议页面
- 重新评估实践中的数据伪造攻击Mohamed Suliman, Anisa Halimi, Swanand Ravindra Kadhe 等会议页面
- 面向预训练大语言模型的仅标签成员推断攻击Yu He, Boheng Li, Liu Liu 等会议页面
- 迈向全生命周期遗忘承诺管理:度量样本级 unlearning 完整性Cheng-Long Wang, Qi Li, Zihang Xiang 等会议页面
- 释放差分隐私零阶优化在 LLM 微调中的潜力Ergute Bao, Yangfan Jiang, Fei Wei 等会议页面
- Whispering Under the Eaves:针对商用与 LLM 驱动 ASR 系统的用户隐私保护Weifei Jin, Yuxin Cao, Junjie Su 等会议页面
- 我们有个包给你!代码生成 LLM 的包幻觉全面分析Joseph Spracklen, Raveen Wijewickrama, A H M Nazmus Sakib 等会议页面
- 验证码还难倒机器人吗?基于 Agent 视觉语言模型的通用视觉验证码破解Xiwen Teoh, Yun Lin, Siqi Li 等会议页面
- Cloak, Honey, Trap:针对 LLM Agent 的主动防御Daniel Ayzenshteyn, Roy Weiss, Yisroel Mirsky会议页面
- ELFuzz:通过 LLM 驱动的 fuzzer 空间合成实现高效输入生成
- 基于 LLM 约束求解的混合语言处理器模糊测试
- LLMxCPG:基于代码属性图引导大语言模型的上下文感知漏洞检测
- 用 LLM 合成输入生成器实现低成本、全面的非文本输入 fuzzing
- 使用大语言模型进行密码猜测
- TORCHLIGHT:揭示隐藏于 Tor 网络中针对无云 IoT 设备的真实攻击
- 当 LLM 联网:联网 LLM 的新兴威胁Hanna Kim, Minkyoo Song, Seung Ho Na 等会议页面
红队
3- 分析 AI 脱衣应用生态
- 刻画 MrDeepFakes 性深度伪造交易市场
- 从 Meme 到威胁:开源视觉语言模型的仇恨 Meme 理解与诱导仇恨内容生成Yihan Ma, Xinyue Shen, Yiting Qu 等会议页面