顶会安全论文
共 45 篇
- EvilHarmony:针对黑盒语音识别系统的隐蔽对抗攻击
- 模糊测试结合LLM智能体:自动高效越狱文本到图像生成模型Yingkai Dong, Xiangtao Meng, Ning Yu 等会议页面
- Modifier Unlocked:通过提示词越狱文本到图像模型Shuofeng Liu, Mengyao Ma, Minhui Xue 等会议页面
- UnMarker:针对防御性图像水印的通用攻击Andre Kassis, Urs Hengartner会议页面
提示注入
2- DataSentinel:基于博弈论的提示注入攻击检测Yupei Liu, Yuqi Jia, Jinyuan Jia 等会议页面
- Fun-tuning:专有LLM对基于优化的提示注入攻击的脆弱性Andrey Labunets, Nishit V. Pandya, Ashish Hooda 等会议页面
防御与护栏
12- 实际深度学习无线系统中基于 ViT 的对抗鲁棒自动调制识别
- EveGuard:用音频对抗扰动抵御基于振动的侧信道窃听
- 探究亲子视角下的生成式 AI 安全:担忧、缓解策略与设计启示
- 以火攻火:用模式随机化防御补丁对抗对抗性补丁攻击Jianan Feng, Jiachun Li, Changqing Miao 等会议页面
- GuardAIn:保护异构 NPU 上的新兴生成式 AI 工作负载
- 协作机器学习中鲁棒性与学习之间的冲突Mathilde Raynal, Carmela Troncoso会议页面
- 查询溯源分析:抵御基于查询的黑盒攻击的高效稳健防御Shaofei Li, Ziqi Zhang, Haomin Jia 等会议页面
- SoK:AI 生成内容的水印技术Xuandong Zhao, Sam Gunn, Miranda Christ 等会议页面
- 用大语言模型辅助人工评审员检测有害内容
- TSQP:保护边缘设备上量化神经网络的实时推理Yu Sun, Gaojian Xiong, Jianhua Liu 等会议页面
- 可验证的提升树集成模型Stefano Calzavara, Lorenzo Cazzaro, Claudio Lucchese 等会议页面
- 面向众多自适应用户的语言模型水印Aloni Cohen, Alexander Hoover, Gabe Schoenbach会议页面
对齐
1- 缓解 LLM 微调中丢失对齐的担忧Kang Yang, Guanhong Tao, Xun Chen 等会议页面
奖励作弊
1- 奖励模型学习中的偏好投毒攻击Junlin Wu, Jiongxiao Wang, Chaowei Xiao 等会议页面
- 从第一性原理研究架构神经后门Harry Langford, Ilia Shumailov, Yiren Zhao 等会议页面
- BAIT:通过反演攻击目标扫描大语言模型后门Guangyu Shen, Siyuan Cheng, Zhuo Zhang 等会议页面
- 并非所有边都同样鲁棒:评估基于排序的联邦学习的鲁棒性Zirui Gong, Yanjun Zhang, Leo Yu Zhang 等会议页面
- PEFTGuard:检测针对参数高效微调的后门攻击Zhen Sun, Tianshuo Cong, Yule Liu 等会议页面
- 聚类联邦学习中有限拜占庭客户端的实用投毒攻击Viet Vo, Mengyao Ma, Guangdong Bai 等会议页面
- 安全迁移学习:抵御预训练编码器与下游数据集中的后门Yechao Zhang, Yuxuan Zhou, Tianyu Li 等会议页面
隐私与数据泄露
14- CipherSteal:利用密文侧信道从 TEE 保护的神经网络中窃取输入数据
- Codebreaker:代码语言模型的动态提取攻击
- Comet:通过预测激活稀疏性加速大语言模型的私有推理
- 边缘遗忘并非“在边缘”:资源受限设备上的自适应精确遗忘系统Xiaoyu Xia, Ziqi Wang, Ruoxi Sun 等会议页面
- GRID:保护训练图免受 GNN 模型的链接窃取攻击Jiadong Lou, Xu Yuan, Rui Zhang 等会议页面
- HARMONYCLOAK:让音乐对生成式AI不可学习Syed Irfan Ali Meerza, Lichao Sun, Jian Liu会议页面
- 面向受保护属性的隐私机器学习Saeed Mahloujifar, Chuan Guo, Edward Suh 等会议页面
- 真实环境提示词窃取攻击的有效性Yicong Tan, Xinyue Shen, Yun Shen 等会议页面
- 普及压过担忧?中国用户对基于 LLM 的医疗咨询的隐私意识与期望
- 针对大语言模型协同推理的提示词反演攻击Wenjie Qu, Yuguang Zhou, Yongji Wu 等会议页面
- 操纵基础模型:通过预训练操控实现更强的成员推断攻击Zihao Wang, Rui Zhu, Zhikun Zhang 等会议页面
- SoK:机器学习系统中的数据集版权审计Linkang Du, Xuanru Zhou, Min Chen 等会议页面
- 可靠验证个性化文生图扩散模型中的未授权数据使用Boheng Li, Yanhao Wei, Yankai Fu 等会议页面
- 理解用户对对话式AI平台的安全与隐私担忧及态度Mutahar Ali, Arjun Arunasalam, Habiba Farrukh会议页面
- 我的模型对你来说是恶意软件:滥用TensorFlow API将AI模型转化为恶意软件
- LLM应用商店的安全性分析Xinyi Hou, Yanjie Zhao, Haoyu Wang会议页面
危险能力
1- GPTracker:大规模测量GPT的滥用情况Xinyue Shen, Yun Shen, Michael Backes 等会议页面