顶会安全论文
共 212 篇
越狱与攻击
28- 针对语言模型水印的自适应攻击优化
- PANDAS:通过正向肯定、负面示范与自适应采样改进 many-shot 越狱
- 语言模型鲁棒性的规模化趋势
- 越狱税:越狱输出到底有多大用处?
- 对抗扰动由对抗 Jacobian 右奇异向量的线性组合迭代学习而成
- 越狱时的对抗推理Mahdi Sabbaghi, Paul Kassianik, George J. Pappas 等OpenReview
- AdvI2I:针对图像到图像扩散模型的对抗图像攻击
- AdvPrompter:面向 LLM 的快速自适应对抗提示Anselm Paulus, Arman Zharmagambetov, Chuan Guo 等OpenReview
- 面向 LLM 越狱的可解释 N-gram 困惑度威胁模型
- 针对 LLM 代码补全的黑盒对抗攻击Slobodan Jenko, Niels Mündler, Jingxuan He 等OpenReview
- 见树不见林:利用启发式与偏差诱导 LLM 的非理性选择Haoming Yang, Ke Ma, Xiaojun Jia 等OpenReview
- De-mark:大语言模型中的水印移除
- DiffAdvMAP:基于扩散模型生成自然的无限制对抗样本
- Emoji Attack:增强针对 Judge LLM 检测的越狱攻击Zhipeng Wei, Yuqi Liu, N. Benjamin ErichsonOpenReview
- FlipAttack:通过文本翻转越狱大语言模型
- HyperNear:针对超图神经网络的不易察觉节点注入攻击
- 通过刷票提升 Chatbot Arena 上的模型排名
- MemFreezing:有限未来知识下针对时序图神经网络的对抗攻击Yue Dai, Liang Liu, Xulong Tang 等OpenReview
- 全角度攻击:针对人脸识别的隐形强力物理对抗攻击Shuai Yuan, Hongwei Li, Rui Zhang 等OpenReview
- Pixel2Feature Attack:重新思考扰动空间以提升对抗迁移性
- REINFORCE 对抗攻击大语言模型:自适应、分布式、语义化目标
- 通过自信息改写攻击揭示文本水印的弱点
- Speak Easy:用简单交互诱发 LLM 的有害越狱Yik Siu Chan, Narutatsu Ri, Yuxin Xiao 等OpenReview
- TtBA:基于决策的对抗攻击的三分之二桥接方法
- 理解可迁移对抗攻击中的模型集成Wei Yao, Zeliang Zhang, Huayi Tang 等OpenReview
- 大语言模型的弱到强越狱Xuandong Zhao, Xianjun Yang, Tianyu Pang 等OpenReview
- 面向鲁棒多智能体强化学习的 Wolfpack 对抗攻击
- X-Transfer 攻击:面向 CLIP 的超强迁移对抗攻击
提示注入
3- Gandalf the Red:面向 LLM 的自适应安全Niklas Pfister, Václav Volhejn, Manuel Knott 等OpenReview
- MELON:针对 AI Agent 间接提示注入攻击的可证明防御Kaijie Zhu, Xianjun Yang, Jindong Wang 等OpenReview
- 角色分离的假象:LLM 角色学习中的隐藏捷径及修复
- AdvAgent:针对 Web Agent 的可控黑盒红队
- Cowpox:迈向基于 VLM 的多智能体系统免疫YUTONG WU, Jie Zhang, Yiming Li 等OpenReview
- GuardAgent:基于知识推理的 LLM Agent 护栏
- SafeArena:评估自主网页 Agent 的安全性Ada Defne Tur, Nicholas Meade, Xing Han Lù 等OpenReview
- ShieldAgent:通过可验证安全策略推理保护 AgentZhaorun Chen, Mintong Kang, Bo LiOpenReview
- UDora:通过动态劫持推理过程的统一 LLM Agent 红队框架
防御与护栏
58- STAIR:通过内省式推理改进安全对齐
- 频域视角下的扩散式对抗净化
- 通过对抗路径单纯形的闭式对齐提升 VLM 零样本对抗鲁棒性
- 为大语言模型学习安全约束
- 现实中没有可靠性:已部署神经网络验证的挑战
- 面向持续 LLM 遗忘的知识否定自适应定位
- 自适应中值平滑:遗忘后文生图扩散模型的推理时对抗防御Xiaoxuan Han, Songlin Yang, Wei Wang 等OpenReview
- 两阶段 Learning-to-Defer 的对抗鲁棒性:算法与保证
- 通过带随机性的可变形卷积提升对抗鲁棒性
- 量化大语言模型的安全风险评估与量化感知安全修补Kejia Chen, Jiawen Zhang, Jiacong Hu 等OpenReview
- 平均认证半径不是随机平滑的好指标
- CLAT:利用关键性提升对抗鲁棒性的对抗训练
- CASE-Bench:面向大语言模型的上下文感知安全基准Guangzhi Sun, Xiao Zhan, Shutong Feng 等OpenReview
- CAT:评估潜在扩散模型保护性扰动鲁棒性的对比对抗训练
- Confidential Guardian:用密码学手段防止模型弃权机制被滥用
- 发现针对语言模型水印的伪造攻击
- 基于 Lipschitz 有界网络的高效鲁棒共形预测
- 用共形预测增强对抗鲁棒性:保证模型可靠性的框架
- EraseAnything:面向整流流 Transformer 的概念擦除Daiheng Gao, Shilin Lu, Wenbo Zhou 等OpenReview
- 解释内在维度在对抗训练中的作用
- GaussMark:语言模型的结构化水印实用方法
- GaussMarker:面向扩散模型的鲁棒双域水印Kecen Li, Zhicong Huang, Xinwen Hou 等OpenReview
- 图像质量守卫:针对图像质量指标对抗攻击的防御基准
- 识别并理解对抗训练中的跨类别特征Zeming Wei, Steven Y. Guo, Yisen WangOpenReview
- 双目标优化改进 LLM 安全对齐Xuandong Zhao, Will Cai, Tianneng Shi 等OpenReview
- 不变性使 LLM 遗忘对未预期的下游微调保持鲁棒
- 恰到好处的偏移:用定向表示微调缓解对齐模型的过度拒答Mahavir Dabas, Si Chen, Charles Fleming 等OpenReview
- LEVIS:神经网络的大型精确可验证输入空间
- LlavaGuard:用于保护视觉数据集与模型的开源 VLM 安全护栏框架Lukas Helff, Felix Friedrich, Manuel Brack 等OpenReview
- 生成模型中的极简概念擦除Yang Zhang, Er Jin, Yanfei Dong 等OpenReview
- 对抗训练中的干净泛化与鲁棒过拟合:表示复杂度与训练动力学
- 一图胜千言:保持可用性的文本-图像协同概念擦除框架Feiran Li, Qianqian Xu, Shilong Bao 等OpenReview
- 一石二鸟:从分布差异视角增强对抗防御
- 优化专家混合模型的鲁棒性与准确率:双模型方法
- OR-Bench:大语言模型过度拒答基准Justin Cui, Wei-Lin Chiang, Ion Stoica 等OpenReview
- 相位与幅度感知提示以增强对抗鲁棒性
- POROver:用过度生成与偏好优化提升安全并减少过度拒答Batuhan K. Karaman, ishmam zabir, Alon Benhaim 等OpenReview
- 概率近似全局鲁棒性认证
- ProSec:用主动安全对齐加固代码大模型
- 基于随机平滑的可证明代价敏感对抗防御Yuan Xin, Dingfan Chen, Michael Backes 等OpenReview
- 用于提升鲁棒性的二次上界
- 面向随机对抗者的鲁棒多智能体强化学习
- 基于 LLM 改写器的鲁棒多比特文本水印
- Robust Secure Swap:屏蔽重点人物并可溯源的负责任换脸
- ROME:基于信息瓶颈的鲁棒蒸馏数据集
- Safe Delta:在多样数据集上微调 LLM 时持续保持安全性
- 显式安全信号让安全对齐不再流于表面Jianwei Li, Jung-Eun KimOpenReview
- 基于准则的安全推理Haoyu Wang, Zeyu Qin, Li Shen 等OpenReview
- SafetyAnalyst:可解释、透明、可调控的 AI 行为安全审核Jing-Jing Li, Valentina Pyatkin, Max Kleiman-Weiner 等OpenReview
- 图神经网络的自监督对抗净化
- SEMU:基于奇异值分解的高效机器遗忘
- StealthInk:面向大语言模型的多比特隐蔽水印
- 多模态对齐中对抗样本的拓扑特征Minh N. Vu, Geigh Zollicoffer, Huy Mai 等OpenReview
- 抵御再学习攻击的 LLM 遗忘:Sharpness-Aware Minimization 视角及拓展
- 释放大视觉语言模型能力实现可泛化、可解释的深度伪造检测
- 当坏数据带来好模型
- WMarkGPT:用多模态大模型理解带水印图像Songbai Tan, Xuerui Qiu, Yao Shu 等OpenReview
- XAttnMark:基于交叉注意力的鲁棒音频水印Yixin Liu, Lie Lu, Jihui Jin 等OpenReview
对齐
17- 涌现式失对齐:窄域微调可导致 LLM 广泛失对齐
- 私有且鲁棒的离线对齐统一理论分析:从 RLHF 到 DPO
- 逐层对齐:考察 VLM 图像编码器各层的安全对齐
- 面向情境感知伦理对齐的制衡框架Edward Y ChangOpenReview
- AssistanceZero:可扩展地求解辅助博弈
- 对克隆鲁棒的 AI 对齐Ariel D. Procaccia, Benjamin Schiffer, Shirley ZhangOpenReview
- 面向 LLM 对齐的 Conformal 尾部风险控制
- 直接密度比优化:统计一致的大语言模型对齐方法Rei Higuchi, Taiji SuzukiOpenReview
- HPS:面向人类偏好对齐的硬偏好采样
- InfAlign:感知推理阶段的语言模型对齐
- 潜在偏好编码:用离散潜码对齐大语言模型Zhuocheng Gong, Jian Guan, Wei Wu 等OpenReview
- 部分可观测辅助博弈中的观测干扰
- 面向大语言模型对齐的渐进式标签增强
- 提高门槛:用生成式演化测试考察 LLM 的价值观
- RuleAdapter:为 RLHF 安全奖励模型训练动态选择规则
- SPRI:用情境化原则对齐大语言模型Hongli Zhan, Muneeza Azmat, Raya Horesh 等OpenReview
- 优化学习奖励函数的风险:低训练误差不保证低遗憾Lukas Fluri, Leon Lang, Alessandro Abate 等OpenReview
奖励作弊
5- Best-of-N 是最优的吗?推理时对齐中的覆盖度、扩展与最优性
- MONA:短视优化加远视认可可缓解多步奖励作弊Sebastian Farquhar, Vikrant Varma, David Lindner 等OpenReview
- 语言模型蒸馏中的教师作弊
- RLHF 中的能量损失现象:缓解奖励作弊的新视角
- 代理数据何时能改善偏好学习的样本复杂度?
可解释性
6后门与投毒
20- 深入审视针对 CLIP 的后门攻击
- 针对强化学习的对抗性 Inception 后门攻击Ethan Rathbun, Alina Oprea, Christopher AmatoOpenReview
- 注意力机制 token 选择中的后门攻击
- 双视角分割防御:无需干净种子的后门安全
- 通过权重对称性绕开后门空间Jie Peng, Hongwei Yang, Jing Zhao 等OpenReview
- CROW:通过内部一致性正则化清除 LLM 后门
- 低秩适应会降低对训练时攻击的鲁棒性吗?Zi Liang, Haibo Hu, Qingqing Ye 等OpenReview
- 针对机器遗忘的灵活、高效、稳定的对抗攻击
- ICLShield:探索并缓解上下文学习后门攻击
- MixBridge:基于混合薛定谔桥的异构图像到图像后门攻击Shixi Qin, Zhiyong Yang, Shilong Bao 等OpenReview
- MP-Nav:增强针对多模态学习的数据投毒攻击Jingfeng Zhang, Prashanth Krishnamurthy, Naman Patel 等OpenReview
- 知识密集领域中应用 RAG 的脆弱性
- PoisonBench:评估语言模型对偏好数据投毒的脆弱性
- PoisonedEye:针对检索增强视觉语言模型的知识投毒攻击Chenyang Zhang, Xiaoyu Zhang, Jian Lou 等OpenReview
- 对抗性策展数据下的自消耗生成模型Xiukun Wei, Xueru ZhangOpenReview
- SPMC:基于边际贡献的自净化联邦后门防御
- 基于对比提示的测试时多模态后门检测Yuwei Niu, Shuo He, Qi Wei 等OpenReview
- 涟漪效应:后门攻击的意外并发症Rui Zhang, Yun Shen, Hongwei Li 等OpenReview
- 通过数据特定不可区分性实现可信机器学习
- 当无数据知识蒸馏遇上不可迁移教师:逃离分布外陷阱
隐私与数据泄露
51- 单次运行审计 f-差分隐私
- 基于能量引导数据合成与判别感知多任务优化的高效无源数据遗忘
- 错误未必不好:用对抗样本做机器遗忘
- PASS:基于随机数据替换的私有属性保护
- 结构化子采样的隐私放大:用于深度差分隐私时间序列预测
- 无需源数据的可认证遗忘方法
- 高效的私有 GPT 无需自回归解码Zhengyi Li, Yue Guan, Kang Yang 等OpenReview
- Cape:基于差分隐私的上下文感知提示扰动机制Haoqi Wu, Wei Dai, Wang Li 等OpenReview
- CEGA:低成本的图模型提取与获取方法
- 基于梯度训练的差分隐私预测认证Matthew Robert Wicker, Philip Sosnin, Igor Shilov 等OpenReview
- 神经网络的可证明遗忘Anastasia Koloskova, Youssef Allouah, Animesh Jha 等OpenReview
- 客户端协作:效用-隐私权衡有保证提升的灵活差分隐私联邦学习Yuecheng Li, Lele Fu, Tong Wang 等OpenReview
- 连接 Thompson Sampling 与 UCB:更高效的隐私与遗憾权衡
- 基于加权多预训练模型融合的对比式隐私数据合成Tianyuan Zou, Yang Liu, Peng Li 等OpenReview
- De-AntiFake:重新审视针对语音克隆攻击的保护性扰动Wei Fan, Kejiang Chen, Chang Liu 等OpenReview
- 二元响应模型的差分隐私分析:最优性、估计与推断Ce Zhang, Yixin Han, Yafei Wang 等OpenReview
- DIS-CO:发现 VLM 训练数据中的受版权内容André V. Duarte, Xuandong Zhao, Arlindo L. Oliveira 等OpenReview
- DMM:基于常数开销线性秘密重分享的差分隐私联邦学习分布式矩阵机制Alexander Bienstock, Ujjwal Kumar, Antigoni PolychroniadouOpenReview
- 别模仿我的声音:零样本 TTS 的说话人身份遗忘Taesoo Kim, Jinju Kim, Dong Chan Kim 等OpenReview
- DRAG:基于引导扩散的数据重建攻击Wa-Kin Lei, Jun-Cheng Chen, Shang-Tse ChenOpenReview
- 高效且保护隐私的 LLM 软提示迁移Xun Wang, Jing Xu, Franziska Boenisch 等OpenReview
- EgoPrivacy:第一人称相机暴露了你的什么信息?Yijiang Li, Genpei Zhang, Jiacheng Cheng 等OpenReview
- 经验隐私方差Yuzheng Hu, Fan Wu, Ruicheng Xian 等OpenReview
- EncryptedLLM:基于 GPU 加速全同态加密的隐私保护 LLM 推理Leo de Castro, Daniel Escudero, Adya Agrawal 等OpenReview
- 面向 LLM 上下文学习数据的快速精确遗忘Andrei Ioan Muresanu, Anvith Thudi, Michael R. Zhang 等OpenReview
- 从片段到事实:对 LLM 的部分信息片段推断攻击
- 多模态模型的梯度反演Omri Ben Hemo, Alon Zolfi, Oryan Yehezkel 等OpenReview
- 这也是我的数据:多用户训练样本数据集的隐私机器学习Arun Ganesh, Ryan McKenna, Hugh Brendan McMahan 等OpenReview
- Janus:面向联邦学习的双服务器多轮可验证安全聚合Lang Pu, Jingjing Gu, Chao Lin 等OpenReview
- 利用模型引导从个性化扩散模型中提取训练数据Xiaoyu Wu, Jiaru Zhang, Steven WuOpenReview
- 利用逐样本隐私损失进行机器遗忘
- 利用模型与数据划分中的随机性实现隐私放大Andy Dong, Wei-Ning Chen, Ayfer OzgurOpenReview
- MTL-UE:为多任务学习生成不可学习样本Yi Yu, Song Xia, SIYUAN YANG 等OpenReview
- 用于提升差分隐私上下文学习准确率的合理词元放大Yusuke Yamasaki, Kenta Niwa, Daiki Chijiwa 等OpenReview
- 针对图像自回归模型的隐私攻击
- 基于偏好优化合成数据的私有联邦学习Charlie Hou, Mei-Yu Wang, Yige Zhu 等OpenReview
- 重访私有模型个性化Conor Snedeker, Xinyu Zhou, Raef BassilyOpenReview
- 基于自适应加权的可扩展差分隐私分区选择Justin Y. Chen, Vincent Cohen-Addad, Alessandro Epasto 等OpenReview
- 差分隐私语言模型的 Scaling LawsRyan McKenna, Yangsibo Huang, Amer Sinha 等OpenReview
- SecEmb:面向大规模 embedding 的稀疏感知安全联邦推荐系统Peihua Mai, Youlong Ding, Ziyan Lyu 等OpenReview
- STAMP:通过带水印的改写证明数据集成员身份
- Stealix:基于提示进化的模型窃取Zhixiong Zhuang, Hui-Po Wang, Maria-Irina Nicolae 等OpenReview
- 系统感知的遗忘算法:存得更少,忘得更快
- 文本遗忘带来虚假的遗忘感Jiacheng Du, Zhibo Wang, Jie Zhang 等OpenReview
- Canary 的回声:审计 LLM 生成合成文本的隐私风险
- 从理论上揭示针对联邦视觉模型中 LDP 保护客户端的推断攻击Quan Minh Nguyen, Minh N. Vu, Truc Nguyen 等OpenReview
- 面向扩散模型的黑盒成员推断攻击Jingwei Li, Jing Dong, Tianxing He 等OpenReview
- 面向不可信参与者的可信联邦学习Youssef Allouah, Rachid Guerraoui, John StephanOpenReview
- LLM 遗忘中少数群体隐私风险被低估Rongzhe Wei, Mufei Li, Mohsen Ghassemi 等OpenReview
- 方差作为催化剂:针对定制扩散模型的高效可迁移语义擦除对抗攻击Jiachen Yang, Yusong Wang, Yanmei Fang 等OpenReview
- 当心你的相册:多模态大模型的无意隐私记忆Tianjie Ju, Yi Hua, Hao Fei 等OpenReview
- 硬件与软件平台推断Cheng Zhang, Hanna Foerster, Robert D. Mullins 等OpenReview
- Mind the Gap:针对 GGUF 量化的实用攻击Kazuki Egashira, Robin Staab, Mark Vero 等OpenReview
危险能力
2- RE-Bench:对比人类专家评估前沿 AI Agent 的 AI 研发能力
- The Elicitation Game:评估能力激发技术Felix Hofstätter, Teun van der Weij, Jayden Teoh 等OpenReview
- 条件数视角下的模型免疫
- 良性样本也重要:在离群良性样本上微调会严重破坏安全性
- Antidote:针对有害微调攻击的微调后安全对齐Tiansheng Huang, Gautam Bhattacharya, Pratik Joshi 等OpenReview
- 漏洞感知对齐:缓解有害微调中的不均匀遗忘
红队
6- 探究并缓解基于投票的排行榜被对抗操纵的问题
- 攻击者可以滥用安全模型的组合Erik Jones, Anca Dragan, Jacob SteinhardtOpenReview
- 用 GOAT 自动化红队:生成式攻击型测试 AgentMaya Pavlova, Erik Brinkman, Krithika Iyer 等OpenReview
- 用调查员 Agent 诱发语言模型行为
- ELITE:面向安全的增强型图文毒性评测Wonjun Lee, Doehyeon Lee, Eugene Choi 等OpenReview
- TRUST-VLM:对视觉语言模型安全威胁的全面红队测试Kangjie Chen, Li Muyang, Guanlin Li 等OpenReview