顶会安全论文
共 233 篇
越狱与攻击
31- AutoDAN-Turbo:自主探索越狱策略的终身智能体
- 用迁移先验增强 hard-label 攻击的射线搜索
- $\sigma$-zero:基于梯度的$\ell_0$范数对抗样本优化Antonio Emanuele Cinà, Francesco Villani, Maura Pintor 等OpenReview
- 针对图像水印的迁移规避攻击Yuepeng Hu, Zhengyuan Jiang, Moyang Guo 等OpenReview
- AdvWave:针对大音频语言模型的隐蔽对抗越狱攻击Mintong Kang, Chejian Xu, Bo LiOpenReview
- Engorgio提示使大语言模型陷入喋喋不休Jianshuo Dong, Ziyuan Zhang, Qingjie Zhang 等OpenReview
- 千处泄露致防线失守:「安全」AI 回复中的不安全信息泄露David Glukhov, Ziwen Han, Ilia Shumailov 等OpenReview
- 大语言模型会成为煤气灯操纵者吗?Wei Li, Luyao Zhu, Yang Song 等OpenReview
- 置信度诱导:大语言模型的新型对抗攻击途径Brian Formento, Chuan-Sheng Foo, See-Kiong NgOpenReview
- 大语言模型的拒答训练能泛化到过去时态吗?Maksym Andriushchenko, Nicolas FlammarionOpenReview
- 大语言模型的安全训练能否泛化至语义相关的自然提示?Sravanti Addepalli, Yerram Varun, Arun Suggala 等OpenReview
- 针对大语言模型的持久化量化条件失准攻击Peiran Dong, Haowei Li, Song GuoOpenReview
- 基于多臂老虎机上下文切换的高效大语言模型序列越狱攻击
- 基于双射学习的无限越狱攻击Brian R.Y. Huang, Maximilian Li, Leonard TangOpenReview
- 视觉语言模型间可迁移图像越狱攻击的失败现象研究Rylan Schaeffer, Dan Valentine, Luke Bailey 等OpenReview
- 泛函同伦:平滑离散优化以实现大模型越狱攻击Zi Wang, Divyam Anshumaan, Ashish Hooda 等OpenReview
- GSE:分组稀疏且可解释的对抗攻击
- h4rm3l:用于可组合越狱攻击合成的领域特定语言Moussa Koulako Bala Doumbouya, Ananjan Nandi, Gabriel Poesia 等OpenReview
- 大语言模型基于优化的越狱改进技术Xiaojun Jia, Tianyu Pang, Chao Du 等OpenReview
- 将大语言模型越狱视为奖励错误指定问题Zhihui Xie, Jiahui Gao, Lei Li 等OpenReview
- 利用简单自适应攻击越狱主流安全对齐大语言模型Maksym Andriushchenko, Francesco Croce, Nicolas FlammarionOpenReview
- Logicbreaks:理解规则推理被颠覆的框架Anton Xue, Avishree Khare, Rajeev Alur 等OpenReview
- 无标签测试时自适应的对抗脆弱性研究Shahriar Rifat, Jonathan Ashdown, Michael J. De Lucia 等OpenReview
- 一模迁所有:面向大语言模型的鲁棒越狱提示生成
- ProAdvPrompter:两阶段高效对抗性提示生成方法Hao Di, Tong He, Haishan Ye 等OpenReview
- 分辨率攻击:利用图像压缩欺骗深度神经网络Wangjia Yu, Xiaomeng Fu, Qiao Li 等OpenReview
- 从时间与模态视角重新审视音视频对抗脆弱性Zeliang Zhang, Susan Liang, Daiki Shimada 等OpenReview
- 针对语言模型激活与Token对抗攻击的缩放定律
- TASAR:骨骼动作识别的迁移对抗攻击Yunfeng Diao, Baiqi Wu, Ruixuan Zhang 等OpenReview
- 理解并提升大语言模型越狱攻击的迁移性Runqi Lin, Bo Han, Fengwang Li 等OpenReview
- UV-Attack:基于动态NeRF纹理映射的行人检测物理对抗攻击
提示注入
3- 面向大语言模型的对抗性搜索引擎优化Fredrik Nestaas, Edoardo Debenedetti, Florian TramèrOpenReview
- 大语言模型能否分离指令与数据?Egor Zverev, Sahar Abdelnabi, Soroush Tabesh 等OpenReview
- 指令分段嵌入:利用指令层级提升LLM安全性Tong Wu, Shujian Zhang, Kaiqiang Song 等OpenReview
- Agent Security Bench:LLM Agent 攻防的形式化与基准评测
- AgentHarm:评估大语言模型Agent危害性的基准Maksym Andriushchenko, Alexandra Souly, Mateusz Dziemian 等OpenReview
- 已对齐的LLM并非已对齐的浏览器智能体Priyanshu Kumar, Elaine Lau, Saranya Vijayakumar 等OpenReview
- BadRobot:在物理世界中越狱具身LLM智能体Hangtao Zhang, Chenyu Zhu, Xianlong Wang 等OpenReview
- 剖析多模态语言模型智能体的对抗鲁棒性Chen Henry Wu, Rishi Rajesh Shah, Jing Yu Koh 等OpenReview
- EIA:针对通用Web智能体以窃取隐私的环境注入攻击Zeyi Liao, Lingbo Mo, Chejian Xu 等OpenReview
防御与护栏
55- 回溯机制提升大语言模型文本生成安全性
- 安全对齐不应仅仅停留在前几个Token深度
- $R^2$-Guard:基于知识增强逻辑推理的鲁棒大模型安全护栏
- ADBM:用于可靠对抗净化的对抗扩散桥模型Xiao Li, Wenxuan Sun, Huanran Chen 等OpenReview
- 有动机的对手:对抗鲁棒性的策略性替代方案Maayan Ehrenberg, Roy Ganz, Nir RosenfeldOpenReview
- AdvPaint:通过对抗性注意力扰动防御图像修复篡改Joonsung Jeon, Woo Jae Kim, Suhyeon Ha 等OpenReview
- 面向生成式图像模型的不可检测水印Sam Gunn, Xuandong Zhao, Dawn SongOpenReview
- ASTrA:带自适应攻击的对抗式自监督训练
- 超越Token分析:防御大模型社会工程攻击的超图度量空间框架
- BingoGuard:具备风险等级的大语言模型内容审核工具Fan Yin, Philippe Laban, XIANGYU PENG 等OpenReview
- BlueSuffix:抵御越狱攻击的强化视觉语言模型蓝队防御Yunhan Zhao, Xiang Zheng, Lin Luo 等OpenReview
- 有界Levenshtein距离下的可验证鲁棒性Elias Abad Rocamora, Grigorios Chrysos, Volkan CevherOpenReview
- CLIPure:基于CLIP隐空间的对抗防御纯化方法Mingkun Zhang, Keping Bi, Wei Chen 等OpenReview
- 基于残差注意力门的文生图扩散模型概念精准擦除
- ConceptPrune:基于关键神经元剪枝的扩散模型概念编辑Ruchika Chavhan, Da Li, Timothy HospedalesOpenReview
- 大型视觉语言模型中的跨模态安全机制迁移
- 用于机器生成文本检测的深度核相对检验Yiliao Song, Zhenqiao Yuan, Shuhai Zhang 等OpenReview
- 抵御通用对抗扰动的民主化训练Bing Sun, Jun Sun, Wei ZhaoOpenReview
- DiffusionGuard:防御扩散模型恶意图像编辑的鲁棒方案June Suk Choi, Kyungmin Lee, Jongheon Jeong 等OpenReview
- 动态神经堡垒:防御模型抽取的自适应护盾Siyu Luan, Zhenyi Wang, Li Shen 等OpenReview
- 赋予视觉重编程对抗鲁棒性Shengjie Zhou, Xin Cheng, Haiyang Xu 等OpenReview
- 从文生图扩散模型中消除概念组合hongyi nie, Quanming Yao, Yang Liu 等OpenReview
- ETA:多模态大模型推理阶段的安全性评估与对齐Yi Ding, Bolian Li, Ruqi ZhangOpenReview
- 探究对抗训练中的遗忘:一种增强鲁棒性的新方法Xianglu Wang, Hu DingOpenReview
- 奇妙的版权角色及如何(不)生成它们Luxi He, Yangsibo Huang, Weijia Shi 等OpenReview
- 扩散模型概念消除的最优目标选择与自适应引导
- 利用生长抑制剂抑制扩散模型中的不当图像概念Die Chen, Zhiwen Li, Mingyuan Fan 等OpenReview
- HarmAug:用于安全护栏模型知识蒸馏的有效数据增强
- 视觉-语言适配如何影响视觉语言模型的安全性?Seongyun Lee, Geewook Kim, Jiyeon Kim 等OpenReview
- 用于对抗鲁棒蒸馏的间接梯度匹配Hongsin Lee, Seungju Cho, Changick KimOpenReview
- 多模态语言模型对安全查询是否过度敏感?Xirui Li, Hengguang Zhou, Ruochen Wang 等OpenReview
- Jailbreak Antidote:通过稀疏表征调整平衡大模型安全与实用性Guobin Shen, Dongcheng Zhao, Yiting Dong 等OpenReview
- 大语言模型能够成为强大的自我去毒者Ching-Yun Ko, Pin-Yu Chen, Payel Das 等OpenReview
- 基于自蒸馏的长尾对抗训练Seungju Cho, Hongsin Lee, Changick KimOpenReview
- 作为 DPO 稳健去噪变体的模型编辑:毒性消除案例研究Rheeya Uppaal, Apratim Dey, Yiting He 等OpenReview
- 用于可靠内容审查的大语言模型护栏模型置信度校准研究Hongfu Liu, Hengguan Huang, Xiangming Gu 等OpenReview
- 论大语言模型的持续机器遗忘Chongyang Gao, Lixu Wang, Kaize Ding 等OpenReview
- Wasserstein 分布鲁棒优化中可证明的鲁棒过拟合缓解Shuang Liu, Yihan Wang, Yifan Zhu 等OpenReview
- 可证明保护分类器免受OOD和对抗样本影响的方法Nicolas Atienza, Johanne Cohen, Christophe Labreuche 等OpenReview
- 重新审视对抗训练中的不变性正则以改善鲁棒性与精度权衡Futa Kai Waseda, Ching-Chun Chang, Isao EchizenOpenReview
- 基于拒答特征对抗训练的鲁棒大语言模型防护
- RobustKV:通过KV驱逐防御大语言模型越狱攻击
- SafeWatch:具透明解释的高效安全策略遵循视频护栏模型Zhaorun Chen, Francesco Pinto, Minzhou Pan 等OpenReview
- SAFREE:用于安全文本到图像和视频生成的免训练自适应护栏Jaehong Yoon, Shoubin Yu, Vaidehi Patil 等OpenReview
- SaLoRA:保持安全对齐的低秩适配Mingjie Li, Wai Man Si, Michael Backes 等OpenReview
- 分数遗忘蒸馏:扩散模型中快速无数据的机器遗忘方法
- 语义损失引导的高数据效率大模型安全响应监督微调
- LLM 的领域认证:限制越域输出Cornelius Emde, Alasdair Paren, Preetham Arvind 等OpenReview
- SORRY-Bench:系统评测大语言模型的安全拒答
- 精准、低成本且灵活:通过单向量消融缓解语言模型的错误拒答Xinpeng Wang, Chengzhi Hu, Paul Röttger 等OpenReview
- 应对对抗可迁移性:一种基于傅里叶变换的集成训练新方法Wanlin Zhang, Weichen Lin, Ruomin Huang 等OpenReview
- 对抗攻击下不确定性校准的可验证性研究Cornelius Emde, Francesco Pinto, Thomas Lukasiewicz 等OpenReview
- UniDetox:基于数据集蒸馏的大语言模型通用去毒化Huimin LU, Masaru Isonuma, Junichiro Mori 等OpenReview
- 用稀疏多项式优化验证二值神经网络的性质
- 对抗鲁棒性评估的零成本代理
对齐
32- 大语言模型机器遗忘与对齐的概率视角
- MAP:多人类价值观对齐调色盘
- 更多RLHF带来更多信任?论偏好对齐对可信度的影响
- 双因子偏好优化:平衡语言模型的安全性与有益性
- 弱监督下迭代标签精炼比偏好优化更重要
- 揭示人类与大语言模型对主观语言理解的差距
- 弱到强偏好优化:从弱对齐模型中提取奖励
- 基于边距的语言模型对齐的常见陷阱:梯度纠缠Hui Yuan, Yifan Zeng, Yue Wu 等OpenReview
- 弱到强泛化的迁移学习框架Seamus Somerstep, Felipe Maia Polo, Moulinath Banerjee 等OpenReview
- 从文本分类到文本生成的贝叶斯弱到强学习Ziyun Cui, Ziyang Zhang, Guangzhi Sun 等OpenReview
- 基于因果机制的大语言模型谄媚行为缓解方法
- Collab:基于智能体混合受控解码的大语言模型对齐Souradip Chakraborty, Sujay Bhatt, Udari Madhushani Sehwag 等OpenReview
- 可控安全对齐:推理时适应多样化安全需求Jingyu Zhang, Ahmed Elgohary, Ahmed Magooda 等OpenReview
- CREAM:一致性正则化的自奖励语言模型Zhaoyang Wang, Weilei He, Zhiyuan Liang 等OpenReview
- GenARM:基于自回归奖励模型的测试时奖励引导对齐Yuancheng Xu, Udari Madhushani Sehwag, Alec Koppel 等OpenReview
- 视觉语言模型失去了自信吗?VLM 谄媚现象研究Shuo Li, Tao Ji, Xiaoran Fan 等OpenReview
- 逆向宪法式AI:将人类偏好压缩为行为准则Arduin Findeis, Timo Kaufmann, Eyke Hüllermeier 等OpenReview
- 语言模型通过RLHF学会误导人类Jiaxin Wen, Ruiqi Zhong, Akbir Khan 等OpenReview
- 学习参考模型以实现真正良好的对齐Alexey Gorbatovski, Boris Shaposhnikov, Alexey Malakhov 等OpenReview
- MACPO:基于多智能体对比偏好优化的弱到强对齐Yougang Lyu, Lingyong Yan, Zihan Wang 等OpenReview
- 磁偏好优化:实现语言模型对齐的最后迭代收敛Mingzhi Wang, Chengdong Ma, Qizhi Chen 等OpenReview
- LLM 智能体的道德对齐Elizaveta Tennant, Stephen Hailes, Mirco MusolesiOpenReview
- 神经交互式证明:受限验证者监督不可信智能体Lewis Hammond, Sam Adam-DayOpenReview
- 论模仿学习与RLHF之间的联系Teng Xiao, Yige Yuan, Mingxiao Li 等OpenReview
- PAL:面向多元对齐的样本高效个性化奖励建模Daiwei Chen, Yi Chen, Aniket Rege 等OpenReview
- RMB:大语言模型对齐中奖励模型的综合基准评测Enyu Zhou, Guodong Zheng, Binghai Wang 等OpenReview
- 强偏好影响偏好模型与价值对齐的鲁棒性Ziwei Xu, Mohan KankanhalliOpenReview
- 形式重于实质:对齐基准测试中LLM裁判的失效模式
- 采样器在在线直接偏好优化中的关键作用Ruizhe Shi, Runlong Zhou, Simon Shaolei DuOpenReview
- TIS-DPO:基于权重估计的词元级重要性采样直接偏好优化Aiwei Liu, Haoping Bai, Zhiyun Lu 等OpenReview
- 无意的失对齐:DPO 中的似然位移
- 弱大语言模型亦可作为强大的对齐教师Leitian Tao, Yixuan LiOpenReview
- 谈谈你自己:大语言模型能意识到自身习得的行为
- AI装弱:语言模型能在评测中策略性隐瞒真实能力Teun van der Weij, Felix Hofstätter, Oliver Jaffe 等OpenReview
- 优化用户反馈时大语言模型的针对性操纵与欺骗Marcus Williams, Micah Carroll, Adhyyan Narang 等OpenReview
- 表面超级对齐:弱到强泛化中强模型可能欺骗弱模型Wenkai Yang, Shiqi Shen, Guangyao Shen 等OpenReview
奖励作弊
4可解释性
8- 我了解这个实体吗?语言模型中的知识感知与幻觉机制
- 注意力头在大型语言模型安全中的作用机制研究
- 通过传输激活来控制语言模型与扩散模型
- 用命题探针监控语言模型中的潜在世界状态
- 利用条件激活干预实现可编程拒答
- Llama3-8b-Instruct 自生成文本识别能力的机制探查与干预控制
- 对齐大语言模型中的安全层:大模型安全的关键Shen Li, Liuyi Yao, Lan Zhang 等OpenReview
- 通过安全特异性神经元理解与增强大模型安全机制Yiran Zhao, Wenxuan Zhang, Yuxi Xie 等OpenReview
- 不可信大语言模型的自适应部署降低分散威胁Jiaxin Wen, Vivek Hebbar, Caleb Larson 等OpenReview
后门与投毒
28- 基于能量的联邦图学习后门防御
- 基于鲁棒性的图神经网络后门防御
- 图神经网络抵御标签投毒的精确鲁棒性认证
- Poison-splat:针对3D高斯泼溅的计算开销投毒攻击
- 面对数据投毒时具备可证明可靠性的共形预测集
- 利用目标攻击提升防范未授权扩散模型定制的保护效果
- 基于激活梯度的后门攻击投毒样本检测Danni Yuan, Mingda Zhang, Shaokui Wei 等OpenReview
- 针对标签投毒攻击的对抗训练防御
- 利用分布外数据对视觉语言模型植入后门
- Bad-PFL:针对个性化联邦学习的后门攻击Mingyuan Fan, Zhanyi Hu, Fuyi Wang 等OpenReview
- BadJudge:LLM裁判机制中的后门脆弱性Terry Tong, Fei Wang, Zhe Zhao 等OpenReview
- 我们能信任具身智能体吗?探索基于LLM的决策系统后门攻击Ruochen Jiao, Shaoyuan Xie, Justin Yue 等OpenReview
- 基于模糊随机平滑的语言模型鲁棒性认证:一种抵御后门攻击的高效防御Bowei He, Lihao Yin, Huiling Zhen 等OpenReview
- Concept-ROT:利用模型编辑在大语言模型中投毒概念Keltin Grimes, Marco Christiani, David Shriver 等OpenReview
- 在对比式语言-图像预训练中检测后门样本Hanxun Huang, Sarah Monazam Erfani, Yige Li 等OpenReview
- 大语言模型联邦指令微调中的新兴安全攻击与防御Rui Ye, Jingyi Chai, Xiangrui Liu 等OpenReview
- 我们离真正的不可学习样本还有多远?Kai Ye, Liangcai Su, Chenxiong QianOpenReview
- 数分钟内向大语言模型植入通用越狱后门
- 机器遗忘无法有效清除数据投毒攻击Martin Pawelczyk, Jimmy Z. Di, Yiwei Lu 等OpenReview
- 通过因果推断实现“心智控制”:从投毒数据预测干净图像Mengxuan Hu, Zihan Guan, Yi Zeng 等OpenReview
- 通过安全感知子空间缓解多任务模型合并中的后门效应Jinluan Yang, Anke Tang, Didi Zhu 等OpenReview
- 离线强化学习中抵御投毒攻击的多级可证明防御Shijie Liu, Andrew Craig Cullen, Paul Montague 等OpenReview
- 测试时适应的对抗风险:现实测试时数据投毒研究
- 大语言模型的持久化预训练投毒研究
- 先探测再说话:面向 LLM 后门失对齐的黑盒防御Biao Yi, Tiansheng Huang, Sishuo Chen 等OpenReview
- 抵御多重并发数据投毒攻击的后门防御方法
- REFINE:基于模型重编程的免触发器反演后门防御Yukun Chen, Shuo Shao, Enhao Huang 等OpenReview
- 针对有效干净标签后门攻击的选择性投毒策略Nguyen Hung-Quang, Ngoc-Hieu Nguyen, The-Anh Ta 等OpenReview
隐私与数据泄露
51- 基于自适应模型融合的版权保护语言生成
- 我的数据被用了多少?机器学习中的定量数据使用推断
- 通过明亮末端注意力探索扩散模型中的局部记忆
- 基于核密度的 shuffled 差分隐私终端用户数据学习
- 缓解语言模型中的训练数据记忆现象
- ScaleGUN:可扩展且可证明的图遗忘学习
- 大语言模型输出语义敏感信息的基准评测Qingjie Zhang, Han Qiu, Di Wang 等OpenReview
- 深入探究大语言模型的机器遗忘Xiaojian Yuan, Tianyu Pang, Chao Du 等OpenReview
- 对抗性机器遗忘学习Zonglin Di, Sixie Yu, Yevgeniy Vorobeychik 等OpenReview
- 对抗性Mixup机器遗忘
- 基于虚构面部身份数据集的视觉语言模型遗忘学习基准Yingzi Ma, Jiongxiao Wang, Fei Wang 等OpenReview
- 量化导致大语言模型机器遗忘的灾难性失效
- ConcreTizer:面向3D点云重建的模型反演攻击Youngseok Kim, Sunwook Hwang, Hyung-Sin Kim 等OpenReview
- 基于ε约束优化的图像到图像生成模型可控遗忘学习XiaoHua Feng, Yuyuan Li, Chaochao Chen 等OpenReview
- CPSample:扩散生成中保护训练数据的分类器保护采样
- 扩散模型中的数据遗忘学习
- 上下文学习中基于数据自适应差分隐私的提示合成Fengyu Gao, Ruida Zhou, Tianhao Wang 等OpenReview
- 面向大语言模型对齐的差分隐私激活干预方法Anmol Goel, Yaxi Hu, Iryna Gurevych 等OpenReview
- DiSK:基于简化卡尔曼滤波降噪的差分隐私优化器Xinwei Zhang, Zhiqi Bu, Borja Balle 等OpenReview
- DocMIA:针对 DocVQA 模型的文档级成员推断攻击Khanh Nguyen, Raouf Kerkouche, Mario Fritz 等OpenReview
- 使用合成数据训练真的能保护隐私吗?Yunpeng Zhao, Jie ZhangOpenReview
- 对加密友好的 LLM 架构Donghwan Rho, Taeseong Kim, Minje Park 等OpenReview
- 听我指令全盘托出:检索增强生成系统的可扩展数据提取Zhenting Qi, Hanlin Zhang, Eric P. Xing 等OpenReview
- GRAIN:基于梯度的图数据精确重构攻击Maria Drencheva, Ivo Petrov, Maximilian Baader 等OpenReview
- 无需Hessian矩阵的在线可证明遗忘学习Xinbao Qiao, Meng Zhang, Ming Tang 等OpenReview
- 基于反演推理扰动的图像级模型记忆检测Yue Jiang, Haokun Lin, Yang Bai 等OpenReview
- Infilling Score:大语言模型预训练数据检测算法Negin Raoof, Litu Rout, Giannis Daras 等OpenReview
- 大语言模型作为高级文本匿名化工具Robin Staab, Mark Vero, Mislav Balunovic 等OpenReview
- LaW:面向大语言模型的大规模知识清洗方法
- 仅基于遗忘数据损失调整的大语言模型遗忘学习Yaxuan Wang, Jiaheng Wei, Chris Yuhao Liu 等OpenReview
- 通过模拟Oracle匹配的机器遗忘
- 代码补全RLHF中的记忆效应度量Jamie Hayes, Ilia Shumailov, William P. Porter 等OpenReview
- 大语言模型非对抗性复现训练数据的度量研究Michael Aerni, Javier Rando, Edoardo Debenedetti 等OpenReview
- MUSE:大语言模型机器遗忘的六维评估基准
- 矩阵机制在 ℓ_p^p 度量下的最优性
- 大语言模型的隐私审计Ashwinee Panda, Xinyu Tang, Christopher A. Choquette-Choo 等OpenReview
- 大语言模型的主动隐私遗忘机制:在极低效用损失下保护PIIMartin Kuo, Jingyang Zhang, Jianyi Zhang 等OpenReview
- 从梯度视角反思大语言模型遗忘学习目标Qizhou Wang, Jin Peng Zhou, Zhanke Zhou 等OpenReview
- 从已对齐的商用语言模型中大规模提取训练数据Milad Nasr, Javier Rando, Nicholas Carlini 等OpenReview
- 基于域对抗训练表示消除的选择性机器遗忘Nazanin Mohammadi Sepahvand, Eleni Triantafillou, Hugo Larochelle 等OpenReview
- 隐蔽之盾防御:基于条件互信息抵御黑盒模型逆向攻击Tianqu Zhuang, Hongyao Yu, Yixiang Qiu 等OpenReview
- TDDBench:训练数据检测基准
- 最后一轮迭代的优势:差分隐私SGD的经验审计与启发式分析Milad Nasr, Thomas Steinke, Borja Balle 等OpenReview
- 分布内与分布外机器遗忘的效用与复杂度Youssef Allouah, Joshua Kazdan, Rachid Guerraoui 等OpenReview
- 隐藏状态威胁模型下DP-SGD更紧致的隐私审计Tudor Ioan Cebere, Aurélien Bellet, Nicolas PapernotOpenReview
- 面向大语言模型遗忘学习方法的有效评估与比较
- 面向大语言模型的高效鲁棒知识遗忘方法Sungmin Cha, Sungjun Cho, Dasol Hwang 等OpenReview
- 基于参数高效微调的可扩展确切机器遗忘Somnath Basu Roy Chowdhury, Krzysztof Marcin Choromanski, Arijit Sehanobish 等OpenReview
- 面向大语言模型的统一参数高效遗忘学习
- 遗忘并毁灭:对抗性机器遗忘请求破坏模型准确率Yangsibo Huang, Daogao Liu, Lynn Chua 等OpenReview
- Ward:基于大模型水印的可证明RAG数据集推断Nikola Jovanović, Robin Staab, Maximilian Baader 等OpenReview
- Booster:通过衰减有害扰动抵御大模型有害微调攻击
- 安全如我:缓解大语言模型特定任务微调中的安全风险Francisco Eiras, Aleksandar Petrov, Philip Torr 等OpenReview
- 关于开源权重前沿模型安全护栏持久性评估的探讨Xiangyu Qi, Boyi Wei, Nicholas Carlini 等OpenReview
- SEAL:基于双层数据选择的安全增强对齐大模型微调Han Shen, Pin-Yu Chen, Payel Das 等OpenReview
- 开源大语言模型的防篡改安全护栏Rishub Tamirisa, Bhrugu Bharathi, Long Phan 等OpenReview
- 遗忘还是混淆?通过良性重学习唤醒已遗忘大语言模型的记忆Shengyuan Hu, Yiwei Fu, Steven Wu 等OpenReview