顶会安全论文
共 209 篇
越狱与攻击
44- Mousetrap:通过迭代混沌链越狱大型推理模型
- 对抗性分词Renato Geh, Zilei Shao, Guy Van Den BroeckACL Anthology
- 效率之下的暗礁:小语言模型中越狱攻击的隐藏威胁
- 突破上限:通过扩展策略空间探索越狱攻击潜力
- 大语言模型水印能否可靠防止未经授权的知识蒸馏?Leyi Pan, Aiwei Liu, Shiyu Huang 等ACL Anthology
- LLM 能欺骗 CLIP 吗?以文本更新评测多模态组合漏洞Jaewoo Ahn, Heeseung Yun, Dayoon Ko 等ACL Anthology
- CAVGAN:通过内部表征生成对抗攻击统一越狱与防御
- Chain of Attack:通过多轮审讯隐藏意图的越狱攻击
- Chain-of-Jailbreak:通过逐步编辑攻击图像生成模型
- Con Instruction:通过非文本模态通用越狱多模态大模型Jiahui Geng, Thy Thy Tran, Preslav Nakov 等ACL Anthology
- Crabs:黑盒场景下自动生成提示的 LLM-DoS 资源消耗攻击
- 思维链推理真的能降低越狱危害吗?
- Don't Say No:通过抑制拒答来越狱 LLM
- 评估大模型被滥用于生成个性化虚假信息的漏洞Aneta Zugecova, Dominik Macko, Ivan Srba 等ACL Anthology
- 通过意图隐藏与转移探索 LLM 越狱攻击
- 从无害到有害:通过对抗隐喻越狱语言模型Yu Yan, Sheng Sun, Zenghao Duan 等ACL Anthology
- GOODLIAR:基于强化学习的欺骗性 Agent,用于扰乱 LLM 对基础原则的信念
- 引导而非强迫:移除多余约束提升越狱攻击迁移性Junxiao Yang, Zhexin Zhang, Shiyao Cui 等ACL Anthology
- 通过多模态联动越狱大型视觉语言模型Yu Wang, Xiaofei Zhou, Yichen Wang 等ACL Anthology
- 越狱?一步就够了!Weixiong Zheng, Peijian Zeng, YiWei Li 等ACL Anthology
- JailbreakRadar:大语言模型越狱攻击综合评估Junjie Chu, Yugeng Liu, Ziqing Yang 等ACL Anthology
- 大模型知晓自身弱点:通过自然分布偏移揭示安全漏洞Qibing Ren, Hao Li, Dongrui Liu 等ACL Anthology
- M2S:将多轮越狱转化为单轮攻击Junwoo Ha, Hyunjun Kim, Sangyoon Yu 等ACL Anthology
- 少量查询下针对黑盒模型的多任务对抗攻击Wenqiang Wang, Yan Xiao, Hao Lin 等ACL Anthology
- 面向文生图模型的多模态语用越狱Tong Liu, Zhixin Lai, Jiawen Wang 等ACL Anthology
- MVTamperBench:评测视觉语言模型对视频篡改的鲁棒性
- QueryAttack:用结构化非自然查询语言越狱对齐模型
- 利用对抗反馈开展实时事实性评估Sanxing Chen, Yukun Huang, Bhuwan DhingraACL Anthology
- Red Queen:揭示大语言模型中潜在的多轮风险
- Rewrite to Jailbreak:发现可学习且可迁移的隐式有害指令
- SATA:通过简单辅助任务链接实现 LLM 越狱的新范式
- SemanticCamo:通过语义伪装越狱大语言模型
- 披着羊皮的狼:大语言模型能识别隐喻式隐性仇恨吗?Jingjie Zeng, Liang Yang, Zekun Wang 等ACL Anthology
- SQL注入式越狱:大语言模型的结构性安全缺陷
- 大语言模型的逐步推理扰乱攻击Jingyu Peng, Maolin Wang, Xiangyu Zhao 等ACL Anthology
- 机器生成文本检测的压力测试:转变语言模型写作风格以欺骗检测器
- 沉默的破坏者:针对黑盒 RAG 系统的不可察觉对抗攻击
- 结构化安全泛化问题
- 冰山之尖:揭示大语言模型的提示内任务对抗攻击Sergey Berezin, Reza Farahbakhsh, Noel CrespiACL Anthology
- 理解大语言模型面对社会偏见攻击的脆弱性Jiaxu Zhao, Meng Fang, Fanghua Ye 等ACL Anthology
- VLMInferSlow:视觉语言模型服务的效率鲁棒性评测Xiasi Wang, Tianliang Yao, Simin Chen 等ACL Anthology
- 大语言模型面对纵向排列文本操纵的脆弱性Zhecheng Li, Yiwei Wang, Bryan Hooi 等ACL Anthology
- 多示例攻击中什么最重要?大模型长上下文漏洞实证研究Sangyeop Kim, Yohan Lee, Yongwoo Song 等ACL Anthology
- 谁能抵御聊天音频攻击?大型音频语言模型评测基准
提示注入
7- 间接提示注入攻击能被检测并移除吗?Yulin Chen, Haoran Li, Yuan Sui 等ACL Anthology
- 利用攻击技术防御提示注入Yulin Chen, Haoran Li, Zihao Zheng 等ACL Anthology
- 高效但脆弱:LLM 批量提示攻击的评测与防御
- 通过语义引导的提示组织实现高效通用目标劫持Yihao Huang, Chong Wang, Xiaojun Jia 等ACL Anthology
- PIGuard:缓解过度防御的提示注入护栏Hao Li, Xiaogeng Liu, Ning Zhang 等ACL Anthology
- Task Shield:以任务对齐防御智能体间接提示注入Feiran Jia, Tong Wu, Xin Qin 等ACL Anthology
- 大语言模型中的提示威胁:系统提示与用户提示视角
- 一个捣乱者如何通过传染性越狱扰乱智能体社会Tianyi Men, Pengfei Cao, Zhuoran Jin 等ACL Anthology
- 围攻智能体:优化提示攻击突破多智能体系统Rana Shahroz, Zhen Tan, Sukwon Yun 等ACL Anthology
- AGrail:具备高效自适应安全检测的终身智能体护栏Weidi Luo, Shenghong Dai, Xiaogeng Liu 等ACL Anthology
- 通过因果影响提示增强 LLM Agent 安全
- G-Safeguard:拓扑引导的多智能体安全检测与干预Shilong Wang, Guibin Zhang, Miao Yu 等ACL Anthology
- NetSafe:探索多智能体系统的拓扑安全性
- 通过通信攻击对大模型多智能体系统开展红队测试
防御与护栏
58- 大语言模型虚假信息的主动防御策略综述
- 自适应解毒:基于毒性感知知识编辑保护 LLM 通用能力
- 面向鲁棒 LLM 对齐的对抗偏好学习
- AGD:基于对抗博弈的大语言模型越狱防御Shilong Pan, Zhiliang Tian, Zhen Huang 等ACL Anthology
- AIGuard:电商 AIGC 风险检测基准与轻量检测方法
- 当心你的 Po!评估与缓解角色扮演微调的安全风险Weixiang Zhao, Yulin Hu, Yang Deng 等ACL Anthology
- 超越表层模式:基于攻击本质的越狱防御框架
- 基于 Growth Bound Matrix 兼顾鲁棒性与泛化以抵御词替换攻击
- Chinese SafetyQA:中文安全知识短答事实性基准Yingshui Tan, Boren Zheng, Baihui Zheng 等ACL Anthology
- 用于可控生成的对比困惑度:大语言模型去毒应用Tassilo Klein, Moin NabiACL Anthology
- COVER:LLM 中上下文驱动的过度拒答验证
- 防御提示补丁:稳健且可泛化的大模型越狱防御
- 让机器去拟人化:缓解文本生成系统的拟人行为Myra Cheng, Su Lin Blodgett, Alicia DeVrio 等ACL Anthology
- DELMAN:用模型编辑动态防御 LLM 越狱
- DeTAM:通过定向注意力修改防御 LLM 越狱
- DIESEL:轻量级的语言模型推理时安全增强
- DiffuseDef:通过迭代去噪增强对抗攻击鲁棒性Zhenhao Li, Huichi Zhou, Marek Rei 等ACL Anthology
- 高效识别混合来源文本中的水印片段Xuandong Zhao, Chenwen Liao, Yu-Xiang Wang 等ACL Anthology
- 通过知识偏好优化增强蛋白质生成的安全可控性Yuhao Wang, Keyan Ding, Kehua Feng 等ACL Anthology
- 大语言模型的集成水印Georg Niess, Roman KernACL Anthology
- 遗忘 Token 与像素:重新思考多模态生成模型概念遗忘中的梯度上升
- 从规避到隐匿:面向 LLM 的隐蔽知识遗忘
- 从权衡到协同:大语言模型的通用共生水印框架Yidan Wang, Yubing Ren, Yanan Cao 等ACL Anthology
- HiddenDetect:监控隐藏状态检测多模态模型越狱Yilei Jiang, Xinyan Gao, Tianshuo Peng 等ACL Anthology
- 分层安全再对齐:轻量恢复剪枝视觉语言模型的安全性
- HumT DumT:测量与控制大语言模型的拟人语言Myra Cheng, Sunny Yu, Dan JurafskyACL Anthology
- 定位安全关键奇异向量,改进大语言模型安全训练Peijian Gu, Quan Wang, Zhendong MaoACL Anthology
- 改进大语言模型的无偏水印Ruibo Chen, Yihan Wu, Junfeng Guo 等ACL Anthology
- 以攻促防:通过对抗训练保护机器生成文本检测器Yuanfan Li, Zhaohan Zhang, Chengzhengxu Li 等ACL Anthology
- K/DA:韩语隐性冒犯语言去毒的自动数据生成流程Minkyeong Jeon, Hyemin Jeong, Yerang Kim 等ACL Anthology
- 学习改写:可泛化的大语言模型生成文本检测Wei Hao, Ran Li, Weiliang Zhao 等ACL Anthology
- LED-Merging:缓解模型合并中的安全与效用冲突Qianli Ma, Dongrui Liu, Qian Chen 等ACL Anthology
- MIND:零样本有害模因检测的多智能体框架Ziyan Liu, Chunxiao Fan, Haoran Lou 等ACL Anthology
- MTSA:通过多轮红队实现大语言模型多轮安全对齐Weiyang Guo, Jing Li, Wenya Wang 等ACL Anthology
- 利用大语言模型重排序减少社交平台有害内容暴露Rajvardhan Oak, Muhammad Haroon, Claire Wonjeong Jo 等ACL Anthology
- 感到不安全就拒答:通过解耦拒答训练提升大模型安全性Youliang Yuan, Wenxiang Jiao, Wenxuan Wang 等ACL Anthology
- 可靠约束误报率:多尺度共形预测的零样本文本检测Xiaowei Zhu, Yubing Ren, Yanan Cao 等ACL Anthology
- 通过表征弯折提升大语言模型安全性Ashkan Yousefpour, Taeheon Kim, Ryan S. Kwon 等ACL Anthology
- 面向 EaaS 的鲁棒且低侵入的水印方法
- 根源防御策略:在解码层面保障大语言模型安全Xinyi Zeng, Yuying Shang, Jiawei Chen 等ACL Anthology
- SafeChain:长思维链推理语言模型的安全性
- SafeEraser:通过多模态机器遗忘增强 MLLM 安全
- SafeRoute:为高效且准确的 LLM 安全护栏自适应选择模型
- 通过受约束知识遗忘实现安全对齐Zesheng Shi, Yucheng Zhou, Jing Li 等ACL Anthology
- 安全不止于拒答:面向可解释 LLM 安全的推理增强微调
- 风暴中的沙堡:重新审视强水印的可能性Fabrice Y Harel-Canada, Boran Erol, Connor Choi 等ACL Anthology
- 塑造安全边界:理解并防御大语言模型越狱Lang Gao, Jiahui Geng, Xiangliang Zhang 等ACL Anthology
- ShieldHead:面向大语言模型的解码时安全防护
- SINCon:缓解谣言检测中的模型生成恶意消息注入Mingqing Zhang, Qiang Liu, Xiang Tao 等ACL Anthology
- 黑暗的崛起:角色扮演对话 Agent 中的安全与效用权衡
- ThinkGuard:深思慢想带来更审慎的护栏
- 迈向 LLM 安全推理:用多智能体协商生成嵌入策略的思维链数据
- 揭示并缓解视觉语言模型的安全对齐退化
- VSCBench:弥合视觉语言模型安全校准的差距
- 大语言模型水印:一种无偏且低风险的方法Minjia Mao, Dongjun Wei, Zeyu Chen 等ACL Anthology
- WET:用线性变换水印抵御嵌入服务中的改写攻击Anudeex Shetty, Qiongkai Xu, Jey Han LauACL Anthology
- 通过自感知护栏增强释放大语言模型的安全潜力
- XDAC:可解释AI驱动的韩语模型生成新闻评论检测与归因Wooyoung Go, Hyoungshick Kim, Alice Oh 等ACL Anthology
对齐
24- 大语言模型多国价值观对齐基准
- 超越被动安全:通过长期模拟实现风险感知对齐
- 结合领域与对齐向量,改善大模型的知识与安全权衡Megh Thakkar, Quentin Fournier, Matthew Riemer 等ACL Anthology
- DeAL:大语言模型的解码时对齐James Y. Huang, Sailik Sengupta, Daniele Bonadiman 等ACL Anthology
- 通过偏好重排序与表征奖励建模实现高效安全对齐Deng Qiyuan, Xuefeng Bai, Kehai Chen 等ACL Anthology
- 探究指令微调对大语言模型错误信息易感性的影响Kyubeen Han, Junseo Jang, Hongjin Kim 等ACL Anthology
- 以生成式心理词汇方法构建大语言模型价值体系Haoran Ye, TianZe Zhang, Yuhang Xie 等ACL Anthology
- 如何缓解弱到强泛化中的过拟合?Junhao Shi, Qinyuan Cheng, Zhaoye Fei 等ACL Anthology
- 混合偏好:学习将样本分配给人类或AI反馈Lester James Validad Miranda, Yizhong Wang, Yanai Elazar 等ACL Anthology
- 语言模型抵抗对齐:来自数据压缩的证据Jiaming Ji, Kaile Wang, Tianyi Alex Qiu 等ACL Anthology
- LSSF:通过低秩安全子空间融合实现大模型安全对齐Guanghao Zhou, Panjia Qiu, Cen Chen 等ACL Anthology
- M-RewardBench:多语言场景下的奖励模型评测Srishti Gureja, Lester James V. Miranda, Shayekh Bin Islam 等ACL Anthology
- MoTE:推理链与专家混合协同实现自对齐Zhili Liu, Yunhao Gou, Kai Chen 等ACL Anthology
- MPO:通过奖励差距优化实现多语言安全对齐Weixiang Zhao, Yulin Hu, Yang Deng 等ACL Anthology
- PKU-SafeRLHF:基于人类偏好的多级安全对齐Jiaming Ji, Donghai Hong, Borong Zhang 等ACL Anthology
- PopAlign:通过多样化对比模式实现更全面的对齐Zekun Moore Wang, Shenzhi Wang, King Zhu 等ACL Anthology
- 通过动态目标间隔实现稳健偏好优化
- SafeLawBench:从法律视角评测 LLM 安全对齐
- SEA:借助合成嵌入实现多模态大模型低资源安全对齐Weikai Lu, Hao Peng, Huiping Zhuang 等ACL Anthology
- 去芜存菁:微调语言模型的事后安全再对齐
- 改进大语言模型对齐的价值原则:系统评估与增强Bingbing Xu, Jing Yao, Xiaoyuan Yi 等ACL Anthology
- 通过影响函数理解人类反馈的作用Taywon Min, Haeone Lee, Yongchan Kwon 等ACL Anthology
- 价值观对齐大模型的意外危害:心理学与实证洞见Sooyung Choi, Jaehyeok Lee, Xiaoyuan Yi 等ACL Anthology
- 没有正确选项时:大语言模型的选择题鲁棒性Gracjan Góral, Emilia Wiśnios, Piotr Sankowski 等ACL Anthology
- 语言模型无需说谎也能欺骗:立法中的策略性措辞研究Atharvan Dogra, Krishna Pillutla, Ameet Deshpande 等ACL Anthology
奖励作弊
2可解释性
7- 超越提示工程:通过目标原子引导稳健控制大模型行为Mengru Wang, Ziwen Xu, Shengyu Mao 等ACL Anthology
- COSMIC:LLM 激活中的通用拒答方向识别
- DAPI:领域自适应毒性探针向量干预实现细粒度解毒
- LLMBraces:通过相关子更新调整大语言模型预测Ying Shen, Lifu HuangACL Anthology
- 通过定向干预实现语言模型的多属性引导Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin 等ACL Anthology
- 小改动,大影响:少量神经元操控如何改变大模型攻击性Jaewook Lee, Junseo Jang, Oh-Woog Kwon 等ACL Anthology
- 防护为何失效?对齐模型的安全机制倾向锚定模板区域Chak Tou Leong, Qingyu Yin, Jian Wang 等ACL Anthology
后门与投毒
13- BadWindtunnel:用置信度方差在高噪声模拟训练中防御后门
- 审查链:检测大语言模型的后门攻击
- 基于近似贪婪梯度下降的语料库投毒
- ELBA-Bench:大语言模型高效学习后门攻击基准Xuxu Liu, Siyuan Liang, Mengya Han 等ACL Anthology
- MEGen:通过模型编辑向 LLM 植入生成式后门
- MEraser:大语言模型的高效指纹擦除方法Jingxuan Zhang, Zhenhua Xu, Rui Hu 等ACL Anthology
- 合并劫持:针对大语言模型合并的后门攻击Zenghui Yuan, Yangming Xu, Jiawen Shi 等ACL Anthology
- 用 GMTP 保护 RAG 流水线:基于梯度的掩码 token 概率检测投毒文档
- 多模态大语言模型的阴影激活后门攻击
- TUBA:指令微调下 LLM 后门攻击的跨语言迁移
- TWIST:编辑文本编码器权重植入文生图木马Xindi Li, Zhe Liu, Tong Zhang 等ACL Anthology
- 基于弱到强知识蒸馏的 LLM 后门遗忘
- 当后门开口:通过模型生成的解释理解大模型后门攻击Huaizhi Ge, Yiming Li, Qifan Wang 等ACL Anthology
隐私与数据泄露
23- LoRD:以局部性强化蒸馏引导语言模型提取Zi Liang, Qingqing Ye, Yanyun Wang 等ACL Anthology
- 增强基于微调的 LLM 遗忘学习的通用框架
- 从统计与多视角重新审视大语言模型成员推断攻击Bowen Chen, Namgi Han, Yusuke MiyaoACL Anthology
- 合并陌生 LLM 需谨慎:可窃取隐私的钓鱼模型
- CLEAR:文本与视觉模态下的角色遗忘基准
- 解耦记忆、静音神经元:面向 LLM 的实用机器遗忘
- DPGA-TextSyn:用于合成文本生成的差分隐私遗传算法
- DYNTEXT:面向隐私保护 LLM 推理的语义感知动态文本脱敏
- 估计语言模型中补充上下文知识的隐私泄露James Flemings, Bo Jiang, Wanrong Zhang 等ACL Anthology
- 利用低排名词元揭示大语言模型的隐私泄漏Yuan Zhou, Zhuo Zhang, Xiangyu ZhangACL Anthology
- MMUnlearner:重新定义多模态大模型的机器遗忘
- 通过模态感知神经元剪枝实现多模态大模型遗忘Zheyuan Liu, Guangyao Dou, Xiangchi Yuan 等ACL Anthology
- Opt-Out:基于最优传输的大语言模型实体级遗忘Minseok Choi, Daniel Rim, Dohyun Lee 等ACL Anthology
- PIG:基于梯度迭代上下文优化的隐私越狱攻击Yidan Wang, Yanan Cao, Yubing Ren 等ACL Anthology
- PrivaCI-Bench:情境完整性与法律合规隐私评测Haoran Li, Wenbin Hu, Huihao Jing 等ACL Anthology
- 隐私记忆编辑:将模型记忆转化为数据隐私防御Elena Sofia Ruzzetti, Giancarlo A. Xompero, Davide Venditti 等ACL Anthology
- R.R.:通过回忆与排序揭示 LLM 训练隐私
- RecordTwin:构建安全的合成临床语料
- REVS:通过词表空间秩编辑遗忘语言模型中的敏感信息
- 基于采样伪似然的成员推断攻击
- 学习用 token、遗忘用 token:以双目的训练缓解 LLM 的成员推断攻击
- 当GPT泄密:GPTs知识文件泄露的全面评估Xinyue Shen, Yun Shen, Michael Backes 等ACL Anthology
- 哪些保留集影响大模型遗忘?实体遗忘案例研究
危险能力
3- CLeVeR:用于漏洞代码表征的多模态对比学习
- 夹击中的大语言模型:恶意软件请求与越狱挑战Haoyang Li, Huan Gao, Zhiyuan Zhao 等ACL Anthology
- SDD:以自退化防御恶意微调ZiXuan Chen, Weikai Lu, Xin Lin 等ACL Anthology
红队
15- AdamMeme:自适应探测多模态大模型的有害性推理能力Zixin Chen, Hongzhan Lin, Kaixin Li 等ACL Anthology
- 利用大语言模型搜索改进红队测试
- 镜中偏见:大语言模型的观点能抵抗自身的对抗攻击吗Virgile Rennard, Christos Xypolopoulos, Michalis VazirgiannisACL Anthology
- 只见树木不见森林:多模态大模型安全意识评测Wenxuan Wang, Xiaoyuan Liu, Kuiyi Gao 等ACL Anthology
- 语码转换红队:评估大语言模型安全与多语言理解Haneul Yoo, Yongjin Yang, Hwaran LeeACL Anthology
- 基于认知推理的大语言模型多轮安全动态评测Lanxue Zhang, Yanan Cao, Yuqiang Xie 等ACL Anthology
- 动态 Evil Score 引导解码:面向红队模型的高效解码框架
- 利用指令跟随检索器进行恶意信息检索
- 如果埃莉诺·里格比遇见ChatGPT:大模型时代的孤独研究Adrian de WynterACL Anthology
- LongSafety:评估大语言模型的长上下文安全性Yida Lu, Jiale Cheng, Zhexin Zhang 等ACL Anthology
- MDIT-Bench:评测大型多模态模型的双重隐式毒性
- Qorǵau:哈萨克语-俄语双语场景下的安全评测
- 更安全还是更走运?大语言模型安全评审易受表面措辞干扰Hongyu Chen, Seraphina Goldfarb-TarrantACL Anthology
- TRIDENT:以三维多样化红队数据合成增强模型安全Xiaorui Wu, Xiaofeng Mao, Fei Li 等ACL Anthology
- VLSBench:揭示多模态安全评测中的视觉信息泄漏Xuhao Hu, Dongrui Liu, Hao Li 等ACL Anthology