顶会安全论文
共 414 篇
越狱与攻击
56- AGILE:基于激活引导局部编辑的越狱攻击Jiecong Wang, Haoran Li, Hao Peng 等ACL Anthology
- ASTRA:自动发现、检索与演化大模型越狱策略Xu Liu, Yan Chen, Kan Ling 等ACL Anthology
- 非对称关系几何驱动的视觉语言模型通用对抗扰动
- Audio Jailbreak:大型音频语言模型越狱的开放综合基准Zirui Song, Qian Jiang, Mingxuan Cui 等ACL Anthology
- AutoRAN:自动劫持大型推理模型的安全推理Jiacheng Liang, Tanqiu Jiang, Yuhui Wang 等ACL Anthology
- 进退两难:LLM 伦理推理与安全对齐之间的张力Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh 等ACL Anthology
- 超越固定印记:大语言模型水印的自适应窃取
- Chimera:通过判定驱动的异构策略搜索构造组合越狱
- 目标冲突使大型推理模型更易遭受攻击
- 词典引导的稀疏Logit编辑实现可靠越狱攻击
- DMN:面向多图输入多模态 LLM 的组合式越狱框架Wenzhuo Xu, Zhipeng Wei, Zonghao Ying 等ACL Anthology
- ECHA:利用隐式语义重建与显式安全对齐错位越狱视觉语言模型
- 利用重参数化不变性提升 LLM 越狱攻击的可迁移性Ao Wang, Xinghao Yang, Yongshun Gong 等ACL Anthology
- 评估 LLM 辅导员在对抗性学生攻击下的答案泄露鲁棒性Jin Zhao, Marta Knežević, Tanja KäserACL Anthology
- 经验驱动的多智能体大语言模型黑盒越狱优化
- FLASH:聚焦层的注意力汇劫持
- 从攻击面到实际操作:现代大语言模型越狱综述
- GAMBIT:面向多模态大模型的游戏化越狱框架Xiangdong Hu, Yangyang Jiang, Qin Hu 等ACL Anthology
- 难读却易越狱:视觉退化如何绕过多模态模型安全对齐
- HauntAttack:当攻击如影随形地嵌入推理
- 大模型如何信任未知知识?一种基于未知知识的越狱攻击
- 上下文表征劫持:Doublespeak 越狱攻击Itay Yona, Amir Sarid, Michael Karasik 等ACL Anthology
- 大语言模型中的不完整提示越狱
- 步入灰色地带:领域上下文会模糊 LLM 的安全边界Ki Sen Hung, Xi Yang, Chang Liu 等ACL Anthology
- 通过道德攻击越狱大语言模型
- 用多片段视频越狱多模态大语言模型Choongwon Kang, Seungjong Sun, Hyunmin Jun 等ACL Anthology
- 明知仍为:以道德脱离诊断与防御角色扮演越狱
- 学习隐藏风险:金融领域大语言模型的可控多轮红队攻击Gang Cheng, Haibo Jin, Wenbin Zhang 等ACL Anthology
- 逻辑越狱:通过形式逻辑表达绕过大模型安全限制
- 让多模态大模型失明:内容审核中的对抗走私攻击
- 增加智能体改善数学解题,但对抗鲁棒性差距依然存在
- MSIA:自适应医疗多模态多轮语义越狱
- MultiCodeAttack:多语言代码模板驱动的迭代越狱
- NaturalSloth:重新审视针对大模型的拒绝服务攻击Yiming Chen, Zexin Li, Xianghu Yue 等ACL Anthology
- OSCR-Attack:自优化连续松弛的单次字符级攻击
- 模式增强多轮越狱:利用大语言模型的结构性弱点
- 透视防护盾:识别大语言模型中的安全护栏
- 在潜空间中探测 LLM 的安全鲁棒性Tianle Gu, Kexin Huang, Zongqi Wang 等ACL Anthology
- RAMP:用于越狱红队测试的风险感知多轮规划
- Reference Attack:针对多模态大模型的跨模态越狱攻击Yulong Wang, Yifei Fu, Jiayi GaoACL Anthology
- 大语言模型安全护栏易受价值驱动对抗提示攻击
- Seeing No Evil:通过对抗性注意力劫持让视觉语言模型对安全指令“失明”Jingru Li, Wei Ren, Tianqing ZhuACL Anthology
- SHAPE:统一教育 LLM 的安全、有用与教学性Sihang Zhao, Kangrui Yu, Youliang Yuan 等ACL Anthology
- SHARP:面向黑盒越狱的自适应有害类别感知提示生成Yingjie Xue, Xingyou Xia, Jun Zhang 等ACL Anthology
- 让护栏失声:通过动态上下文表征消融实现推理时越狱
- SoundBreak:对三模态模型纯音频对抗攻击的系统研究Aafiya Shamshad Hussain, Gaurav Srivastava, Alvi Md Ishmam 等ACL Anthology
- StanceAttack:针对立场检测的对抗攻击
- 偏离拒答:基于首词元分布的黑盒越狱方法
- StructBreak:结构性认知过载引发多模态模型安全失效
- 水印消退:针对大语言模型水印的自适应进化改写攻击
- 以自适应叠加密码越狱大型推理模型
- TinyAttack:探索大语言模型的字符样式漏洞
- TROJail:以过程奖励优化多轮大模型越狱轨迹Xiqiao Xiong, Ouxiang Li, Zhuo Liu 等ACL Anthology
- 背景也重要:针对医疗视觉语言模型的可迁移攻击Akash Ghosh, Subhadip Baidya, Sriparna Saha 等ACL Anthology
- 当效率遇上安全:LLM 中 KV Cache 压缩的安全基准分析Xiaoxiao Ma, Kuofeng Gao, Zeyi Lu 等ACL Anthology
- 安全对齐何时无法泛化:语言游戏越狱探测
提示注入
12- 超越显式拒答:针对 RAG 的软失效攻击Wentao Zhang, Yan Zhuang, ZhuHang Zheng 等ACL Anthology
- CachePrune:通过编辑 KV-Cache 教 LLM 不跟随注入指令Rui Wang, Junda Wu, Yu Xia 等ACL Anthology
- EVA:以语义对抗演化对GUI智能体开展环境注入红队测试
- 知己知彼:以多样数据与指令级思维链防御提示注入
- PIArena:提示注入评测平台Runpeng Geng, Chenlong Yin, Yanting Wang 等ACL Anthology
- 大模型自动简历筛选中的单人及多人提示注入
- RAP-ID:基于指令冒充行为的机制式提示注入检测
- 推理劫持:大语言模型推理对齐的脆弱性Yuansen Liu, Yixuan Tang, Anthony Kum Hoe TungACL Anthology
- 重新审视提示注入攻击评估
- 引用带来鲁棒性:通过引用执行指令防御提示注入
- VIGIL:以先验证后提交防御 LLM Agent 的工具流注入Junda Lin, Zhaomeng Zhou, Zhi Zheng 等ACL Anthology
- 当效率成为弱点:针对网页智能体的计算成本攻击Liang-Bo Ning, Yuchen Zhu, Heqing Huang 等ACL Anthology
Agent 安全
33- 视觉对抗扰动如何绕过多模态智能体的价格约束
- 面向电商领域 Web Agent 的功能导向评测基准Xianren Zhang, Shreyas Prasad, Di Wang 等ACL Anthology
- Among Us:度量并缓解模型协作系统中的恶意贡献Ziyuan Yang, Wenxuan Ding, Shangbin Feng 等ACL Anthology
- 电商欺骗性界面下的 Web Agent 安全基准Zijing Shi, Meng Fang, Ling ChenACL Anthology
- 多智能体大模型系统中的组合式提示攻击Nokimul Hasan Arif, Qian Lou, Mengxin ZhengACL Anthology
- CORBA:针对大语言模型多智能体系统的传染式递归阻塞攻击
- 别点那里:教 Web Agent 抵御欺骗性界面Yilin Zhang, Yingkai Hua, Chunyu Wei 等ACL Anthology
- 基于双层图异常检测的 LLM 多智能体系统可解释细粒度防护Junjun Pan, Yixin Liu, Rui Miao 等ACL Anthology
- 壳中的假朋友:揭示 LLM 的颜文字语义混淆漏洞Weipeng Jiang, Xiaoyu Zhang, Juan Zhai 等ACL Anthology
- 从任务到团队:金融多智能体系统的风险优先评测框架
- 对抗环境如何误导智能体?
- InquireMobile:用强化微调教 VLM 移动 agent 请求人工协助Qihang Ai, Pi Bu, Yue Cao 等ACL Anthology
- 贾维斯还是奥创?计算机操作智能体安全威胁综述Ada Chen, Yongjiang Wu, Junyuan Zhang 等ACL Anthology
- 以真话行骗:通过生成式蒙太奇实现开放信道多智能体合谋的信念操纵Jinwei Hu, Xinmiao Huang, Youcheng Sun 等ACL Anthology
- MADRA:面向风险感知具身规划的多智能体辩论
- MCP-Guard:智能体模型上下文协议的多阶段纵深防御
- 生成式智能体社会模拟中的多模态安全评估Alhim Adonai Vera Gonzalez, Carlos Hinojosa, Karen Sanchez 等ACL Anthology
- 经验驱动自演化智能体的安全风险
- OS-Sentinel:通过混合验证提升移动 GUI Agent 安全性Qiushi Sun, Mukai Li, Zhoumianze Liu 等ACL Anthology
- PerMemSafe:长程自演化智能体的隐式个性化安全评测
- SafeAgent:用自动风险模拟器保护 LLM agentXueyang Zhou, Weidong Wang, Lin Lu 等ACL Anthology
- SafeMCP:基于环境前瞻推理的 LLM Agent 主动权力调节防御Lichao Wang, ZhaoXing Ren, Tianzhuo Yang 等ACL Anthology
- Safety Sidecar:反思驱动的智能体运行时安全控制
- SafetyALFRED:评估视觉语言模型的安全规划能力
- 别再盯着提示词:面向 LLM Agent 红队的推理劫持与约束收紧Yanxu Mao, Peipei Liu, Tiehan Cui 等ACL Anthology
- TAMAS:多智能体 LLM 系统对抗风险基准Ishan Kavathekar, Hemang Jain, Ameya Rathod 等ACL Anthology
- ToolSafe:通过步骤级主动护栏与反馈提升工具调用安全
- TopoSHIELD:以时空风险感知拓扑演化阻断恶意传播
- Visual Inception:通过多模态记忆投毒破坏 Agent 推荐系统的长期规划Jiachen QianACL Anthology
- 针对大模型多智能体系统的网页链接欺诈攻击
- 当个性化使风险合法化:个性化对话 Agent 的安全漏洞Jiahe Guo, Xiangran Guo, Yulin Hu 等ACL Anthology
- 智能体为何在压力下牺牲安全
- XOXO:针对 AI 编程助手的隐蔽跨源上下文投毒攻击Adam Štorek, Mukur Gupta, Noopur Bhatt 等ACL Anthology
防御与护栏
118- TRuST:有毒语言片段与攻击目标识别
- 从BERTology看大模型编排:高效单次前向分类探针Gonzalo Ariel Meyoyan, Luciano Del CorroACL Anthology
- 用于提示安全的轻量可解释护栏Md Asiful Islam, Mihai SurdeanuACL Anthology
- 利用句法可预测性的语言学感知大语言模型水印Shinwoo Park, Hyejin Park, Hyeseon An 等ACL Anthology
- 多语言模型有害内容缓解策略综述
- 剖析机器遗忘:事实显著性与模型微调的双重影响
- 审计大语言模型对心理健康群体有害刻板印象的回应
- BanHADEX:人类标注解释支持的孟加拉语仇恨检测Faisal Hossain Raquib, Akm Moshiur Rahman Mazumder, Md Fahim 等ACL Anthology
- 做自己的红队:通过自博弈与反思经验回放实现安全对齐
- 超越表层检测:基于元操作推理的认知驱动越狱防御Rui Pu, Chaozhuo Li, Rui Ha 等ACL Anthology
- 超越安全代价:以外部安全修正抑制不安全文生图
- BOOKAGENT:多智能体认知校准下的安全视觉叙事
- 用序列级风险累积校准推理时对齐Shanwen Tan, Ziyang Dong, Wei Ju 等ACL Anthology
- CARO:面向鲁棒内容审核的类比链推理优化
- CEAID:面向中欧语言的多语种机器生成文本检测基准
- 认知分析图引导的大语言模型多轮安全增强
- 大模型仇恨言论检测中的安全对齐与意识形态偏差Sanjeevan Selvaganapathy, Mehwish NasimACL Anthology
- 通过基于梯度的样本选择维持持续安全对齐
- CrossGuard:保护 MLLM 免受联合模态隐式恶意攻击Xu Zhang, Hao Li, Zhichao LuACL Anthology
- DART:以蒸馏、审计和修复训练缓解差异感知模型的危害漂移
- 深度研究的开放域评估与多阶段安全护栏Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu 等ACL Anthology
- 结合模板化上下文学习与防御后缀抵御大模型越狱
- 针对提示攻击的防御学到的是表面启发式Li Li, Chenxiao Yu, Zhiyu Ni 等ACL Anthology
- 检测查询意图:用 FFN 输出激活监测实现 LLM 安全 steeringXiaohao Luo, Ying Wei, Rui ZhaoACL Anthology
- LLM 去毒:从数据集本身入手Wei Shao, Yihang Wang, Gao yu Zhu 等ACL Anthology
- DIA-HARM:50 种英语方言下有害内容检测的差异Jason S Lucas, Matt Murtagh White, Ali Al-Lawati 等ACL Anthology
- 基于增强策略训练的领域可泛化 AI 护栏Minqian Liu, Ioana Baldini, David Rabinowitz 等ACL Anthology
- 别破坏事实:基于双重事实护盾的可信RAG水印Hao Huang, JiaTang Luo, Ruihua Zhou 等ACL Anthology
- DR-HM:以认知感知数据合成及先蒸馏后强化检测有害模因
- DualGuard:抵御改写与伪造攻击的双流水印
- EntroBench:多熵场景与实际用户操作下的大模型水印评测
- 遗忘而不留痕:大模型的隐式知识遗忘Huazheng Wang, Yongcheng Jing, Haifeng Sun 等ACL Anthology
- 评估法条型法律问答的结构感知检索与安全性Kyubyung Chae, Jewon Yeom, Jeongjae Park 等ACL Anthology
- 解释为何标记:超越内容屏蔽的仇恨言论语境分析
- FigSIM:自杀主题表情包的严重程度与修辞语言数据集
- FlexGuard:面向严格度自适应 LLM 内容审核的连续风险评分Zhihao Ding, Jinming Li, Ze Lu 等ACL Anthology
- 忘掉重要的,保留其余:信息性 Token 的选择性遗忘Seunghee Koh, Sunghyun Baek, Youngdong Kim 等ACL Anthology
- 从TDMA到CDMA:扩散语言模型的多比特水印Baizhou Huang, Xiaojun WanACL Anthology
- 壳中幽灵:以同义词感知逻辑值塑形指纹保护视觉语言模型版权
- GrandGuard:老年人与聊天机器人交互的安全分类、基准及护栏
- Guardian-as-an-Advisor:以建议式护栏提升模型可信度
- HalluGuard:用证据驱动的小型推理模型抑制RAG幻觉
- Health-ORSC-Bench:健康场景过度拒答与安全作答基准
- HiddenGuard:基于专用表征路由器的细粒度安全生成Lingrui Mei, Shenghua Liu, Yiwei Wang 等ACL Anthology
- 如何增强大型推理模型的安全性:一项实证研究Zhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang 等ACL Anthology
- 基于 SAE 构造低秩子空间的可解释安全对齐Dianyun Wang, Qingsen Ma, Yuhu Shang 等ACL Anthology
- 越狱攻击对抗内容安全过滤器:大模型安全攻防进展如何?
- JPU:通过 on-policy 路径修正连接越狱防御与遗忘学习Xi Wang, Songlei Jian, Shasha Li 等ACL Anthology
- 知道何时放弃:诊断并训练大模型终止无效推理
- 面向RAG知识库的知识注入式多比特水印
- LASA:在语义瓶颈处实现语言无关的安全对齐Junxiao Yang, Haoran Liu, Jinzhe Tu 等ACL Anthology
- 从模型内部保障安全:利用内部表征检测有害内容Difan Jiao, Yilun Liu, Ye Yuan 等ACL Anthology
- 基于大模型的孟加拉语仇恨言论多任务检测Md Arid Hasan, Firoj Alam, Md Fahad Hossain 等ACL Anthology
- LLM-VA:通过向量对齐化解越狱与过度拒答的权衡Haonan Zhang, Dongxia Wang, Yi Liu 等ACL Anthology
- LR-DWM:扩散语言模型的高效水印方法
- LS-Guard:针对单个大语言模型定制的自适应安全护栏
- 通过推理时激活能量缓解对齐大语言模型的过度拒答Eric Hanchen Jiang, Weixuan Ou, Run Liu 等ACL Anthology
- 通过意图引导安全推理缓解多模态模型的安全上下文遗忘Xiyao Dong, Guangsheng Cheng, YiLong Chen 等ACL Anthology
- 超越模态之和:解析多模态仇恨言论检测中的意图转变
- 多思少言:将审慎安全推理内化到大模型参数Guan Wang, Xuehai Tang, Biyu Zhou 等ACL Anthology
- 通过多语种拒答对齐提升大语言模型安全性
- 从神经元理解大模型攻击:定向调优实现精准稳健的漏洞修补
- 新词新毒性:搜索增强大模型的中文新词毒性检测
- OFFSIDE:多模态大模型虚假信息遗忘评测
- 穿透语言伪装:中文仇恨言论的细粒度毒性抽取
- 自适应对比解码:缓解大语言模型的过度拒答Yupeng Qi, Ziyu Lyu, Lixin Cui 等ACL Anthology
- 观点:大语言模型水印落地需要协调各方激励
- 通过关键权重保护维持量化大语言模型的公平与安全
- 通过耦合权重与激活约束防止大语言模型安全漂移
- 投影去除恶意:基于全局子空间的大模型去毒Zenghao Duan, Zhiyi Yin, Zhichao Shi 等ACL Anthology
- 剪除不安全彩票:让 LLM 更安全更稳健的资源高效框架Wai Man Si, Mingjie Li, Michael Backes 等ACL Anthology
- ReasMark:抵御知识蒸馏攻击的推理归属水印Peizhuo Lv, Ruihua Zhou, Yunpeng Li 等ACL Anthology
- 同时参考判例与法条:案例增强的审慎对齐用于 LLM 安全Can Jin, Rui Wu, Tong Che 等ACL Anthology
- 推理结构对推理模型的安全对齐至关重要Yeonjun In, Wonjoong Kim, Sangwu Park 等ACL Anthology
- 通过指令层级推理提升语言模型可控性
- ReasoningGuard:用推理时安全顿悟时刻保护大型推理模型Yuquan Wang, Mi Zhang, Yining Wang 等ACL Anthology
- ReCon:通过反向安全概念注入防御视觉语言模型越狱
- 强化学习引导的分布外有害文本检测自适应调优Mengyu Xiang, Tinghao Chen, Boxu Han 等ACL Anthology
- 可审计潜在思维链对齐:化解安全与可审计性困境Guan Wang, Biyu Zhou, Xuehai Tang 等ACL Anthology
- 用表示对比评分重新思考大型视觉语言模型的越狱检测Peichun Hua, Hao Li, Shanghao Shi 等ACL Anthology
- 重新审视黑盒大语言模型水印检测:非侵入式第三方框架
- 检索增强防御:自适应、可控的大语言模型越狱防范Guangyu Yang, Jinghong Chen, Jingbiao Mei 等ACL Anthology
- RLShield:基于强化自适应学习的大模型动态越狱检测
- RShield:嵌入即服务中可追溯用户的LLM后门水印
- RST-Guarder:通过 RST 解析与概率推断增强护栏的长文本鲁棒性Xu Zhang, Xiaojun WanACL Anthology
- RubRIX:用评估量规降低照护者与AI互动中的风险
- Safe-FedLLM:联邦大语言模型的安全性研究Mingxiang Tao, Yu Tian, Wenxuan Tu 等ACL Anthology
- SafeConstellations:任务感知表征引导缓解过度拒答Utsav Maskey, Sumit Yadav, Mark Dras 等ACL Anthology
- 通过推拉式分布对齐保护 LLM 微调安全Haozhong Wang, Zhuo Li, Yibo Yang 等ACL Anthology
- SafeMERGE:通过选择性逐层合并保留微调模型的安全对齐
- SAFER:通过高效事前推理增强安全对齐
- SafeSteer:多模态大语言模型的解码级防御机制
- 面向口腔癌术后护理的安全感知对话系统与临床数据集
- SafetyMem:基于双组件安全记忆的自适应越狱防御Hao Wang, Ziyi Ni, Huacan Wang 等ACL Anthology
- SAME:安全变换引导的安全感知模型编辑Jiayi Wang, Shipeng Wang, Ji Wu 等ACL Anthology
- SEA-Guard:立足东南亚文化的多语言安全护栏
- SEA-SafeguardBench:东南亚语言文化安全基准
- 自我反思提升大型推理模型的安全性
- SMARTER:大模型自增强的低数据可解释毒性检测Huy Nghiem, Advik Sachdeva, Hal Daumé IiiACL Anthology
- 仅用提示适配音频语言模型的低资源多语言有毒语音检测
- SSG:用于大模型水印的Logit平衡词表划分Chenxi Gu, Xiaoning Du, John C. GrundyACL Anthology
- 别再全面加固:面向神经排序模型的免训练神经元级防御Yu-An Liu, Ruqing Zhang, Hongru Song 等ACL Anthology
- SWAN:基于抽象意义表示的语义水印Ziping Ye, Gourab Dey, Christos Christodoulopoulos 等ACL Anthology
- 再想一遍,让大语言模型更安全、更有帮助
- 基于主题的大语言模型水印
- 理解稀疏自编码器的鲁棒性
- TOXIFRENCH:法语毒性检测基准与思维链微调
- ToxiTrace:以梯度对齐训练实现可解释中文毒性检测
- TrajGuard:基于隐状态轨迹的解码时越狱防御
- TriPlay-RL:面向 LLM 安全对齐的三角色自博弈强化学习Zhewen Tan, Wenhan Yu, Jianfeng Si 等ACL Anthology
- TRUST:通过不确定性引导与图净化增强社交机器人检测
- UbuntuGuard:扎根非洲语言文化的AI安全策略基准
- UMMF:基于遗忘学习的多模态记忆指纹保护 LVLM 版权Xiaofan Zheng, Xinghao Wang, Xiaojun WanACL Anthology
- 遗忘者会说谎:评估并改进 LLM 遗忘中的诚实性Renjie Gu, Jiazhen Du, Yihua Zhang 等ACL Anthology
- VLMGuard-R1:推理驱动提示优化的视觉语言模型安全对齐
- 当推理突破安全:揭示并缓解大推理模型的自我越狱
- 微调后 LLM 安全护栏为何崩塌:对齐数据与微调数据的相似性分析Lei Hsiung, Tianyu Pang, Yung-Chen Tang 等ACL Anthology
- 只需一个Token即可改善安全对齐
对齐
38- 面向医疗角色规范遵循的自演化大模型智能体框架
- 迁就与认知警觉:LLM 为何不质疑有害信念的语用学解释Myra Cheng, Robert D. Hawkins, Dan JurafskyACL Anthology
- 用于少样本模型对齐的激活奖励模型
- CliniCAST:医疗分诊中的声学依据与文本主导评测
- COMPASS:大语言模型组织特定政策对齐评测框架Dasol Choi, DongGeon Lee, Brigitta Jesica Kartono 等ACL Anthology
- ConsistRM:以一致性感知自训练改进生成式奖励模型Yu Liang, Liangxin Liu, Longzheng Wang 等ACL Anthology
- 诊断与缓解大语言模型因果判断中的谄媚与过度怀疑
- 大模型智能体会再现权力不对等对话中的社会认知效应吗?Anvesh Rao Vijjini, Sagar B. Manjunath, Snigdha ChaturvediACL Anthology
- 视觉语言模型有道德定力吗?道德判断的脆弱性研究
- 上下文学习中的涌现失对齐:狭窄示例引发广泛偏离Nikita Afonin, Nikita Andriianov, Vahagn Hovhannisyan 等ACL Anthology
- EthicMind:多轮对话的风险感知伦理与情感对齐Jiawen Deng, Wei Li, Wentao Zhang 等ACL Anthology
- 忠实性与安全性:评估反事实医学证据下的大模型行为
- 感觉正确与真正正确:AI谄媚如何影响价值判断Jeongwoo Ryu, Soomin Kim, Jinsu Eun 等ACL Anthology
- 谄媚的动态:Video-LLM 谄媚行为的基准与分析Wenrui Zhou, Mohamed Hendy, Shu Yang 等ACL Anthology
- 从局部遗忘到大语言模型的涌现失对齐Erum Mushtaq, Anil Ramakrishna, Satyapriya Krishna 等ACL Anthology
- 信任的泛化:语言模型的弱到强可信性Lillian Sun, Martin Pawelczyk, Zhenting Qi 等ACL Anthology
- 对付讨好者的好论据:推理如何缓解(却又掩盖)LLM 谄媚Zhaoxin Feng, Zheng Chen, Jianfei Ma 等ACL Anthology
- 大语言模型如何权衡内部知识、用户主张与文档主张
- 价值观引导如何重塑大语言模型行为
- RLHF中训练数据与策略的联合优化
- MedRedFlag:大模型如何纠正真实健康咨询中的错误前提
- 结果准确还不够:对齐奖励模型的推理过程Binghai Wang, Yantao Liu, Yuxuan Liu 等ACL Anthology
- 观点:后训练时代应将人类标注分歧视为内在价值
- ProMedical:显式注入细粒度临床标准的医疗对齐He Geng, Yangmin Huang, Lixian Lai 等ACL Anthology
- PsychEthicsBench:依澳大利亚心理健康伦理评估大模型
- RLHS:利用事后模拟缓解RLHF中的失对齐
- 安全与效用冲突并非全局:基于注意力头诊断的精准对齐Wang Cai, Yilin Wen, Jinchang Hou 等ACL Anthology
- 简单角色分配在安全对齐中表现出显著效果
- 像专家与是专家:拆解大模型谄媚中的权威、语体与文化影响
- 时空谄媚:否定式误导下的视频大模型信念反转
- SycoBench-600:评测大模型助手的谄媚与选择性纠错
- 是否干预:用概率模型混合引导推理时对齐
- 好人难说真话:角色扮演语言模型中由宜人性驱动的谄媚Arya Shah, Deepali Mishra, Chaklam SilpasuwanchaiACL Anthology
- 大语言模型拓扑增强对齐:轨迹拓扑损失与拓扑偏好优化
- 揭示大语言模型的策略性利己行为
- 视觉自我实现对齐:用威胁相关图像塑造安全导向人格Qishun Yang, Shu Yang, Lijie Hu 等ACL Anthology
- 当正确信念崩塌:LLM 在临床压力下的认知韧性Boyu Xiao, Xiuqi Tian, Xuwen Song 等ACL Anthology
- WildFeedback:利用真实交互与用户反馈对齐大模型Taiwei Shi, Zhuoer Wang, Longqi Yang 等ACL Anthology
奖励作弊
11- 用偏差拟合缓解 RLHF 中奖励模型的长度偏差Kangwen Zhao, Jianfeng Cai, Jinhua Zhu 等ACL Anthology
- 用评分细则奖励治愈数学推理中的“奇迹步骤”Youliang Yuan, Qiuyang Mang, Jingbang Chen 等ACL Anthology
- 通过评估器压力测试检测强化学习与大模型对齐中的代理指标作弊
- LCO:以约束优化缓解智能体的奖励作弊
- 修补漏洞:缓解多语言翻译强化学习中的奖励作弊
- PRISM:具有内在结构建模的概率奖励模型Yuhang Zhou, Yixin Cao, Yuchen Ni 等ACL Anthology
- 重新审视可验证奖励强化学习中的选择题:通过干扰项设计释放潜力
- TNT:缓解混合推理模型强化学习中的奖励作弊Siyuan Gan, Jiaheng Liu, Boyan Wang 等ACL Anthology
- 以分层多步奖励模型增强大语言模型推理
- TRAC:以自适应校准的教师词元奖励实现稳健策略优化Sitong Wu, Haoru Tan, Xichen Zhang 等ACL Anthology
- 训练语言模型将Prolog用作工具
- 推理轨迹影响输出,但模型不愿承认Yijie Hao, Lingjie Chen, Ali Emami 等ACL Anthology
可解释性
14- 分析激活引导向量的安全隐患
- 约束参数区域能否保障大语言模型安全?Zongmin Li, Jian Su, Farah Benamara 等ACL Anthology
- CausalDetox:通过因果注意力头选择与干预降低语言模型毒性
- CRISP:基于稀疏自编码器的持久概念遗忘Tomer Ashuach, Dana Arad, Aaron Mueller 等ACL Anthology
- 虚假的安全感:基于探针的恶意输入检测为何难以泛化
- FineSteer:面向大模型的统一细粒度推理时 steering 框架Zixuan Weng, Jinghuai Zhang, Kunlin Cai 等ACL Anthology
- 让机制可解释性可审计:呼吁通过持续协作评审制定指南Michael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi 等ACL Anthology
- LLM 的心理 steering:有效性与可信度评估Amin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani 等ACL Anthology
- Safe-SAIL:用稀疏自编码器刻画模型细粒度安全特征
- 选择性激活引导:通过判别式层选择实现保范数控制
- 离策略训练数据对探针泛化的影响
- 识别与干预大语言模型的安全关键参数
- 大语言模型欺骗行为的隐藏状态轨迹特征Viraaji Mothukuri, Reza M. PariziACL Anthology
- 用特征叠加几何理解涌现式错位Gouki Minegishi, Hiroki Furuta, Takeshi Kojima 等ACL Anthology
后门与投毒
31- 通过激活分解与引导修复大语言模型后门Lingfeng Zhong, Qiongkai Xu, Usman NaseemACL Anthology
- ATAAT:视觉语言动作模型后门的自适应对抗调优
- 后门坍缩:通过已知后门聚合消除语言模型中的未知威胁Liang Lin, Miao Yu, Moayad Aloqaily 等ACL Anthology
- BackdoorAgent:大模型智能体后门攻击统一框架
- RLVR 中的后门:经可验证奖励植入的越狱后门Weiyang Guo, Zesheng Shi, Zeen Zhu 等ACL Anthology
- 通过零空间约束将激活 steering 编译进权重以实现隐蔽后门Rui Yin, Tianxu Han, Naen Xu 等ACL Anthology
- Critical-CoT:防御 LLM 推理层后门攻击的稳健框架Vu Tuan Truong, Long Bao LeACL Anthology
- 防御针对GraphRAG的知识投毒攻击Havva Alizadeh Noughabi, Fattane Zarrinkalam, Ali DehghantanhaACL Anthology
- DiSec:解耦对抗权重以清除预训练语言模型后门
- 向窃贼致意:去中心化GRPO的攻击与防御
- 针对 LLM 后门式指纹的抑制攻击Hang fu, Wanli Peng, Yinghan Zhou 等ACL Anthology
- 针对医疗多模态检索增强生成的知识投毒攻击Peiru Yang, Haoran Zheng, Tong Ju 等ACL Anthology
- LogicPoison:针对图检索增强生成的逻辑攻击Yilin Xiao, Jin Chen, Qinggang Zhang 等ACL Anthology
- 合并触发器,打破后门:面向指令微调语言模型的防御性投毒San Kim, Gary LeeACL Anthology
- MirageBackdoor:诱导“想得对、答得错”推理的隐蔽后门攻击Yizhe Zeng, Wei Zhang, Yunpeng Li 等ACL Anthology
- MM-PoisonRAG:以局部和全局知识投毒攻击破坏多模态 RAGHyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim 等ACL Anthology
- P2P:以毒攻毒的大语言模型后门防御
- PRA-RAG:抵御检索内容投毒的可证明鲁棒聚合
- 从拒绝到接受:不依赖少量输出词元的模型编辑越狱后门
- 重新审视推理:大语言模型推理型后门综述
- 检索可能有害:检索增强扩散模型的后门漏洞Hao Fang, Xiaohang Sui, Hongyao Yu 等ACL Anthology
- RIPRAG:用强化学习攻击黑盒检索增强问答系统
- SAFER:误接受率可控的大模型后门防御
- SilentDrift:利用动作分块隐蔽攻击视觉语言动作模型
- SLIP:结合软标签与关键词引导思维链防御API指令后门
- 自适应审问者:以演化对话策略检测多智能体系统中的木马模型
- 让训练徒劳:以功能保持型投毒阻止代码数据集未经授权使用
- 工业助手的隐患:针对大模型PLC代码生成的隐蔽后门
- 超越触发器:编码器攻击下扩散模型的语义漂移
- LoRA为何难以遗忘:用正则化低秩适配消除语言模型后门
- 你的LLM智能体可能泄露数据:通过后门工具调用窃取数据
隐私与数据泄露
46- 通过自适应回溯保护大语言模型隐私
- 局部差分隐私下基于 Agent 的子结构计数Yuting Zhang, Kai Wang, Wei Ni 等ACL Anthology
- AGTAO:结合对抗门控与自适应正交的大模型遗忘
- Apertus:面向全球语言环境的开放合规大语言模型Alejandro Hernández-Cano, Alexander Hägele, Allen Hao Huang 等ACL Anthology
- Auto-Stega:智能体驱动的大模型文本隐写策略持续演化
- 遗忘之前先学会记忆:重新审视视觉语言大模型遗忘基准
- 多模态大语言模型视频训练数据的黑盒成员推断攻击Jinrui Wang, Zhenfeng Gao, Wendan Wang 等ACL Anthology
- CAP:面向大语言模型遗忘的可控对齐提示Zhaokun Wang, Jinyu Guo, Jingwen Pu 等ACL Anthology
- CheckMIABench:夯实语言模型成员推断攻击评测基础Jeffrey George Wang, Jason Wang, Marvin Li 等ACL Anthology
- CiPO:通过迭代偏好优化实现大型推理模型的反事实遗忘Junyi Li, Yongqiang Chen, Ningning DingACL Anthology
- ContextLens:面向法律合规的不完美隐私与安全情境建模Haoran Li, Yulin Chen, Huihao Jing 等ACL Anthology
- CURaTE:保留大模型知识的实时持续遗忘
- 解码式遗忘:通过熵引导推理抑制事实知识Jingwen Pu, Mingjun Shi, Xinrui Ren 等ACL Anthology
- 分解信任:低秩大模型的隐私、对抗鲁棒性、伦理与公平性
- 通过双路径运行时完整性博弈检测 RAG 提取攻击Yuanbo Xie, Yingjie Zhang, Yulin Li 等ACL Anthology
- 面向检索增强生成的差分隐私合成文本生成
- 直接词元优化:无需外部资源的大语言模型遗忘方法
- LLM 真的记住了个人身份信息吗?用线索控制框架重审 PII 泄露Xiaoyu Luo, Yiyi Chen, Qiongxiu Li 等ACL Anthology
- 多模态RAG会泄露数据吗?成员推断与图像描述检索攻击评估
- Doc-PP:大型视觉语言模型的文档保密策略遵循基准
- DP3:用于多轮大模型推理的差分隐私提示扰动
- DUSK:机器遗忘不应删除共享知识
- 揭示图检索增强生成的隐私风险
- 从领域到实例:大语言模型遗忘的双粒度数据合成
- HearSay基准:音频大模型会泄露听到的隐私吗?
- 超越语言的知识:弥合多语言机器遗忘评测的差距Kyomin Hwang, Hyeonjin Kim, Sangyeon Cho 等ACL Anthology
- LDEDE:LRP驱动的大模型隐私神经元高效检测与编辑
- 别动我的图片:用视觉提示注入阻止 MLLM 分析图像Zedian Shao, Hongbin Liu, Yuepeng Hu 等ACL Anthology
- LOTUS:以双曲蕴含与洛伦兹传输实现多模态遗忘Zekun Wang, Jingjie Zeng, Yingxu Li 等ACL Anthology
- LUNE:通过负例与LoRA微调高效遗忘大模型知识
- 跨视觉、语言、视频与音频的多模态遗忘综述
- PII-VisBench:按网络可见度评测视觉语言模型隐私安全
- 针对微调自回归语言模型的免训练强力成员推断攻击David Ilić, David Stanojević, Kostadin CvejoskiACL Anthology
- 隐私崩塌:良性微调会破坏语言模型的情境隐私Anmol Goel, Cornelius Emde, Seong Joon Oh 等ACL Anthology
- 私有种子与公共大模型:逼真且保护隐私的合成数据生成
- 通过推理轨迹重写保护语言模型免遭未授权蒸馏Xinhang Ma, William Yeoh, Ning Zhang 等ACL Anthology
- REMIND:从输入损失景观理解大模型记忆与遗忘Liran Cohen, Yaniv Nemcovsky, Avi MendelsonACL Anthology
- 表征引导的参数高效大模型遗忘
- 重新审视大型视觉语言模型遗忘后的行为
- 对抗性生成干扰下的大语言模型稳健成员推断Yuanhong Huang, Huili Wang, Xueying Bai 等ACL Anthology
- 旋转控制遗忘:利用认知旋转空间量化与控制大模型连续遗忘
- SEAD:基于语义感知密度的无替代模型成员推断攻击
- SecureGate:以词元门控双适配器控制联邦大模型隐私披露Mohamed Shaaban, Mohamed ElmahallawyACL Anthology
- 大语言模型的选择性片段级遗忘Chaewon Yoon, Dongjun Kim, Hyun-Je SongACL Anthology
- SharedRequest:与模型无关的 LLM 隐私保护推理Peihua Mai, Xuanrong Gao, Youlong Ding 等ACL Anthology
- SLIM:基于潜在空间混淆区的隐蔽低覆盖黑盒水印
- ImF:在大语言模型中嵌入隐式指纹Jiaxuan Wu, Wanli Peng, Hang fu 等ACL Anthology
- PARASITE:通过条件式系统提示投毒劫持 LLMViet Pham, Thai LeACL Anthology
危险能力
2- MolSafeEval:揭示AI生成分子安全风险的基准
- 撒谎还是不撒谎?研究 LLM 对全球虚假信息传播的偏向Zohaib Khan, Mustafa Dogan, Ifeoma Okoh 等ACL Anthology
- 打破“可证明安全”:利用低概率消失检测大模型隐写的有限精度痕迹
- 从信任到失陷:结果验证的 LLM 钓鱼模拟与实时防御Tulika Tewari, Nalin Arachchilage, Jagat Sesh Challa 等ACL Anthology
- LogicEval:真实软件逻辑漏洞自动修复评测框架Syed Md Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu 等ACL Anthology
- 用大语言模型重写裸指针,让C转译的Rust代码更安全
- 抓住关键线索:用大模型辅助分类器检测演变中的诈骗电话
- CTRAP:嵌入坍塌陷阱以保护 LLM 免受有害微调Biao Yi, Tiansheng Huang, Baolei Zhang 等ACL Anthology
- HarmRLVR:利用可验证奖励实现有害对齐Yuexiao Liu, Lijun Li, Xingjun Wang 等ACL Anthology
- OASIS:通过正交自适应安全对齐策略缓解 LLM 有害微调攻击Jiayu Tang, Guowei Peng, Qiuhao Xie 等ACL Anthology
- SGT:用安全引导触发器保护开源 LLM 免受恶意微调Sunguk Shin, Fangzhao Wu, Byung-Jun Lee 等ACL Anthology
- 合成数据来源多样性对大语言模型微调的影响
- 对齐与失效:微调如何破坏并恢复大模型安全
红队
35- 面向大语言模型自动红队测试的自适应指令组合Jesse Zymet, Andy Luo, Swapnil Shinde 等ACL Anthology
- AgenticEval:智能体驱动的自演化大模型安全评测
- ARES:策略—奖励系统的自适应红队测试与端到端修复Jiacheng Liang, Yao Ma, Tharindu Kumarage 等ACL Anthology
- 超越静态基准:基于角色模拟合成有害内容进行稳健评测Huije Lee, Jisu Shin, Hoyun Song 等ACL Anthology
- AI 生成的说服内容能被检测吗?Persuaficial 基准与人机语言差异Arkadiusz Modzelewski, Paweł Golik, Anna Kołos 等ACL Anthology
- 大语言模型能识别“狗哨”暗语吗?
- 刻画大语言模型的选择性拒答偏差
- 用自适应压力测试评估黑盒大模型规划器的观测扰动鲁棒性
- FinSafetyBench:真实金融场景下的大模型安全评测
- GRE评分:大语言模型生成风险评估
- HarDBench:草稿协作写作越狱攻击基准EunTae Kim, Soomin Han, Buru ChangACL Anthology
- 反转护盾:从策略规范系统化生成安全测试Xiaoyue Lu, Xianglin Yang, Haijun Liu 等ACL Anthology
- Jailbreak-Zero:迈向帕累托最优的大语言模型红队测试Kai Hu, Abhinav Aggarwal, Mehran Khodabandeh 等ACL Anthology
- JailMeter:基于证据的大模型越狱攻击评估框架
- 越狱场景下的水印评测:攻击成功率虚高与目标服从度错位
- MHSafeEval:角色感知的心理健康交互安全评测
- MTMCS-Bench:多模态模型多轮对话情境安全评测
- N-GLARE:非生成式的潜表示高效 LLM 安全评估器Zheyu Lin, Jirui Yang, Yukui Qiu 等ACL Anthology
- OmniCompliance-100K:规则支撑的跨域安全合规数据集
- 基于人设的 AI 陪伴应用多轮对话安全评测Prerna Juneja, Lika LomidzeACL Anthology
- 中文短视频虚假信息中的多模态大模型认知偏差评测
- 对大型推理模型进行红队测试Jiawei Chen, Yang Yang, Chao Yu 等ACL Anthology
- Red-Bandit:多臂老虎机引导LoRA专家自适应红队测试Christos Ziakas, Nicholas Loo, Nishita Jain 等ACL Anthology
- 对文生图安全护栏中的NSFW图像分类器开展红队测试
- RedCoder:面向代码 LLM 的自动化多轮红队Wenjie Jacky Mo, Qin Liu, Xiaofei Wen 等ACL Anthology
- 逆向宪法式AI:通过概率截断实现可控有害数据生成
- SafeMT:多模态语言模型的多轮对话安全Han Zhu, Juntao Dai, Jiaming Ji 等ACL Anthology
- 安全并非普遍:大模型对齐中的选择性安全陷阱
- STAR-Teaming:基于策略—响应多层网络的自动化红队
- StealthGraph:用知识图谱引导生成领域有害提示以暴露 LLM 风险Huawei Zheng, Xinqi Jiang, Sen Yang 等ACL Anthology
- LLM 文化禁忌安全中的“知识—行为鸿沟”Ying He, Sihang Jiang, Xingzhou Chen 等ACL Anthology
- 聪明的副作用:多模态大模型的多图推理安全风险Renmiao Chen, Yida Lu, Shiyao Cui 等ACL Anthology
- USB:面向多模态大模型的全面统一安全评测基准Baolin Zheng, Guanlin Chen, Qingyang Teng 等ACL Anthology
- 当助手变成隐患:多模态大模型的日常生活安全基准
- XGUARD:大语言模型极端主义内容安全失效分级基准