顶会安全论文
共 303 篇
越狱与攻击
40- 隐形安全威胁:基于隐写术的大语言模型恶意微调
- 成本不对称下黑盒攻击的通用框架
- Align to Misalign:基于元优化裁判的自动化大模型越狱方法Hamin Koo, Minseon Kim, Jaehyung KimOpenReview
- 深度语音降噪模型对对抗噪声鲁棒吗?
- 自动辩证越狱:有效越狱策略生成框架Jianghai Yu, Yang Zhou, Zihan Zhou 等OpenReview
- 基于概念的对抗攻击:概率视角
- 特征压缩是神经网络对抗脆弱性的根源
- 有限计算预算下的细粒度迭代对抗攻击Zhichao Hou, Weizhi Gao, Xiaorui LiuOpenReview
- GuidedBench:评估并缓解真实场景大模型越狱方法的评测偏差Ruixuan Huang, Xunguang Wang, Zongjie Li 等OpenReview
- 图像能唤醒记忆:针对图像生成模型遗忘学习的多模态引导攻击Renyang Liu, Guanlin Li, Tianwei Zhang 等OpenReview
- 通过生成器语义一致性改进黑盒生成式对抗攻击
- 越狱可迁移性源于共享表征Rico Angell, Jannik Brinkmann, He HeOpenReview
- 基于分镜切分策略的文生视频模型越狱攻击Wonjun Lee, Haon Park, Doehyeon Lee 等OpenReview
- 越狱黑客帝国:用于受控模型颠覆的零空间导向Vishal Pramanik, Maisha Maliha, Susmit Jha 等OpenReview
- JailbreakLoRA:从共享平台下载的LoRA可能并不安全Fanjunduo Wei, Zhenheng Tang, Rongfei Zeng 等OpenReview
- JailNewsBench:越狱攻击下虚假新闻生成的多语言与区域基准
- JALMBench:语音语言模型越狱脆弱性基准评测
- JULI:利用模型自我内省越狱大语言模型Jesson Wang, Zhanhao Hu, David WagnerOpenReview
- LingoLoop攻击:通过语言上下文与状态诱捕使多模态大模型陷入死循环Jiyuan Fu, Kaixun Jiang, Lingyi Hong 等OpenReview
- 大语言模型可在同等长度文本中隐藏文本Antonio Norelli, Michael M. BronsteinOpenReview
- MIDAS:面向多模态大模型越狱的多图分散与语义重构框架Yilian Liu, Xiaojun Jia, Guoshun Nan 等OpenReview
- 错位角色与图像:结构化输入扰动暴露多模态对齐盲区Erfan Shayegani, G M Shahariar, Sara Abdali 等OpenReview
- 绕过Token级安全机制的深度微调攻击Joshua Kazdan, Abhay Puri, Rylan Schaeffer 等OpenReview
- 隐晦却高效:基于仿生搜索的文言文越狱提示词优化Xun Huang, Simeng Qin, Xiaoshuang Jia 等OpenReview
- PLAGUE:用于终身自适应生成多轮越狱的即插即用框架Neeladri Bhuiya, Madhav Aggarwal, Diptanshu PurwarOpenReview
- 基于逆梯度采样的抗未知扰动鲁棒对抗攻击Zhaoyang Zhang, Shen Wang, Runze Liu 等OpenReview
- 抵御对抗性行为操纵的鲁棒深度强化学习Shojiro Yamabe, Kazuto Fukuchi, Jun SakumaOpenReview
- SafeDialBench:多轮对话多样越狱攻击下的大模型安全评测基准
- 面向大语言模型的采样感知对抗攻击Tim Beyer, Yan Scholten, Leo Schwinn 等OpenReview
- 自我越狱:语言模型在良性推理训练后会自行突破安全对齐Zheng Xin Yong, Stephen BachOpenReview
- SEMA:简单高效的多轮越狱攻击学习框架Mingqian Feng, Xiaodong Liu, Weiwei Yang 等OpenReview
- SeRI:基于决策黑盒攻击的无梯度敏感区域识别方法Feiyang Wang, Xingquan Zuo, Hai Huang 等OpenReview
- SlotGCG:利用大模型位置脆弱性进行越狱攻击Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim 等OpenReview
- TAO-Attack:面向大语言模型的高级优化型越狱攻击Zhi Xu, Jiaqi Li, Xiaotong Zhang 等OpenReview
- 面具背后的恶魔:扩散式 LLM 的新兴安全漏洞Zichen Wen, Jiashu Qu, Zhaorun Chen 等OpenReview
- 时间即一切:针对事件驱动脉冲神经网络的脉冲重定时攻击Yi Yu, Qixin Zhang, Shuhan Ye 等OpenReview
- 迈向面向视觉语言模型的通用且可迁移越狱攻击Kaiyuan Cui, Yige Li, Yutao Wu 等OpenReview
- 针对大型视觉语言模型的高迁移性与隐蔽性对抗攻击Zhewen Yao, Yao Zhu, Shiliang ZhangOpenReview
- VEAttack:针对大视觉语言模型的下游无关视觉编码器攻击Hefei Mei, Zirui Wang, Shen You 等OpenReview
- 平坦性何时(不)保证对抗鲁棒性
提示注入
3- ASIDE:语言模型中指令与数据的架构级分离Egor Zverev, Evgenii Kortukov, Alexander Panfilov 等OpenReview
- ChatInject:利用聊天模板在LLM智能体中实施提示注入Hwan Chang, Yonghyun Jun, Hwanhee LeeOpenReview
- VPI-Bench:针对计算机使用智能体的视觉提示注入攻击
Agent 安全
18- RedTeamCUA:混合 Web-OS 环境下计算机使用智能体的对抗测试
- A2ASecBench:面向智能体间协议的安全基准
- 击破智能体骨干:评估AI智能体中基座大模型的安全性Julia Bazinska, Max Mathys, Francesco Casucci 等OpenReview
- 突破与修复多智能体系统中的控制流劫持防御Rishi Dev Jha, Harold Triedman, Justin Wagle 等OpenReview
- 通过合成数据为通用智能体系统构建基础护栏Yue Huang, Hang Hua, Yujun Zhou 等OpenReview
- GhostEI-Bench:移动端智能体对抗环境注入攻击评估基准
- 多智能体系统中目标感知的虚假信息识别与纠正Zherui Li, Yan Mi, Zhenhong Zhou 等OpenReview
- 将生成式规划器植根于可验证逻辑:可信具身智能的混合架构
- 黑暗模式如何操纵 Web AgentPhil Cuvin, Hao Zhu, Diyi YangOpenReview
- 盲目执行!?计算机使用智能体表现出盲目目标导向性Erfan Shayegani, Keegan Hines, Yue Dong 等OpenReview
- ManagerBench:评估自主大模型在安全与实用间的权衡Adi Simhi, Jonathan Herzig, Martin Tutek 等OpenReview
- MCP Security Bench:LLM Agent 中针对 Model Context Protocol 的攻击基准
- MCP-SafetyBench:基于真实MCP服务器的大模型安全评测基准
- OpenAgentSafety:评估真实世界AI Agent安全的综合框架Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou 等OpenReview
- 优化智能体规划以兼顾安全性与自主性Aashish Kolluri, Rishi Sharma, Manuel Costa 等OpenReview
- ST-WebAgentBench:Web智能体安全性与可信度评测基准
- AI Agent线上共谋:社交平台多Agent金融欺诈风险Qibing Ren, Zhijie Zheng, Jiaxuan Guo 等OpenReview
- 智能体可能会误进化:自进化LLM智能体中的涌现风险Shuai Shao, Qihan Ren, Dongrui Liu 等OpenReview
防御与护栏
74- SafeDPO:兼顾高安全性的简易直接偏好优化方法
- SAFETY-GUIDED FLOW:安全生成中负向引导的统一框架
- 安全保持护栏:安全敏感子空间与抗害零空间的结合
- A2D:扩散语言模型的任意顺序与任意步安全对齐防御Wonje Jeung, Sangyeon Yoon, Yoonjun Cho 等OpenReview
- AdPO:基于偏好优化提升大视觉语言模型的对抗鲁棒性
- AdvChain:面向大型推理模型鲁棒安全对齐的对抗思维链微调Zihao Zhu, Xinyu Wu, Gehan Hu 等OpenReview
- 对抗攻击已透露答案:面向视觉语言模型的方向偏差引导测试时防御Liangsheng Liu, Si Chen, Jiamin Wu 等OpenReview
- 对抗既视感:用于未知越狱攻击强泛化的越狱字典学习Mahavir Dabas, Tran Huynh, Nikhil Reddy Billa 等OpenReview
- 对抗预训练Transformer可作为通用鲁棒上下文学习器
- AEGIS:无需保留数据的扩散模型鲁棒概念擦除Fengpeng Li, Kemou Li, Qizhou Wang 等OpenReview
- 对齐加权DPO:提升安全对齐的原则性推理方法Mengxuan Hu, Vivek Datla, Anoop Kumar 等OpenReview
- AlphaAlign:利用极简强化学习激励安全对齐Yi Zhang, An Zhang, XiuYu Zhang 等OpenReview
- Antibody:通过衰减有害梯度影响强化大语言模型抵御有害微调的防御Quoc Minh Nguyen, Trung Le, Jing Wu 等OpenReview
- Any-Depth Alignment:解锁大语言模型任意生成深度的内在安全对齐Jiawei Zhang, Andrew Estornell, David D. Baek 等OpenReview
- ARMOR:通过细致推理对齐安全可靠的大语言模型Zhengyue Zhao, YingziYingzi Ma, Somesh Jha 等OpenReview
- ASGuard:基于激活缩放护栏缓解针对性越狱攻击Yein Park, Jungwoo Park, Jaewoo KangOpenReview
- 超越线性探针:大语言模型的动态安全监控James Oldfield, Philip Torr, Ioannis Patras 等OpenReview
- 基于注意随机性混合卷积的可验证与经验对抗鲁棒性Joy Dhar, Song Xia, Manish Kumar Pandey 等OpenReview
- 弥合安全差距:视觉自回归模型的精准概念擦除Xinhao Zhong, Yimin Zhou, Zhiqi Zhang 等OpenReview
- 扩散模型遗忘学习中的共现关联保留概念保护Miso Kim, Georu Lee, Yunji Kim 等OpenReview
- AI对齐中过滤机制的计算壁垒Sarah Ball, Grzegorz Gluch, Shafi Goldwasser 等OpenReview
- Constitutional Classifiers++:防御通用越狱的高效生产级护栏
- 文生图扩散模型的持续遗忘:正则化视角Justin Lee, Zheda Mai, Jinsu Yoo 等OpenReview
- 基于证据不确定性量化的大视觉语言模型异常行为检测Tao Huang, Rui Wang, Xiaofei Liu 等OpenReview
- DiffuGuard:扩散大语言模型内在安全性的丧失与重构Zherui Li, Zheng Nie, Zhenhong Zhou 等OpenReview
- 去伪存真:通过对比精炼减少大模型过度拒答
- 降级以升级:简化优化器提升大模型机器遗忘的鲁棒性Yicheng Lang, Yihua Zhang, Chongyu Fan 等OpenReview
- DRAGON:基于负向检测与推理的上下文大模型遗忘护栏Yaxuan Wang, Chris Yuhao Liu, Quan Liu 等OpenReview
- DRIFT:基于滤波变换发散响应的稳健对抗防御Amira Guesmi, Muhammad ShafiqueOpenReview
- 双空间平滑性实现鲁棒且均衡的大模型机器遗忘Han Yan, Zheyuan Liu, Meng JiangOpenReview
- DUET:基于高效上下文教师蒸馏的大模型遗忘学习Yisheng Zhong, Zhengbang Yang, Zhuangdi ZhuOpenReview
- DynaGuard:支持用户自定义策略的动态守护模型Monte Hoover, Vatsal Baherwani, Neel Jain 等OpenReview
- 通过正则化子集选择提升微调 LLM 的可信度Kumar Shubham, Nishant Sharma, Karn Tiwari 等OpenReview
- EnsembleSHAP:随机子空间方法的忠实且可证明鲁棒的归因Yanting Wang, Jinyuan JiaOpenReview
- ExpGuard:专业领域大语言模型内容审核护栏
- 基于推理的可解释大语言模型机器遗忘Junfeng Liao, Qizhou Wang, Shanshan Ye 等OpenReview
- 从评测到防御:提升视频大语言模型的安全性Yiwei Sun, Peiqi Jiang, Chuanbin Liu 等OpenReview
- Get RICH or Die Scaling:利用推理算力换取对抗鲁棒性Tavish Malcolm McDonald, Bo Lei, Stanislav Fort 等OpenReview
- GraphShield:基于图论网络级动态建模的稳健越狱检测Sunghee Dong, Sungwon Yi, Kangmin Bae 等OpenReview
- GuardAlign:多模态大语言模型的测试时安全对齐防御Xingyu Zhu, Beier Zhu, Junfeng Fang 等OpenReview
- 利用双曲几何进行有害提示词检测与净化Igor Maljkovic, Maria Rosaria Briglia, Iacopo Masi 等OpenReview
- 识别鲁棒神经通路:视觉语言模型的少样本对抗掩码微调
- 激励对齐的多来源 LLM 摘要Yanchen Jiang, Zhe Feng, Aranyak MehtaOpenReview
- 基于动态奖励缩放逆强化学习的大语言模型对齐Ruoxi Cheng, Hao-Xuan Ma, Weixin Wang 等OpenReview
- 基于高层表征误导的文生图扩散模型局部概念擦除Uichan Lee, Jeonghyeon Kim, Sangheum HwangOpenReview
- 使用轻量级时序监控器防范分解攻击Chen Yueh-Han, Nitish Joshi, Yulin Chen 等OpenReview
- Nasty Adversarial Training:从概率稀疏性视角增强鲁棒性Yuhang Zhou, Zhongyun Hua, Zhaoquan Gu 等OpenReview
- 虽有噪声但有效:利用不完美裁判对大模型进行鲁棒统计评测
- 混淆激活绕过大模型隐空间防御Luke Bailey, Alex Serrano, Abhay Sheshadri 等OpenReview
- OffTopicEval:大语言模型进错聊天场景时的运行安全评测Jingdi Lei, Varun Gumma, Rishabh Bhardwaj 等OpenReview
- 少关注虚词:免费提升视觉语言模型的鲁棒性Qiwei Tian, Chenhao Lin, Zhengyu Zhao 等OpenReview
- Pragma-VL:多模态大模型中安全与有用性的务实权衡Ming Wen, Kun Yang, Xin Chen 等OpenReview
- ProSafePrune:缓解大语言模型过度拒答的投影安全剪枝方法Zijun Chen, Wenbo Hu, Ya Li 等OpenReview
- 推理型安全对齐:通过“先答后检”实现越狱防御Chentao Cao, Xiaojun Xu, Bo Han 等OpenReview
- 反思视觉语言模型安全微调的瓶颈
- 非稳健预训练模型的稳健微调:利用Epsilon调度缓解次优迁移
- 基于后验判别与多轮思考的鲁棒大模型机器遗忘
- 抵御对抗攻击的鲁棒脉冲神经网络
- SafeMoE:通过对齐有害输入路由实现MoE模型的安全微调Jaehan Kim, Minkyoo Song, Seungwon Shin 等OpenReview
- 安全本能:LLM 学会信任内部指南针进行自我防御Guobin Shen, Dongcheng Zhao, Haibo Tong 等OpenReview
- 安全幻象:虚假相关削弱VLM安全微调及机器遗忘缓解方案Yiwei Chen, Yuguang Yao, Yihua Zhang 等OpenReview
- SDErasure:基于自适应扩散分类器的概念消除特定轨迹偏移
- Sysformer:利用自适应系统提示词保护冻结的大模型Kartik Sharma, Yiqiao Jin, Vineeth Rakesh 等OpenReview
- 教会推理安全:面向多模态大推理模型的策略引导安全微调Jingyu Zhang, Kun Yang, Ming Wen 等OpenReview
- 对齐之舞:联合训练智能体协同保障模型安全Jingyu Zhang, Haozhu Wang, Eric Michael Smith 等OpenReview
- 面向安全大模型微调的Token级数据选择Yanping Li, Zhening Liu, Zijian Li 等OpenReview
- 迈向更安全的扩散语言模型:启动漏洞的发现与缓解Shojiro Yamabe, Jun SakumaOpenReview
- TriQDef:阻断量化神经网络中对抗补丁迁移性的防御方法Amira Guesmi, Bassem ouni, Muhammad ShafiqueOpenReview
- Trust The Typical:基于典型安全分布检测的大模型安全护栏框架Debargha Ganguly, Sreehari Sankar, Biyao Zhang 等OpenReview
- 基于上下文学习理论理解与改进大语言模型连续对抗训练Shaopeng Fu, Di WangOpenReview
- 基于低秩拒答向量的视频扩散模型概念消除方法Simone Facchiano, Stefano Saravalle, Matteo Migliarini 等OpenReview
- VLSU:探寻 AI 安全中多模态联合理解的边界
- 当风格破坏安全:防御大模型的表层风格对齐脆弱性Yuxin Xiao, Sana Tonekaboni, Walter Gerych 等OpenReview
- 预训练编码器的零牺牲持久鲁棒对抗防御Zhuxin Lei, Ziyuan Yang, Yi ZhangOpenReview
对齐
33- AdAEM:自适应且自动扩展的大语言模型价值差异度量
- EigenBench:价值对齐的比较行为度量方法
- 人类反馈中包含什么?学习偏好数据的可解释描述
- 一次对齐多语言获益:增强大模型安全对齐的多语言一致性Yuyan Bu, Xiaohao Liu, ZhaoXing Ren 等OpenReview
- 自诊断对齐:偏好对齐中融合内在反馈的元学习范式Mengyang Li, Pinlong Zhao, Zhong ZhangOpenReview
- 基于元加权在线采样的偏好优化对齐方法Junming Yang, Ning Xu, Biao Liu 等OpenReview
- 超越成对比较:通过排序选择建模赋能大语言模型对齐Yuxuan Tang, Yifan FengOpenReview
- 认知模型可揭示语言模型中可解释的价值权衡Sonia Krishna Murthy, Rosie Zhao, Jennifer Hu 等OpenReview
- Command-V:免训练的表示微调迁移
- ELEPHANT:测量并理解大语言模型中的社交谄媚现象Myra Cheng, Sunny Yu, Cinoo Lee 等OpenReview
- 基于信息论引导消除奖励模型归纳偏置
- 基于损失规则在AI对齐中实现公理化保证Alexandros Hollender, Sonja KraiczyOpenReview
- 生成式价值观冲突揭示大语言模型的优先级倾向Andy Liu, Kshitish Ghate, Mona T. Diab 等OpenReview
- Humanline:将在线对齐视为感知损失Sijia Liu, Niklas Muennighoff, Kawin EthayarajhOpenReview
- 接种提示:在训练中诱发特征可减少测试期的特征表达Daniel Tan, Anders Cairns Woodruff, Niels Warncke 等OpenReview
- 基于保序偏好优化的可靠大模型对齐方法
- LitmusValues:通过AI风险困境石蕊测试AI价值优先级
- 利用零空间约束策略优化缓解安全对齐税Yifan Niu, Han Xiao, Dongyi Liu 等OpenReview
- 模态失语症:统一多模态模型能否凭记忆描述图像?Michael Aerni, Joshua Swanson, Kristina Nikolić 等OpenReview
- OrthAlign:基于正交子空间分解的无冲突多目标对齐Liang Lin, Zhihao Xu, Junhao Dong 等OpenReview
- PluriHarms:评测人类对AI危害判断全谱系的基准
- RE-PO:面向大语言模型对齐的鲁棒增强策略优化框架Xiaoyang Cao, Zelai Xu, Mo Guang 等OpenReview
- 参考答案提升非可验证领域的 LLM 对齐Kejian Shi, Yixin Liu, PeiFeng Wang 等OpenReview
- 奖励模型继承预训练阶段的价值偏置
- 基于方向邻域共识的鲁棒偏好对齐Ruochen Mao, Yuling Shi, Xiaodong Gu 等OpenReview
- 表层安全对齐假说Jianwei Li, Jung-Eun KimOpenReview
- 对齐审计器:验证与优化大模型目标的贝叶斯框架
- 混乱的AI:未对齐如何随模型智力与任务复杂度扩展
- 构建符合认知规律的决策模型以改进 AI 对齐Cyrus Cousins, Vijay Keswani, Vincent Conitzer 等OpenReview
- 通过纠正性干预实现大推理模型的安全推理Yichi Zhang, Yue Ding, Jingwen Yang 等OpenReview
- TrustGen:生成式基础模型可信度动态评测平台
- 克服弱监督的诚实性:基于对等预测评估与训练大语言模型Tianyi Alex Qiu, Micah Carroll, Cameron AllenOpenReview
- 基于失败轨迹的弱到强泛化方法Ruimeng Ye, Zihan Wang, Yang Xiao 等OpenReview
- 超越提示诱导的谎言:探究大语言模型在良性提示下的欺骗行为
- 前沿大语言模型隐写能力的早期迹象Artur Zolkowski, Kei Nishimura-Gasparian, Robert McCarthy 等OpenReview
- 学会撒谎:针对人机协作团队与大语言模型的对抗攻击Abed K. Musaffar, Anand Gokhale, Sirui Zeng 等OpenReview
- LH-DECEPTION:模拟与理解长程交互中大语言模型的欺骗行为
- PRISON:揭示大语言模型的犯罪潜能Xinyi Wu, Geng Hong, Pei Chen 等OpenReview
- 坦白交代:训练大语言模型主动报告其隐藏目标Chloe Li, Mary Phuong, Daniel TanOpenReview
- 干预具备评测感知的大语言模型以展现真实部署行为Tim Tian Hua, Andrew Qin, Samuel Marks 等OpenReview
- 策略性不诚实会破坏前沿大语言模型的AI安全评测Alexander Panfilov, Evgenii Kortukov, Kristina Nikolić 等OpenReview
- 语言模型中欺骗性推理的策略性隐匿Arun Jose, Niels Warncke, Mia TaylorOpenReview
奖励作弊
10- 是思考还是作弊?通过衡量推理工作量检测隐式奖励作弊
- Bradley-Terry与多目标奖励建模具有互补性
- 通过响应条件建模解耦偏好学习中的长度偏置Jianfeng Cai, Jinhua Zhu, Ruopei Sun 等OpenReview
- 奉承、冗余与含糊:诊断并缓解偏好模型的特异性偏差Anirudh Bharadwaj, Chaitanya Malaviya, Nitish Joshi 等OpenReview
- 从好奇到谨慎:用悲观原则缓解 Best-of-N 中的奖励作弊Zhuohao Yu, Steven Wu, Adam BlockOpenReview
- ImpossibleBench:评测LLM利用测试用例作弊的倾向Ziqian Zhong, Aditi Raghunathan, Nicholas CarliniOpenReview
- 通过相关代理奖励鲁棒优化缓解奖励作弊Zixuan Liu, Xiaolin Sun, Zizhan ZhengOpenReview
- 基于因果准则的鲁棒奖励建模
- 真实还是编造?用因果归因缓解解释中的奖励作弊Pedro Lobato Ferreira, Wilker Aziz, Ivan TitovOpenReview
- 统一 RLHF 中的稳定优化与参考正则化Li He, Qiang Qu, He Zhao 等OpenReview
- All Code, No Thought:语言模型难以用密码语言推理Shiyuan Guo, Henry Sleight, Fabien RogerOpenReview
- 用于高信息量语言建模的马尔可夫 Transformer
- 仅输出监督仍会导致思维链混淆jacob drori, Luke Marks, Bryce Woodworth 等OpenReview
- Thought Branches:解读 LLM 推理需要重采样
可解释性
16- 对抗影响的形态:利用持续同调表征大语言模型潜在空间
- AlphaSteer:基于零空间约束学习拒答激活干预Leheng Sheng, Changshuo Shen, Weixiang Zhao 等OpenReview
- Dyslexify:针对CLIP排版攻击的机制性防御方法
- 涌现性不对齐易发生,狭义不对齐难实现
- 基于分布匹配与分布式交换干预的双向模型调控
- 从Sure到Sorry:基于JailNeurons的大视觉语言模型越狱检测Yuyou Gan, Qingming Li, Junhao Li 等OpenReview
- GAVEL:基于激活监控的规则化安全Shir Rozenfeld, Rahul Pankajakshan, Itay Zloczower 等OpenReview
- 基于成对均值差干预的推理时个性化安全控制Tran Huynh, Ruoxi JiaOpenReview
- 窄域微调在激活差异中留下清晰可读的痕迹
- Persona 特征控制 Emergent MisalignmentMiles Wang, Tom Dupre la Tour, Olivia Watkins 等OpenReview
- RepIt:利用特定概念拒答向量引导语言模型Vincent Siu, Nathan W. Henry, Nicholas Crispino 等OpenReview
- 基于权重算术的大语言模型干预技术Constanza Fierro, Fabien RogerOpenReview
- 通过专家激活与停用调控MoE大语言模型
- 关注权重:微调大语言模型的无监督监控与控制
- 当思考适得其反:推理诱导对齐失效的机制性洞察
- 问题出在哪?通过表征梯度追踪归因大模型不良行为Zhe Li, Wei Zhao, Yige Li 等OpenReview
- LLM Agent 的可靠弱到强监控
- 针对可信监控器的自适应攻击瓦解AI控制协议Mikhail Terekhov, Alexander Panfilov, Daniil Dzenhaliou 等OpenReview
- Control Tax:约束与控制AI的安全代价Mikhail Terekhov, Zhen Ning David Liu, Caglar Gulcehre 等OpenReview
后门与投毒
18- 小心脚下:大模型微调时激活的潜伏对抗行为
- BEAT:基于对比触发器学习的具身智能体视觉后门攻击Qiusi Zhan, Hyeonjeong Ha, Rui Yang 等OpenReview
- 警惕不可信仿真器:强化学习中的无奖励后门攻击Ethan Rathbun, Wo Wei Lin, Alina Oprea 等OpenReview
- 通过模块切换防御后门攻击Weijun Li, Ansh Arora, Xuanli He 等OpenReview
- 勿转接触发器:用于后门遗忘的鲁棒梯度上升Xingyi Zhao, Tian Xie, Xiaojun Qi 等OpenReview
- DualEdit:通过肯定与拒答调控缓解大模型后门编辑中的安全回退Houcheng Jiang, Zetong Zhao, Junfeng Fang 等OpenReview
- 更少的权重,更多的问题:针对大模型剪枝的实用攻击Kazuki Egashira, Robin Staab, Thibaud Gloaguen 等OpenReview
- 云中魅影:地理分布式大语言模型训练易遭恶意操纵Zichen TANG, Zhenheng Tang, Gaoning Pan 等OpenReview
- 抵御数据投毒攻击的近最优鲁棒联邦学习
- 无需先验知识或干净参照的生成式 LLM 后门清除
- 基于锐度感知最小化增强的后门攻击投毒样本可靠检测Mingda Zhang, Mingli Zhu, Zihao Zhu 等OpenReview
- SABRE-FL:联邦提示学习中的选择性精确后门拒绝
- STEDiff:揭示文生图扩散模型后门攻击的时空冗余Yu Pan, Jiahao Chen, Lin Wang 等OpenReview
- 利用后门CLIP浅层恶意匹配的测试期投毒样本检测Zhengyao Song, Meixi Zheng, Ke Xu 等OpenReview
- TrojanTO:针对轨迹优化模型的动作级后门攻击Yang Dai, Oubo Ma, Xingxing Liang 等OpenReview
- 揭示后门:基于梯度-注意力异常评分的预训练语言模型可解释防御
- 不可学习样本为何有效:基于互信息的新视角
- 冬兵:通过间接数据投毒在预训练阶段为语言模型植入后门Wassim Bouaziz, Mathurin VIDEAU, Nicolas Usunier 等OpenReview
隐私与数据泄露
53- 大语言模型微调经验隐私保护基准评测
- 高维空间中的高斯可认证机器遗忘:基于假设检验的方法
- Hubble:推进大语言模型记忆研究的模型套件
- 基于注意力平滑的大语言模型机器遗忘方法Saleh Zare Zade, Xiangyu Zhou, Sijia Liu 等OpenReview
- 警惕开源大模型微调:私有微调数据可能被隐蔽窃取Zhexin Zhang, Yuhao Sun, Junxiao Yang 等OpenReview
- 超越成员资格:差分隐私中增删相邻关系的局限性Gauri Pradhan, Joonas Jälkö, Santiago Zanella-Beguelin 等OpenReview
- 多任务学习中共享表征的黑盒隐私攻击John Abascal, Nicolás Berrios, Alina Oprea 等OpenReview
- 防御嵌入反演攻击的概念感知隐私机制Yu-Che Tsai, Hsiang Hsiao, Kuan-Yu Chen 等OpenReview
- 筛选泄露:针对机器学习数据筛选的成员推断攻击Dariush Wahdany, Matthew Jagielski, Adam Dziedzic 等OpenReview
- 瓦解层级推理:多模态推理模型地理隐私的对抗保护Jiaming Zhang, CHE WANG, Yang Cao 等OpenReview
- 镜头下的开盒:揭示多模态大推理模型的位置隐私泄露Weidi Luo, Tianyu Lu, Qiming Zhang 等OpenReview
- DP-Fusion:面向大语言模型的Token级差分隐私推理
- 消除还是隐藏?抑制虚假遗忘神经元以实现鲁棒机器遗忘Nakyeong Yang, Dong-Kyum Kim, Jea Kwon 等OpenReview
- FaLW:面向长尾遗忘学习的遗忘感知损失重加权Liheng Yu, Zhe Zhao, Yuxuan Wang 等OpenReview
- 利用知识不对称性从检索增强生成系统中细粒度提取隐私Yufei Chen, Yao Wang, Haibin Zhang 等OpenReview
- HiddenEcho:利用隐藏状态校正缓解差分隐私LLM的噪声放大Wenhao Li, Kunhao Li, Lei YangOpenReview
- Hot PATE:面向多样化生成任务的分布隐私聚合Edith Cohen, Benjamin Cohen-Wang, Xin Lyu 等OpenReview
- 基于信息论成员推断的大模型记忆细粒度量化评估Jiashu Tao, Reza ShokriOpenReview
- 知识外部化:多模态大语言模型的可逆遗忘与模块化检索Jiaqi Li, Zihan You, Ruoyan Shen 等OpenReview
- 标签平滑提升机器遗忘学习效果Zonglin Di, Zhaowei Zhu, Jinghan Jia 等OpenReview
- 可学习性与隐私脆弱性纠缠于少数关键权重Xingli Fang, Jung-Eun KimOpenReview
- 基于模型自身信念的大模型机器遗忘Kemou Li, Qizhou Wang, Yue Wang 等OpenReview
- 评估大语言模型物理世界隐私意识的基准Xinjie Shen, Mufei Li, Pan LiOpenReview
- 针对微调扩散语言模型的成员推断攻击Yuetian Chen, Kaiyuan Zhang, Yuntao Du 等OpenReview
- 锐度感知最小化(SAM)的成员隐私泄露风险Young In Kim, Andrea Agiollo, Pratiksha Agrawal 等OpenReview
- 通过免遗忘集遗忘学习缓解隐私风险
- MOAI:面向非交互式安全 Transformer 推理的模块优化架构Linru Zhang, Xiangning Wang, Jun Jie Sim 等OpenReview
- 模型崩溃是大语言模型机器遗忘的特性而非缺陷Yan Scholten, Sophie Xhonneux, Leo Schwinn 等OpenReview
- 用于大语言模型隐私与数据审计的自然标识符
- 无需文本描述的模型拟合嵌入成员推断攻击Joonsung Jeon, Woo Jae Kim, Suhyeon Ha 等OpenReview
- 面向大语言模型隐私保护提示的数据最小化落地框架Jijie Zhou, Niloofar Mireshghallah, Tianshi LiOpenReview
- 利用元梯度下降优化金丝雀样本以进行隐私审计Matteo Boglioni, Terrance Liu, Andrew Ilyas 等OpenReview
- PE-SGD:通过文本梯度子空间演化实现的差分隐私深度学习Tianyuan Zou, Zinan Lin, Sivakanth Gopi 等OpenReview
- Pisces:支持双路检索的基于密码学的隐私RAG框架Xiaojian Liang, Lushan Song, Shishuai Du 等OpenReview
- 超越像素的隐私:面向隐私保护视频理解的潜空间匿名化Joseph Fioresi, Ishan Rajendrakumar Dave, Mubarak ShahOpenReview
- 联邦学习中针对源推断攻击的防御保护Andreas Athanasiou, Kangsoo Jung, Catuscia PalamidessiOpenReview
- 扩散模型中记忆与泛化的可证明分离
- 减少信息依赖不能保障训练数据隐私:对抗非鲁棒特征才是根源Rasmus Torp, Shailen Smith, Adam BreuerOpenReview
- 基于群体相对策略优化的强化遗忘学习Efstratios Zaradoukas, Bardh Prenkaj, Gjergji KasneciOpenReview
- 无需保留数据的样本贡献抑制机器遗忘学习
- RESFL:平衡隐私、公平与效用的负责任联邦学习框架Dawood Wasif, Terrence J Moore, Jin-Hee ChoOpenReview
- 重新思考良性再学习:句法是遗忘失效的隐藏驱动Sangyeon Yoon, Hyesoo Hong, Wonje Jeung 等OpenReview
- ReTrace:基于强化学习的机器遗忘数据重构攻击Mengyao Ma, Shuofeng Liu, Jason Xue 等OpenReview
- 通过模拟搜索 LLM Agent 的隐私风险Yanzhe Zhang, Diyi YangOpenReview
- 基于无条件分数的扩散模型安全推理Jaeyun Song, Geondo Park, Uigyu Kim 等OpenReview
- 感知锐度的机器遗忘Haoran Tang, Rajiv KhannaOpenReview
- 无声泄露:针对RAG系统的隐式知识提取攻击Yuhao Wang, Wenjie Qu, Shengfang Zhai 等OpenReview
- SMOTE与镜花水月:揭示合成少数类过采样的隐私泄露风险Georgi Ganev, MohammadReza Nazari, Rees Davison 等OpenReview
- 别追踪我!大语言模型属性推断攻击的主动防御Dong Yan, Jian Liang, Ran He 等OpenReview
- Tab-MIA:针对大语言模型表格数据的成员推断攻击基准数据集
- 纵向联邦学习中面向隐私保证的标签遗忘学习Hanlin Gu, Hong Xi Tae, Lixin Fan 等OpenReview
- 遗忘并非无痕:通过大模型输出检测机器遗忘痕迹Yiwei Chen, Soumyadeep Pal, Yimeng Zhang 等OpenReview
- WARP:用于抗攻击遗忘协议的权重瞬移防御Mohammad mahdi Maheri, Xavier Cadet, Peter Chin 等OpenReview
- 利用基于秩的均匀性检验审计黑盒大语言模型 APIXiaoyuan Zhu, Yaowen Ye, Tianyi Alex Qiu 等OpenReview
危险能力
4- 通过在受护栏模型输出上微调诱导危险能力Jackson Kaunismaa, John Hughes, Christina Q Knight 等OpenReview
- GeneBreaker:基于致病性引导的DNA语言模型越狱攻击
- PropensityBench:基于Agent方法评估大模型的潜在安全倾向Udari Madhushani Sehwag, Shayan Shabihi, Alex McAvoy 等OpenReview
- SoSBench:六大高危科学领域的大模型安全对齐基准
- 真实网络渗透测试中AI智能体与人类专业人员的对比评估Justin W Lin, Eliot Krzysztof Jones, Donovan Julian Jasper 等OpenReview
- HackWorld:评估计算机使用Agent利用Web应用漏洞的能力
- RESCUE:检索增强的安全代码生成框架Jiahao Shi, Tianyi ZhangOpenReview
- Deep Ignorance:过滤预训练数据为开源权重 LLM 构建抗篡改防护Kyle O'Brien, Stephen Casper, Quentin Gregory Anthony 等OpenReview
- 评估开源权重前沿大语言模型的最坏情况风险Eric Wallace, Olivia Watkins, Miles Wang 等OpenReview
- 单样本安全修复:仅用单个样本修复微调后的大模型Jiawen Zhang, Tony He, Kejia Chen 等OpenReview
- 安全子空间并非线性独立:微调案例研究Kaustubh Ponkshe, Shaan Shah, Raghav Singhal 等OpenReview
- 自毁灭语言模型:抵御有害微调攻击Yuhui Wang, Rongyi Zhu, Ting WangOpenReview
红队
9- ARMs:面向多模态模型的即插即用自适应红队智能体Zhaorun Chen, Xun Liu, Mintong Kang 等OpenReview
- Auto-RT:用于大语言模型红队测试的自动越狱策略探索yanjiang liu, Shuheng Zhou, Yaojie Lu 等OpenReview
- CAGE:跨文化自适应红队基准生成框架
- 基于能力的大模型红队测试标度律趋势Alexander Panfilov, Paul Kassianik, Maksym Andriushchenko 等OpenReview
- 你的大模型有多危险?多轮对话中灾难性风险的统计认证Chengxiao Wang, Isha Chaudhary, Qian Hu 等OpenReview
- RedCodeAgent:针对多种代码 Agent 的自动化红队 AgentChengquan Guo, Chulin Xie, Yu Yang 等OpenReview
- SocialHarmBench:揭示大语言模型在社会危害请求下的脆弱性Punya Syon Pandey, Lê Hải Sơn, Devansh Bhardwaj 等OpenReview
- STAR:策略驱动的大语言模型自动化越狱红队测试Jianing Liu, Qingming Li, Jiahao Chen 等OpenReview
- 面向红队攻击的树结构对话强化策略优化Ruohao Guo, Afshin Oroojlooy, Roshan Sridhar 等OpenReview