顶会安全论文
共 377 篇
越狱与攻击
50- Jailbreak Foundry:从论文到可运行攻击的可复现基准
- Trojan-Speak:通过对抗性微调零越狱代价绕过宪法分类器
- 当提示变为视觉:针对大型图像编辑模型的视觉中心越狱攻击
- “有人藏了它!”:针对 LLM 检索的查询无关黑盒攻击
- 基于组合技能的 LLM 攻击博弈论分析
- 声学干扰:利用声学潜在语义对大型音频语言模型的通用越狱Yanyun Wang, Yu Huang, Zi Liang 等OpenReview
- 自适应探针式 Steering 实现鲁棒 LLM 越狱Junxi Chen, Junhao Dong, Xiaohua XieOpenReview
- 基于隐式神经表示的分类器的对抗鲁棒性研究
- 用自适应 SVD 结构化对抗对齐攻击灰盒大型视觉语言模型
- 基于决策的对抗攻击中零阶法向量估计的偏差分析
- 协作式 MARL 的预算高效攻击与鲁棒性训练Junyong Jiang, Xin Yuan, Longhe Lin 等OpenReview
- DART:针对闭源多模态大模型对抗攻击的分布感知自适应关系迁移
- DDGA:面向视觉语言模型可迁移对抗攻击的 Dirichlet 分布梯度聚合
- 剖析安全回路:面向VLM可迁移对抗攻击的神经元干预Chunlong Xie, Kangjie Chen, Shangwei Guo 等OpenReview
- 从相似性到脆弱性:针对大模型语义缓存的键碰撞攻击Zhixiang Zhang, Zesen Liu, Yuchong Xie 等OpenReview
- Furina:基于分片不确定性驱动的拒答不稳定性越狱攻击Tongxi Wu, Jian Zhang, Yang GaoOpenReview
- 贪心坐标扩散:基于扩散引导的高效且语义连贯对抗攻击Bohdan Turbal, Blossom Metevier, Max Springer 等OpenReview
- 充耳不闻?注意力感知的隐蔽黑盒对抗性音频攻击
- ImpText:隐式文本推理基准与工具增强框架
- 诱导过度思考:基于分层遗传算法的黑盒大语言推理模型DoS攻击Shuqiang Wang, Wei Cao, Jiaqi Weng 等OpenReview
- 通过视觉模态越狱视觉语言模型
- 多样性越低越不安全:大语言模型测试时扩展的隐性普遍风险
- 线性集成可抹除水印:LLM 分布扰动水印的脆弱性
- Lookahead-GCG:基于随机 Nesterov 优化的通用多模型越狱攻击Rong Feng, Haohan Zhao, Shiqin Tang 等OpenReview
- 基于双域自然投影的低算力水印移除Pragati Shuddhodhan Meshram, Varun ChandrasekaranOpenReview
- 低秩与稀疏即所需:探索鲁棒分层潜在子空间用于可迁移对抗攻击Shuangshuang Pu, Wen Yang, Min Li 等OpenReview
- MADA-Attack:针对视觉语言模型的可迁移多模态注意力分散对抗攻击Zhihan Qin, Jiahao Chen, Chunyi Zhou 等OpenReview
- Metis:通过自进化元认知策略优化学习越狱 LLMHuilin Zhou, Jian Zhao, Yilu Zhong 等OpenReview
- MoCo-EA:利用对抗模态连通性实现高效进化攻击Hyo Seo Kim, Gang Luo, Can Chen 等OpenReview
- MultiBreak:用于评估大模型安全性的多轮越狱评测基准Jialin Song, Xiaodong Liu, Weiwei Yang 等OpenReview
- 新型“广撒网”越狱攻击威胁大模型安全
- OBJVanish:提示驱动生成物理可实现的3D激光雷达隐身物体
- 视觉 token 压缩下大型视觉语言模型的对抗鲁棒性
- OrchJail:以编排引导的 fuzzing 越狱调用工具的文生图 AgentJianming Chen, Yawen Wang, Junjie Wang 等OpenReview
- 刻画非理性智能体:序列越狱中 LLM 行为的认知建模Xikang Yang, biyu zhou, Xuehai Tang 等OpenReview
- 推理作为攻击面:针对大语言模型的自适应进化思维链越狱Jianan Li, Simeng Qin, Xiaojun Jia 等OpenReview
- 沿结构传播扰动:面向异构表格数据的似然约束对抗攻击Zhengjie Zhou, Jiahuan Yan, Boqun Ma 等OpenReview
- 语义路由器:利用单一对抗扰动劫持多模态大模型的可行性Changyue Li, Jiaying Li, Youliang Yuan 等OpenReview
- 稀疏模型与稀疏安全:混合专家大语言模型中的不安全路由Yukun Jiang, Hai Huang, Mingjie Li 等OpenReview
- 稀疏Token足矣:基于Token感知梯度优化的音频语言模型越狱Zheng Fang, Xiaosen Wang, Shenyi Zhang 等OpenReview
- SpatialJB:文本空间分布艺术成为 LLM 护栏的“越狱钥匙”Zhiyi Mou, Jingyuan Yang, ZEHENG QIAN 等OpenReview
- 多模态大模型的语音-音频组合攻击与SALMONN-Guard防御Yudong Yang, Xuezhen Zhang, Zhifeng Han 等OpenReview
- 多轮语言模型交互中状态依赖的安全失效Pengcheng Li, Jie Zhang, Tianwei Zhang 等OpenReview
- 哈密顿生成框架下的结构化多步越狱Zihan Zhou, Yang Zhou, Jianghai Yu 等OpenReview
- 特洛伊知识:通过无害提示编织与自适应树搜索绕过商用LLM护栏Rongzhe Wei, Peizhi Niu, Xinjie Shen 等OpenReview
- TRAP:利用对抗补丁劫持VLA思维链推理Zhengxian Huang, Wenjun Zhu, Haoxuan Qiu 等OpenReview
- TSFAdv:面向时间序列预测的频域引导黑盒对抗攻击Qizhuo Han, Xiangrui Cai, Sihan Xu 等OpenReview
- 释放傅里叶形状表征能力以攻击红外目标检测
- VERA-V:基于变分推断的视觉语言模型越狱框架
- 攻破CLIP测试时防御的关键假设:基于分布差异操控的自适应攻击
提示注入
8- 安全与保真度权衡:间接提示注入防御的隐性代价
- 多步LLM智能体攻击的因果检测
- CausalArmor:基于因果归因的高效间接提示注入护栏Minbeom Kim, Mihir Parmar, Phillip Wallis 等OpenReview
- AI 审稿人看到全貌了吗?攻击与防御多模态同行评审
- TRAP!面向Web智能体的任务重定向说服评测基准Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki 等OpenReview
- 定位与消除:基于梯度引导Token抑制抵御视觉提示注入攻击Dongpeng Zhang, Ke Ma, Yangbangyan Jiang 等OpenReview
- 提示注入的本质是角色混淆
- RedVisor:基于零拷贝KV缓存复用的推理感知提示注入防御Mingrui Liu, Sixiao Zhang, Cheng Long 等OpenReview
Agent 安全
24- A-MemGuard:大模型Agent记忆的主动防御框架Qianshan Wei, Tengchao Yang, Yaochen Wang 等OpenReview
- AdvEvo-MARL:通过多智能体对抗共进化内化安全防御
- AgentLAB:大模型智能体抵御长程攻击评测基准
- AIR:通过事件响应机制提升大模型智能体安全性Zibo Xiao, Jun Sun, Junjie ChenOpenReview
- ANCHOR:针对CLI智能体真实世界危害的自动化对齐审计框架
- 架构设计对多智能体系统安全至关重要Ben Hagag, William L. Anderson, Christian Schroeder de Witt 等OpenReview
- AutoRAS:基于原语表征学习鲁棒智能体系统
- 开口即得:探索性代码智能体窃取前沿大模型系统提示词Xiang Zheng, Yutao Wu, Hanxun Huang 等OpenReview
- 学会何时行动或拒答:守护智能体多步工具调用的安全性
- MaMa:面向安全智能体系统设计的博弈论方法Jonathan Nöther, Adish Singla, Goran RadanovicOpenReview
- MemIncept:通过协作式隐蔽记忆注入操纵大语言模型智能体Nan Yan, Qian Lou, Jiarong XingOpenReview
- OTora:面向LLM智能体推理级拒绝服务攻击的统一红队框架
- PragLocker:用不可移植提示词在不可信部署中保护 Agent 知识产权Qinfeng Li, Yuntai Bao, Jianghui Hu 等OpenReview
- SafeSearch:基于大语言模型的搜索智能体自动化红队测试Jianshuo Dong, Sheng Guo, Hao Wang 等OpenReview
- 通过节点贡献反向传播防御多智能体系统恶意污染Chengcan Wu, Zhixin Zhang, Mingqian Xu 等OpenReview
- 推测性安全蜜罐:面向多轮智能体攻击的主动防御Zezhong WANG, Xueyang Tang, RUI LIAN 等OpenReview
- 海绵工具攻击:针对工具增强智能体推理的隐蔽效率拒绝攻击Qi Li, Xinchao WangOpenReview
- 三思而后行:通过思维修正增强智能体行为安全Changyue Jiang, Wenqi Zhang, Xudong Pan 等OpenReview
- 三思而后行:通过隔离规划保护LLM智能体免受工具描述投毒Shanghao Shi, Xiao Wang, Chaoyu Zhang 等OpenReview
- 多轮交互更不安全:工具使用智能体的多轮安全风险基准与防御Xu Li, Simon Yu, Minzhou Pan 等OpenReview
- 视觉说服:什么会影响视觉语言模型的决策?
- 当行动偏离任务:计算机使用Agent的未对齐行动检测与纠正Yuting Ning, Jaylen Jones, Zhehao Zhang 等OpenReview
- 良性输入引发严重危害:诱发计算机使用Agent的不安全非预期行为Jaylen Jones, Zhehao Zhang, Yuting Ning 等OpenReview
- 当基于嵌入的防御失效:反思基于大模型的多智能体系统安全Lingxi Zhang, Guangtao Zheng, Hanjie ChenOpenReview
防御与护栏
75- 概念消除引导:面向安全扩散采样的证据校准负向引导
- GEM:基于对比速度匹配的Rectified Flow模型几何概念擦除
- 以越狱促保护:通过临时越狱实现大模型安全微调的缓冲与强化
- 模块化预训练赋能双重用途AI的能力访问控制
- 扩散模型的正交概念擦除
- 基于非合作博弈的语言模型安全对齐
- 通过内部信息分解保障多模态AI安全
- 去噪扩散采样的对抗攻击与防御Zhao-Rong Lai, Xiwen Yuan, Jian WengOpenReview
- 超图神经网络的对抗攻击与鲁棒训练
- 面向鲁棒扩散大语言模型遗忘的对抗强化学习
- BARRED:基于非对称辩论的定制策略安全护栏合成训练
- BlueCodeAgent:基于自动红队的代码生成AI蓝队防御智能体Chengquan Guo, Yuzhou Nie, Chulin Xie 等OpenReview
- 基于混合随机平滑的异构扰动下可信鲁棒性
- 通过在线自我博弈强化学习追踪移动目标以构建更安全的语言模型
- 前沿图像生成模型的概念移除
- 用于平衡安全对齐的可配置奖励模型
- 对比推理对齐:基于隐藏表示的强化学习Haozheng Luo, Yimin Wang, Jiahao Yu 等OpenReview
- 对比谱校正:CLIP 零样本对抗鲁棒性的测试时防御Sen Nie, Jie Zhang, Zhuo Wang 等OpenReview
- D-Judge:利用保持语义的输出重写瓦解多轮越狱攻击Huanli Gong, Zhipeng Wei, Yu Fu 等OpenReview
- 基于去噪表示的数据归因检测并过滤不安全训练数据
- 通过序列熵变检测流畅的优化型对抗提示词Mohammed Alshaalan, Miguel R. D. RodriguesOpenReview
- 解耦意图与角色:用于角色无关安全对齐的对抗自博弈
- 可区分删除:统一知识擦除与拒答的 LLM 遗忘
- 混合空间感知随机化防御能否提升经验与认证对抗鲁棒性?
- 远离分界线:基于边界引导的过滤生成安全微调Sarah Ball, Andreas HauptOpenReview
- 基于多层潜在原型的高效 LLM 内容审核Maciej Chrabaszcz, Filip Szatkowski, Bartosz Wójcik 等OpenReview
- EMBGuard:为具身智能体构建危险感知护栏以实现安全规划Dongwook Choi, Taeyoon Kwon, Bogyung Jeong 等OpenReview
- 评估情境违法性:前沿大模型在公司法场景下的合规表现
- Fleet:少样本即可实现有效的 AI 生成图像检测Jiaan Wang, Sirui Liu, Yu Li 等OpenReview
- ForceForget:通过强化概念消除提升文生图模型安全性Dong Han, Yong LiOpenReview
- HyperPotter:在音频深度伪造检测中利用高阶交互Qing Wen, Haohao Li, Zhongjie Ba 等OpenReview
- 针对语言模型突现不对齐的训练期防御David Kaczér, Magnus Jørgenvåg, Clemens Vetter 等OpenReview
- 通过验证将安全理解内化到大型推理模型中
- LALM-as-a-Judge:多轮语音对话安全评测基准
- 从错误中学习:面向安全代码大模型的树状自我博弈Wenqi Chen, Ziyan Zhang, Wang Bin 等OpenReview
- 为合规学习高效护栏Xiaofei Wen, Wenjie Jacky Mo, Yanan Xie 等OpenReview
- 在生成模型潜空间中学习水印Sylvestre-Alvise Rebuffi, Tuan A. Tran, Valeriu Lacatusu 等OpenReview
- MAGIC:协同演化的攻防对抗博弈以实现稳健 LLM 安全
- Meerkat-VL:通过感知推理与自验证实现多模态 LLM 的隐式风险安全对齐Peicheng Zhou, Chuanbin Liu, Shancheng Fang 等OpenReview
- MESA:通过去中心化专业能力改进MoE模型安全对齐Yitong Sun, Yao Huang, Teng Li 等OpenReview
- 通过自适应安全上下文学习缓解 LLM 对齐中的安全-效用权衡Yanbo Wang, Minzheng Wang, Jian Liang 等OpenReview
- 基于表示空间可分性的多语言安全对齐
- 基于稀疏权重编辑的多语言安全对齐
- NExT-Guard:无需Token级标注的流式安全护栏
- OSCS:面向大语言模型安全且具备可证明误接受率控制的在线选择Zirui Hu, Zheng Zhang, Yingjie Wang 等OpenReview
- PlugGuard:基于潜在动力学引导风险检测的大模型流式护栏Xiaodan Li, Mengjie Wu, Yao Zhu 等OpenReview
- 抵御对抗攻击的概率鲁棒性认证
- RADAR:动态防御 RAG 的检索污染Ziyuan Chen, Yueming Lyu, Yi Liu 等OpenReview
- RBCBF:基于风险引导回退与屏障控制的解码期安全对齐
- Reflector:通过内化逐步反思防御间接越狱攻击Jiachen Ma, Jiawen Zhang, Xiangtian Li 等OpenReview
- 重新思考基于 IBP 的认证训练评估范式
- 风险感知注入:不损失效用校准视觉语言模型安全性Mengxuan Wang, Yuxin Chen, Gang Xu 等OpenReview
- 奖励投毒攻击下的鲁棒上下文强化学习
- 基于迭代自改进码本的安全自回归图像生成Yunqi Xue, Zhijiang Li, Philip Torr 等OpenReview
- SafeCompass:基于推理时安全信号的动态思维链 steering
- SafeHarbor:基于分层记忆增强护栏的 LLM Agent 安全决策边界
- SafeSpec:基于动态反思采样的快速且安全LLM推理
- Safety Game:基于约束优化的黑盒大语言模型推理期对齐Tuan Nguyen, Long Tran-ThanhOpenReview
- 推理模型安全恢复仅需早期几步引导
- SARSteer:基于安全消融拒答引导的大型音频语言模型安全防护Weilin Lin, Jianze Li, Hui Xiong 等OpenReview
- 自校准一致性提升视觉语言模型的对抗鲁棒性
- 超越支撑集的 Steering:基于无监督越狱激活模拟的对抗训练LUOYU CHEN, Weiqi Wang, Zhiyi Tian 等OpenReview
- 用子模优化实现鲁棒语言模型对齐的最小数据增强
- 无需训练的测试时解毒
- 文本扩散模型的安全感知去噪器Amman Yusuf, Zhejun Jiang, Mijung ParkOpenReview
- 迈向安全的量化感知微调:理解并缓解安全对齐退化
- 面向大语言模型的上下文不变安全对齐Yixu Wang, Yang Yao, Xin Wang 等OpenReview
- 文生图模型中面向随机种子鲁棒的安全对齐Zhenyu Wu, Yao Huang, Shouwei Ruan 等OpenReview
- 追踪拒答动态:利用潜在拒答轨迹实现稳健越狱检测
- 利用蜜罐训练:重塑大语言模型在对抗攻击下的失效模式
- 理解并缓解 VLM 中 Token 剪枝引入的安全漏洞Shuailong Wang, Xinyu Lyu, Shengming Yuan 等OpenReview
- UnHype:CLIP 引导的超网络动态 LoRA 遗忘
- 限制不安全信息流的多模态DiT统一安全上下文图像生成Xiang Yang, Feifei Li, Mi Zhang 等OpenReview
- 统一文本评分模型的对抗鲁棒性与对抗训练
- Z-Erase:单流扩散 Transformer 中的概念擦除Nanxiang Jiang, Zhaoxin Fan, Baisen Wang 等OpenReview
对齐
40- 对齐预训练:语料中的AI论述引发自我实现的(非)对齐
- BrokenMath:大语言模型定理证明中谄媚行为的评测基准
- 压力见品行:大语言模型深度行为对齐评测
- 面向冲突目标的无奖励模型对齐
- 迈向稳定的价值对齐:引入独立模块实现一致的价值引导
- VALUEFLOW:面向 LLM 的多元可控价值观对齐
- 追求能力的强化学习训练所引发的对齐风险Yujun Zhou, Yue Huang, Han Bao 等OpenReview
- 对齐篡改:人类反馈强化学习如何被利用以放大未对齐偏差Dongyoon Hahm, Dylan Hadfield-Menell, Kimin LeeOpenReview
- 自动发现大语言模型奖励模型偏差Zifan Wang, Iván Arcuschin, Arthur ConmyOpenReview
- BLOCK-EM:通过隐空间阻断预防突现未对齐
- 面向可扩展监督的保守性校准William Overman, Mohsen BayatiOpenReview
- 协同分歧消解:面向可扩展监督的新范式Yuyang Jiang, Chacha Chen, Teng Wu 等OpenReview
- 一致性训练会加剧模型对齐失效David Demitri Africa, Arathi ManiOpenReview
- 可纠正性变换:构造接受更新的目标Rubi HudsonOpenReview
- 发现 LLM 对齐中的隐含目标Edward Chen, Sanmi Koyejo, Carlos GuestrinOpenReview
- 基于价值码本的LLM文化价值对齐开放式分布评估Jaehyeok Lee, Xiaoyuan Yi, Jing Yao 等OpenReview
- 价值表达的双重机制:大语言模型中的内在价值与提示价值
- 竞争带来的涌现对齐
- FormalJudge:面向智能体监督的形式化神经符号范式Jiayi Zhou, Yang Sheng, Hantao Lou 等OpenReview
- GenAlign:基于生成式奖励模型的多模态大模型统一对齐框架Jingyu Zhang, Kun Yang, Ming Wen 等OpenReview
- 一触即发的对齐:黑盒评估无法保证模型更新后的对齐状态
- RLHF如何放大语言模型的谄媚行为Itai Shapira, Gerdus Benade, Ariel D. ProcacciaOpenReview
- 如何避免辩论:基于双高效交互式证明的可扩展AI安全Liyan Chen, Yael Tauman Kalai, Zoe XiOpenReview
- 利用机器遗忘实现高性价比的大模型偏好对齐XiaoHua Feng, Yuyuan Li, HuWei Ji 等OpenReview
- 基于能量校准的多适配器表征干预(MARI)
- PersistBench:大语言模型何时应遗忘长期记忆?Sidharth Pulipaka, Oliver Chen, Manas Sharma 等OpenReview
- PICACO:基于总相关优化的多元上下文价值对齐Han Jiang, Dongyao Zhu, Xiaoyuan Yi 等OpenReview
- 深度神经网络中潜在智能体子结构的概率建模Su Hyeong Lee, Risi Kondor, Richard NgoOpenReview
- 量化地缘文化价值观对多元安全对齐的显著性Arkadiy Saakyan, Charvi Rastogi, Lora AroyoOpenReview
- 边界推理:通过测试期深思提升规范对齐
- 通过选择性几何控制重新审视 LLM 安全对齐的鲁棒性Yonghui Yang, Wenjian Tao, Jilong Liu 等OpenReview
- 基于斯塔克尔伯格博弈视角的推理期对齐奖励塑造
- 基于可验证与不可验证奖励的同步多目标对齐Yiran Jenny Shen, Yu Xia, Jonathan Daniel Chang 等OpenReview
- Split Personality Training:通过替代人格揭示潜在知识Florian Dietz, William Wale, Oscar Gilg 等OpenReview
- 偏好优化中的虚假相关学习:机理、影响与平局训练缓解方法
- 监督博弈:协同平衡AI智能体安全性与自主性的学习方法William Overman, Mohsen BayatiOpenReview
- 重对齐问题:当大模型中的“对”变成“错”Aakash Sen Sharma, Debdeep Sanyal, Manodeep Ray 等OpenReview
- 传递性与循环性:用于动态大语言模型对齐的显式偏好分解Yucong Huang, Xiucheng Li, Kaiqi Zhao 等OpenReview
- 人工筛选何时适得其反:多模型自消耗循环下的偏好对齐Yang Zhang, Xiukun Wei, Xueru ZhangOpenReview
- 谁在主导?真实 LLM 使用中的用户失能模式
欺骗与谋划
10- 对研究人员的谄媚驱动了表演性未对齐
- 混淆图谱:在带有欺骗探针的RLVR中描绘诚实性涌现
- 你的 Agent 会向上欺骗吗?Dadi Guo, Qingyu Liu, Dongrui Liu 等OpenReview
- Debate with Images:检测多模态大模型中的欺骗行为Sitong Fang, Shiyi Hou, Kaile Wang 等OpenReview
- DecepChain:诱导大语言模型生成欺骗性思维链推理Wei Shen, Han Wang, Haoyu Li 等OpenReview
- 探索作弊:大语言模型能学会抵抗强化学习训练吗?Eyon Jang, Damon Falck, Joschka Braun 等OpenReview
- 前沿模型具备极低概率执行特定动作的能力Alex Serrano, Wen Xing, David Lindner 等OpenReview
- OpenDeception:通过多智能体模拟学习人机交互中的欺骗与信任Yichen Wu, Qianqian Gao, Xudong Pan 等OpenReview
- 前沿模型中的同伴保护行为Yujin Potter, Nicholas Crispino, Vincent Siu 等OpenReview
- 同题异谎:基于跨上下文一致性的黑盒装傻检测Lin Yulong, Pablo Bernabeu-Perez, Benjamin Arnav 等OpenReview
奖励作弊
11- 通过贝叶斯非负奖励建模缓解 RLHF 中的奖励作弊
- 基于对比分析在代码环境中评测奖励作弊检测
- CapBencher:为大模型基准测试内置测试集过拟合警报Takashi Ishida, Thanawat Lodkaew, Ikko YamaneOpenReview
- 面向RLHF鲁棒奖励建模的因式分解因果表征学习
- 梯度正则化缓解RLHF与可验证奖励中的奖励作弊
- 偏见接踵而至:语言奖励模型中的机理性奖励塑形与持久偏见Daniel Fein, Max Lamparth, Violet Xiang 等OpenReview
- 超越语义的实时对齐奖励模型
- 无需修改规格:重上下文化缓解规格博弈
- 奖励作弊基准:衡量工具调用大模型智能体的作弊利用Kunvar ThamanOpenReview
- 奖励受袭:分析过程奖励模型的鲁棒性与可作弊性
- 无偏原则与鲁棒奖励:抑制强化学习中的奖励作弊
- 监控可监控性:评估推理模型的思维链监控能力
- 自然场景下的思维链推理并不总是忠实的
- 可监控性作为免费馈赠:RLVR如何自发对齐推理过程
- 权衡扬帆与压舱:应对大推理模型扩展推理空间中的有害知识泄漏Qibing Ren, Xinhao Song, Ke Fan 等OpenReview
- 过度思考:放大推理权重以提取模型习得的秘密
- 大型推理模型思维链谄媚的实时监测与校准
- 推理模型难以控制其思维链Chen Yueh-Han, Robert McCarthy, Bruce W. Lee 等OpenReview
可解释性
17- 越狱攻击下的鲁棒有害特征:来自大模型注意力头功能分工的机制性证据
- Assistant Axis:定位并稳定语言模型的默认人格
- 超越外部监控器:提升大语言模型透明度以实现更易监控Guanxu Chen, Jing Shao, Tao Luo 等OpenReview
- 用于忠实表示干预的概念浓缩方法
- CorrSteer:基于相关稀疏自编码器特征的生成期大模型引导
- CoT并非真实之链:虚假新闻生成中推理大模型的内部机制分析Zhao Tong, Chunlin Gong, Yiping ZHANG 等OpenReview
- 大语言模型对激活干预的内生抵抗机制
- 内省适配器:训练LLM如实报告自身学到的行为
- 大语言模型的局部线性赋能基于线性最优控制的激活干预
- 基于功能归因的机制异常检测
- 单一探针无法捕获所有欺骗:迈向针对性欺骗检测
- SAEmnesia:利用有监督稀疏自编码器擦除扩散模型中的概念
- SafeSeek:语言模型安全回路的通用归因框架
- 利用概念消融微调引导大模型分布外泛化
- SteeringSafety:大语言模型多维度安全表征干预评测基准Vincent Siu, Nicholas Crispino, David Park 等OpenReview
- TraceRouter:基于路径级干预的大模型鲁棒安全防御框架Chuancheng Shi, Shangze Li, Wenjun Lu 等OpenReview
- 谁在迁移安全?识别并定位跨语言共享安全神经元Xianhui Zhang, Chengyu Xie, Linxia Zhu 等OpenReview
- 面向大语言模型智能体谋划行为的宪政黑盒监控Simon Storf, Rich Barton-Cooper, James Peters-Gill 等OpenReview
- 信息访问权限如何影响大模型监控器检测破坏行为的能力Rauno Arike, Raja Mehta Moreno, Rohan Subramani 等OpenReview
- 用弱监督训练消除 LLM 的 sandbagging
后门与投毒
37- 从中毒到觉察:培养 LLM 的后门自我觉察
- Rapid Poison:针对快速响应防护框架的实用投毒攻击
- 天使还是恶魔:探究可塑性干预对深度强化学习后门威胁的影响Oubo Ma, Ruixiao Lin, Yang Dai 等OpenReview
- 基于累积熵的抗后门核心子集选择Qi Zhao, Christian WressneggerOpenReview
- Attention Hijacking:通过语义锚点对文本数据集蒸馏植入后门
- 拓宽后门盆地:理解大语言模型后门崩溃机制并实现持久后门Xingyi Zhao, Tian Xie, Xiaojun Qi 等OpenReview
- BYORn:自举自身响应以防御大型视觉语言模型的后门攻击
- CBV:基于扩散模型的视觉语言模型干净标签后门攻击Ji Guo, xiaolong qin, Cencen Liu 等OpenReview
- 图神经网络抵御标签与结构投毒的可认证防御
- 联邦学习持久后门攻击:触发器优化与脆弱参数对齐耦合
- DF-LoGiT:面向Vision Transformer的无数据逻辑门控后门攻击
- 双分支鲁棒不可学习样本Xianlong Wang, Hangtao Zhang, Wenbo Pan 等OpenReview
- 针对离线 RLHF 的高效偏好投毒攻击
- 擦除但未遗忘:后门如何破坏概念擦除
- Eyes-on-Me:基于注意力吸引子的可扩展RAG投毒攻击Yen-Shan Chen, Sian-Yao Huang, Cheng-Lin Yang 等OpenReview
- 从内部诊断到外部审计:VLM 驱动的无数据在线后门防御Binyan Xu, Fan Yang, Xilin Dai 等OpenReview
- 从参数到特征空间:模型合并中消除后门任务算术
- 嵌入空间中的捉迷藏:大语言模型的几何隐写与检测Charles Westphal, Keivan Navaie, Fernando RosasOpenReview
- 通过类别子空间正交化提升后门检测器灵敏度
- INDEXGUARD:面向大语言模型安全联邦PEFT的纯索引后门审查
- 基于结构不变锚定的类增量学习持久后门攻击
- 基于代码风格的投毒攻击:面向代码大语言模型的隐蔽后门攻击Khang Tran, Yazan Boshmaf, Issa Khalil 等OpenReview
- PolicyGuard:面向强化学习智能体的测试期单步级后门防御
- 针对检索增强生成的强投毒攻击:揭示重排序器的防御盲区Xiaokun Yang, Jian Liang, Yesheng Liu 等OpenReview
- 安全与效能权衡:抵御数据投毒的鲁棒性研究
- 针对文本到图像扩散模型的语义级后门攻击
- SkillTrojan:面向基于技能智能体系统的后门攻击
- 深度神经网络中统计不可检测的后门
- TCAP:用于多模态大模型微调的无监督三元注意力画像后门检测
- 持续学习抵御数据投毒攻击的理论分析
- 深度网络最小权重扰动理论及其在低秩激活后门攻击中的应用
- 透视隐蔽性:针对RAG投毒攻击的注意力感知防御Sarthak Choudhary, Nils Palumbo, Ashish Hooda 等OpenReview
- TimeGuard:用于时间序列预测后门防御的通道级池化训练Quang Duc Nguyen, Siyuan Liang, Yiming Li 等OpenReview
- TokenSwap:针对大视觉语言模型组合理解能力的后门攻击
- 深度强化学习中面向子空间扰动与轨迹感知的后门攻击
- 揭示隐藏触发器:语言模型中的后门归因
- VENOMREC:多模态 LLM 推荐系统中面向定向推广的跨模态交互投毒
隐私与数据泄露
61- 语言模型能记忆多少内容?
- PRISM:规范不变切空间差分隐私LoRA
- SlaClip:以梯度范数 slack 作为 DP-SGD 自适应裁剪的指示信号
- ACTG-ARL:基于强化学习增强控制的差分隐私条件文本生成Yuzheng Hu, Ryan McKenna, Da Yu 等OpenReview
- 部分模型合并对模型克隆攻击的抵抗力实证研究Tiantong Wu, Yurong Hao, Wei Yang Bryan LimOpenReview
- ASRU:结合激活引导与强化遗忘的多模态大模型机器遗忘Jiahui Guang, Haiyan Wang, Yingjie Zhu 等OpenReview
- 超越样本级遗忘:提升多模态机器遗忘的可靠性Jianzhou Wang, Yirui Wu, Lixin Yuan 等OpenReview
- 协作式阈值水印Tameem Bakr, Anish Ambreth, Nils LukasOpenReview
- 基于文本保持技术的微调大语言模型数据溯源审计
- 通过降低数据归因实现大语言模型机器遗忘
- 用于大语言模型对齐的差分隐私偏好数据合成Fengyu Gao, Jing YangOpenReview
- 散度解码:利用辅助模型实现推理阶段的机器遗忘Humzah Merchant, Bradford LevyOpenReview
- 基于随机裁剪的高效大语言模型差分隐私随机梯度下降Enayat Ullah, Sai Aparna Aketi, Devansh Gupta 等OpenReview
- 通过正则化实现隐私机器学习的高效公开验证Zoë Ruha Bell, Anvith Thudi, Olive Franzese 等OpenReview
- 频域视角下针对扩散模型的成员推断攻击增强Puwei Lian, Yujun Cai, Songze Li 等OpenReview
- 从开源模型中提取对齐数据Federico Barbero, Xiangming Gu, Christopher A. Choquette-Choo 等OpenReview
- 寻找 DoRI:发现扩散模型中残留的训练图像Antoni Kowalczuk, Dominik Hintersdorf, Lukas Struppek 等OpenReview
- 以不确定性遗忘:面向量化神经网络的正交熵遗忘
- 遗忘以知,记忆以用:面向大语言模型的上下文感知遗忘学习Yuefeng Peng, Parnian Afshar, Megan Ganji 等OpenReview
- 从微弱线索到真实身份:评估LLM智能体的推断驱动去匿名化风险Myeongseob Ko, Jihyun Jeong, Sumiran Singh Thakur 等OpenReview
- FUSE:基于频谱均衡的全频段不可学习样本Jiale Cai, Gezheng Xu, Zhihao Li 等OpenReview
- 超越SGD的梯度反演攻击Guangnian Wan, Gongfan Fang, Xinyin Ma 等OpenReview
- 贝叶斯采样如何助力成员推断攻击?
- 能有多难?基于难度感知的多目标机器遗忘Jiangwei Chen, Xinyuan Niu, Rachael Hwee Ling Sim 等OpenReview
- 私有且鲁棒对齐的改进界Wenqian Weng, Yi He, Xingyu ZhouOpenReview
- Leak@k:概率解码下遗忘学习并未让 LLM 真正忘记
- 大道至简:基于极少数据披露的大语言模型几何遗忘学习
- LMCleaner:基于影响传播截断的高效且可认证在线遗忘学习Jie Xu, Zihan Wu, Wenbo Pan 等OpenReview
- 面向未见类别的成员推断攻击Pratiksha Thaker, Neil Kale, Steven Wu 等OpenReview
- MemPot:利用优化蜜罐防御记忆提取攻击Yuhao Wang, Shengfang Zhai, Guanghao Jin 等OpenReview
- MINIM:基于可信本地脱敏的智能体隐私感知最小化视图Hexuan Yu, Chaoyu Zhang, Heng Jin 等OpenReview
- 大语言模型的多语言机器遗忘:迁移、动态与可逆性Chaoyi Xiang, Olga Ohrimenko, Benjamin I. P. Rubinstein 等OpenReview
- MultiPriv:视觉语言模型个人级隐私推理能力评测基准Xiongtao Sun, HUI LI, Jiaming Zhang 等OpenReview
- OptiFluence:隐私金丝雀的原则性设计Mohammad Yaghini, Michael Aerni, Junrui Zhang 等OpenReview
- OSNIP:利用混淆语义零空间平衡大模型推理隐私与效用Zhiyuan Cao, Zeyu Ma, Chenhao Yang 等OpenReview
- PEARL:差分隐私与熵感知的受控语言生成Seongho Joo, Hyukhun Koh, Kyomin JungOpenReview
- 基于偏好校准优化与得分级分布对齐的文生图扩散模型遗忘学习Xiuyuan Wang, Weiming Liu, Hongyu Cai 等OpenReview
- PrivAct:通过多智能体偏好训练内化情境隐私保护
- 隐状态下差分隐私零阶优化的隐私放大Eli Chien, Wei-Ning Chen, Pan LiOpenReview
- Privasis:从零合成最大规模的“公开”隐私数据集Hyunwoo Kim, Niloofar Mireshghallah, Michael Duan 等OpenReview
- 基于差分隐私的隐私且稳定测试时自适应
- PrivCode++:提供全面隐私保障的隐空间条件差分隐私代码生成Zheng Liu, Chen GONG, Terry Yue Zhuo 等OpenReview
- PrivGate:基于潜空间几何调控大语言模型的语境完整性Runshan Hu, Yukun Dong, Yingying Huangfu 等OpenReview
- 在保持可用性的同时可证明防御微调大模型的训练数据提取Tom Segal, Yuval Elovici, Asaf ShabtaiOpenReview
- RECOVER:利用反演鲁棒性检测文生图扩散模型中的未授权数据使用Yanhao Wei, Xiaokang Zhao, Boheng Li 等OpenReview
- 表征遗忘:通过信息压缩实现机器遗忘
- 逆向工程语言模型的模型编辑:揭示更新隐蔽泄露与防御Zhiyu Sun, Minrui Luo, Yu Wang 等OpenReview
- 重新审视针对图神经网络的黑盒链接窃取攻击不对称性Paul Agbaje, Habeeb OlufowobiOpenReview
- 重新审视全同态加密下的 ML 训练:收敛保证、差分隐私与高效算法Yvonne Zhou, Mingyu Liang, Ivan Brugere 等OpenReview
- 先调温后倾斜:基于温度调节与分类器引导的生成模型机器遗忘
- 遗忘与保留的两难:持续学习中的认证遗忘理论Yiting Hu, Lingjie Duan, Qian ZhangOpenReview
- 隐秘风险:基于模态不平衡的多模态联邦学习成员推断攻击chang Ma, Jun Li, Kang Wei 等OpenReview
- 面向异构RAG知识库的全语料重构提取攻击Peiru Yang, Yi Luo, Zhenfeng Gao 等OpenReview
- 基于SGD稳定性的轨迹感知可证明去中心化遗忘Hengliang Wu, Jiale Yang, Shuzhen Chen 等OpenReview
- 扩散模型中的机器遗忘:基于KL散度与似然约束的统一框架
- 遗忘并非删除:探究大语言模型机器遗忘的可逆性Xiaoyu Xu, Xiang Yue, Yang Liu 等OpenReview
- 遗忘并非消除:揭示类别遗忘评估中的隐藏泄露与防御Ali Ebrahimpour-Boroojeny, Yian Wang, Hari SundaramOpenReview
- 非对称数据源下的机器遗忘:利用公开数据改善效用权衡Ahmed Mehdi Inane, Vincent Quirion, Gintare Karolina Dziugaite 等OpenReview
- 机器遗忘的盲区:过度遗忘与 Prototypical Relearning AttackSeungBum Ha, Saerom Park, Sung Whan YoonOpenReview
- Flow Matching的泄露机制:表征插值路径上的成员信号
- ZeroUnlearn:大语言模型中的少样本知识遗忘Yujie Lin, Chengyi Yang, Zhishang Xiang 等OpenReview
- 狐入鸡舍:针对强化学习的供应链后门攻击Shijie Liu, Andrew Craig Cullen, Paul Montague 等OpenReview
- SOPE:面向MCP智能体的情境感知与统计不可区分隐私窃取框架Ruixiao Lin, Qingming Li, Jiahao Chen 等OpenReview
危险能力
4- ABC-Bench:面向生物安全的 Agent 生物能力基准Andrew Bo Liu, Samira Nedungadi, Bryce Cai 等OpenReview
- AutoControl Arena:合成可执行测试环境以评估前沿 AI 风险Changyi Li, Pengfei Lu, Xudong Pan 等OpenReview
- PostTrainBench:大语言模型智能体能否自主完成后训练?
- SafeSci:科学及相关领域的LLM安全评测与增强
- AI Agent 网络安全拒答新框架Eliot Krzysztof Jones, Matt Fredrikson, J Zico KolterOpenReview
- Agora:利用LLM智能体在生产级共识协议中自主检测漏洞
- AutoBaxBuilder:代码安全评测任务的自动构建Tobias von Arx, Niels Mündler, Mark Vero 等OpenReview
- CYBERTEAM:通过标准化威胁搜寻评测LLM辅助网络蓝队能力Yuqiao Meng, Luoxi Tang, Feiyang Yu 等OpenReview
- Co-RedTeam:基于大模型智能体的协同安全漏洞挖掘与利用
- RepetitionCurse:DoS 压力下 MoE 大模型路由失衡的测量与理解Ruixuan Huang, Qingyue Wang, Hantao Huang 等OpenReview
- SecCodePRM:面向代码安全的过程奖励模型Weichen Yu, Ravi Mangal, Yinyi Luo 等OpenReview
- WatchLog:基于多模态大模型的端点检测与响应日志高效可解释推理Hongyi Zhou, Jianfeng Pan, Min Peng 等OpenReview
- Surgery:利用注意力汇聚机制防御大模型有害微调
- 从参数动力学到风险评分:量化大模型微调中的样本级安全退化Xiao Wang, Yifei Zhang, YongKang Liu 等OpenReview
- 通过尺度敏感损失曲面使模型不可合并Minwoo Jang, Hoyoung Kim, Jabin Koo 等OpenReview
- 安全锚点:利用几何瓶颈防御有害微调攻击
- SPARD:基于安全投影与相关性-多样性数据选择的有害微调防御
- 良性多语言微调对模型安全的异构影响Will Hawkins, Kai Rawal, Jonathan Rystrøm 等OpenReview
红队
14- 估计语言模型输出分布中的尾部风险
- Stable-GFlowNet:基于对比轨迹平衡的多样且鲁棒的大模型红队测试
- 安全评测如抛硬币:LLM 评审无法可靠衡量对抗鲁棒性
- 主动攻击:通过自适应环境对大语言模型进行红队测试
- FLARE-AI:面向人工智能的缺陷报告系统
- FoeGlass:简单的上下文学习即可对音频深伪检测器做红队测试Sepehr Dehdashtian, Jacob H Seidman, Vishnu Boddeti 等OpenReview
- Helpful to a Fault:衡量多轮多语言 LLM Agent 的违规协助
- REALISTA:诱发 LLM 幻觉的真实潜空间对抗攻击Buyun Liang, Jinqi Luo, Liangzu Peng 等OpenReview
- RedDebate:通过多智能体红队辩论实现更安全的模型响应Ali Asad, Stephen Obadinma, Radin Shayanfar 等OpenReview
- 重新审视黑盒设置下对语义水印的伪造攻击:几何失真视角Cheng-Yi Lee, Yichi Zhang, Yuchen Yang 等OpenReview
- RLCracker:用自适应强化学习攻击评估 LLM 水印的最坏情况脆弱性Hanbo Huang, Yiran Zhang, Hao Zheng 等OpenReview
- Scam2Prompt:量产大模型恶意钓鱼端点审计框架Zhiyang Chen, Tara Saba, Xun Deng 等OpenReview
- STARE:多模态毒性攻击的分步时序对齐与红队引擎Xutao Mao, Liangjie Zhao, Tao Liu 等OpenReview
- 当搜索出错:网络增强大语言模型的红队测试