顶会安全论文
共 317 篇
越狱与攻击
50- 每次查询泄露的比特数:LLM 对抗攻击的信息论界
- 学到错误的教训:语言模型中的句法-领域伪相关
- 用强化学习逆向工程人类偏好
- 构建可跨模型与提示迁移的大视觉语言模型攻击器
- 通过图像偏好模型实现可迁移的黑盒单样本水印伪造
- 跨层对抗攻击:攻破文生图模型的多层防御
- 消失于无形:针对 SAM2 的跨提示通用对抗攻击
- 极简高效的攻击基线:对 GPT-4.5/4o/o1 等黑盒模型成功率超 90%
- “Erasing the Invisible”技术报告:2024 NeurIPS 图像水印压力测试竞赛
- 相邻词语,分歧意图:通过任务并发越狱大语言模型Yukun Jiang, Mingjie Li, Michael Backes 等OpenReview
- 通过特征最优对齐对闭源 MLLM 的对抗攻击Xiaojun Jia, Sensen Gao, Simeng Qin 等OpenReview
- 对抗性改写:让 AI 生成文本“人类化”的通用攻击
- AdvPrefix:面向细腻 LLM 越狱的目标函数
- 基于类比的多轮 LLM 越狱Mengjie Wu, Yihao Huang, Zhenjun Lin 等OpenReview
- 注意!你的视觉语言模型可能被恶意操控
- BAM-ICL:基于预算化对抗操纵的上下文学习因果劫持攻击
- Best-of-N 越狱John Hughes, Sara Price, Aengus Lynch 等OpenReview
- 用空间对抗对齐提升对抗样本迁移性
- CARES:医疗 LLM 安全性与对抗鲁棒性综合评测
- 通过参数与表示扰动实现共识鲁棒的迁移攻击Shixin Li, Zewei Li, Xiaojing Ma 等OpenReview
- DepthVanish:优化对抗间隔结构的立体深度隐形补丁Yun Xing, Yue Cao, Nhat Chung 等OpenReview
- 强化学习中扩散模型引导的对抗状态扰动
- Dual-Flow:通过级联流优化实现可迁移的多目标、实例无关攻击
- 通过对手偏好对齐增强基于扩散模型的无限制对抗攻击
- 通过降低指令不确定性探索语义约束对抗样本Jin Hu, Jiakai Wang, linna Jing 等OpenReview
- 拟合分布:针对多模态大模型的跨图像/提示对抗攻击
- GASP:高效黑盒生成对抗后缀以越狱 LLMAdvik Raj Basani, Xiao ZhangOpenReview
- 利用 ViT 的计算冗余提升对抗迁移性Jiani Liu, Zhiyuan Wang, Zeliang Zhang 等OpenReview
- HQA-VLAttack:针对视觉语言预训练模型的高质量对抗攻击
- IMPACT:基于两阶段优化的不规则多补丁对抗组合
- JailBound:突破视觉语言模型的内部安全边界Jiaxin Song, Yixu Wang, Jie Li 等OpenReview
- Jailbreak-AudioBench:大型音频语言模型越狱威胁评测
- LARGO:基于梯度优化的潜空间对抗反思越狱 LLMRan Li, Hao Wang, Chengzhi MaoOpenReview
- 非自适应对抗人脸生成
- LLM 口头置信度在对抗攻击下的鲁棒性
- 安全 + 安全 = 不安全?利用安全图像越狱大型视觉语言模型
- SECA:语义等价且连贯的攻击以诱发 LLM 幻觉Buyun Liang, Liangzu Peng, Jinqi Luo 等OpenReview
- 针对对齐大模型的语义表示攻击Jiawei Lian, Jianhong Pan, Lefan Wang 等OpenReview
- SilentStriker:针对大语言模型的隐蔽比特翻转攻击
- T2V-OptJail:面向文生视频越狱攻击的离散提示词优化
- 压缩的代价:针对 ℓ2 范数估计 Sketch 的紧二次黑盒攻击Sara Ahmadian, Edith Cohen, Uri StemmerOpenReview
- 荧光面纱:针对交通标志识别的隐蔽高效物理对抗补丁Shuai Yuan, Xingshuo Han, Hongwei Li 等OpenReview
- 未来无标记:基于下一帧预测的 AI 生成图像水印移除攻击Huming Qiu, Zhaoxiang Wang, Mi Zhang 等OpenReview
- VLLM 安全悖论:越狱攻击与防御的双重容易Yangyang Guo, Fangkai Jiao, Liqiang Nie 等OpenReview
- 迈向不可逆攻击:基于多种群协同进化搜索欺骗场景文本识别Jingyu Li, Pengwen Dai, Mingqing Zhu 等OpenReview
- 面向视觉语言模型的思维可视化越狱攻击
- TransferBench:基于集成的黑盒迁移攻击基准
- VERA:大语言模型越狱的变分推断框架
- Video-SafetyBench:视频大视觉语言模型安全评测基准Xuannan Liu, Zekun Li, Zheqi He 等OpenReview
- WMCopier:在任意图像上伪造不可见水印Ziping Dong, Chao Shuai, Zhongjie Ba 等OpenReview
提示注入
3- DRIFT:基于动态规则与注入隔离的 LLM Agent 防护Hao Li, Xiaogeng Liu, CHIU Hung Chun 等OpenReview
- ReliabilityRAG:面向 RAG 网页搜索的可证明鲁棒防御
- WASP:Web Agent 抗提示注入安全基准Ivan Evtimov, Arman Zharmagambetov, Aaron Grattafiori 等OpenReview
Agent 安全
13- AgentBreeder:通过自我改进缓解多智能体脚手架的 AI 安全风险
- OS-Harm:计算机使用智能体安全性评测基准
- AdvEDM:针对基于 VLM 的具身智能体的细粒度对抗攻击
- AgentAuditor:LLM Agent 的类人安全评估Hanjun Luo, Shenyu Dai, Chiming Ni 等OpenReview
- 吸引力元数据攻击:诱导 LLM Agent 调用恶意工具Kanghua Mo, Li Hu, Yucheng Long 等OpenReview
- GUARDIAN:用时序图建模守护 LLM 多智能体协作Jialong Zhou, Lichao Wang, Xiao YangOpenReview
- 信息检索引发的 AI Agent 安全退化Cheng Yu, Benedikt Stroebl, Diyi Yang 等OpenReview
- 通过仅查询交互对 LLM Agent 实施记忆注入攻击Shen Dong, Shaochen Xu, Pengfei He 等OpenReview
- MIP against Agent:恶意图像补丁劫持多模态 OS Agent
- RiOSWorld:多模态计算机使用 Agent 的风险评测基准Yang JingYi, Shuai Shao, Dongrui Liu 等OpenReview
- AI Agent 部署中的安全挑战:大规模公开竞赛的启示Andy Zou, Maxwell Lin, Eliot Krzysztof Jones 等OpenReview
- TAI3:测试 Agent 对用户意图解释的完整性Shiwei Feng, Xiangzhe Xu, Xuan Chen 等OpenReview
- TRAP:定向重定向智能体偏好Hangoo Kang, Jehyeok Yeon, Gagandeep SinghOpenReview
防御与护栏
87- 对抗攻击下鲁棒的神经网络动态低秩压缩
- 基于贝叶斯数据调度器的 LLM 有害微调自适应防御
- 连接对称性与鲁棒性:等变性在增强对抗鲁棒性中的作用
- CURE:基于正交表示编辑的扩散模型概念遗忘
- 通过拟合自然图像分布检测生成图像
- 通过跨模态对齐增强 CLIP 的对抗鲁棒性
- 增强 LLM 水印对擦除与伪造攻击的双重鲁棒性
- EraseFlow:基于 GFlowNet 对齐学习概念擦除策略
- 从自然隐空间学习鲁棒的视觉语言模型
- 通过缓解分类复杂度实现鲁棒图凝聚
- Robust SuperAlignment:视觉语言模型的弱到强鲁棒性泛化
- 大语言模型的可扩展指纹技术
- 通过解耦层间依赖加速纵向联邦对抗学习
- AdaptDel:面向可证明鲁棒性的自适应删除率随机平滑Zhuoqun Huang, Neil G Marchant, Olga Ohrimenko 等OpenReview
- 展开网络(基于模型)的对抗泛化
- 对抗感知优化:基于扩散先验的鲁棒防御
- AegisGuard:RL 引导的适配器调优,实现基于 TEE 的高效安全端侧推理CHE WANG, Ziqi Zhang, Yinggui Wang 等OpenReview
- ALMGuard:为音频语言模型寻找安全捷径作为护栏Weifei Jin, Yuxin Cao, Junjie Su 等OpenReview
- 反蒸馏采样(Antidistillation Sampling)
- 超越 Oracle:面向指令层级的验证器监督
- BlurGuard:增强图像保护以抵御 AI 编辑的简单方法Jinsu Kim, Yunhun Nam, Minseon Kim 等OpenReview
- 用信息量更大的触发器提升神经网络指纹的唯一性Zhuomeng Zhang, Fangqi Li, Hanyi Wang 等OpenReview
- 打破检测器中的潜在先验偏差:实现可泛化的 AIGC 图像检测
- C-SafeGen:基于声明级流式护栏的可认证安全 LLM 生成Mintong Kang, Zhaorun Chen, Bo LiOpenReview
- CARE:通过回滚与自省干预实现解码时安全对齐
- 文生图扩散模型 NSFW 内容擦除的综合评估与分析Die Chen, Zhiwen Li, Cen Chen 等OpenReview
- Conformal Arbitrage:语言模型中竞争目标的风险受控平衡William Overman, Mohsen BayatiOpenReview
- 文生图扩散模型中的连续概念移除Tingxu Han, Weisong Sun, Yanrong Hu 等OpenReview
- DEGauss:防御针对高斯泼溅的恶意 3D 编辑Lingzhuang Meng, Mingwen Shao, Yuanjian Qiao 等OpenReview
- 基于自回归奖励引导表征编辑的 LLM 去毒Yisong Xiao, Aishan Liu, Siyuan Liang 等OpenReview
- DiffBreak:基于扩散的对抗净化真的鲁棒吗?Andre Kassis, Urs Hengartner, Yaoliang YuOpenReview
- FocalLoRA:面向 LLM 指令层级对齐的焦点注意力头微调
- E2E-VGuard:面向生产级 LLM 端到端语音合成的对抗式防护Zhisheng Zhang, Derui Wang, Yifan Mi 等OpenReview
- 大语言模型中特定知识的弹性鲁棒遗忘
- 用奇异池化增强图分类鲁棒性
- 从语言模型中擦除概念知识Rohit Gandikota, Sheridan Feucht, Samuel Marks 等OpenReview
- EVOREFUSE:评估并缓解 LLM 对伪恶意指令过度拒答的进化式提示优化Xiaorui Wu, Fei Li, Xiaofeng Mao 等OpenReview
- FALCON:面向 LLM 的对比正交去对齐细粒度激活操控遗忘Jinwei Hu, Zhenglin Huang, Xiangyu Yin 等OpenReview
- 发现并重新激活后训练 LLM 中被隐藏的安全机制Mingjie Li, Wai Man Si, Michael Backes 等OpenReview
- 加固时间序列:DTW 认证鲁棒的异常检测
- FrameShield:对抗鲁棒的视频异常检测
- 从判断到干预:通过流式内容监控提前终止 LLM 有害输出Yang Li, Qiang Sheng, Yehan Yang 等OpenReview
- GuardReasoner-VL:通过强化推理守护 VLM
- GuardSet-X:大规模多领域、基于安全政策的护栏数据集Mintong Kang, Zhaorun Chen, Chejian Xu 等OpenReview
- 人类文本是离群点:用分布外检测识别 LLM 生成文本Cong Zeng, Shengkun Tang, Yuanzhou Chen 等OpenReview
- IF-Guide:基于影响函数的 LLM 去毒化Zachary Coalson, Juhan Bae, Nicholas Carlini 等OpenReview
- 语言模型的终身安全对齐Haoyu Wang, Yifei Zhao, Zeyu Qin 等OpenReview
- LORE:面向视觉编码器的拉格朗日优化鲁棒嵌入
- MetaDefense:在生成前与生成中防御微调式越狱攻击
- 通过嵌入扭曲缓解文生图扩散模型的色情内容生成Jaesin Ahn, Heechul JungOpenReview
- MixAT:结合连续与离散对抗训练的 LLM 防御Csaba Dékány, Stefan Balauca, Dimitar Iliev Dimitrov 等OpenReview
- 一头定乾坤:用单个关键注意力头增强 LVLM 安全性Junhao Xia, Haotian Zhu, Shuchao Pang 等OpenReview
- OVERT:文生图模型过度拒答评测基准Ziheng Cheng, Yixiao Huang, Hui Xu 等OpenReview
- Panacea:通过微调后扰动缓解 LLM 有害微调Yibo Wang, Tiansheng Huang, Li Shen 等OpenReview
- LLM 的个性化安全:基准与基于规划的 Agent 方法Yuchen Wu, Edward Sun, Kaijie Zhu 等OpenReview
- 用追问预测黑盒语言模型的表现Dylan Sam, Marc Anton Finzi, J Zico KolterOpenReview
- 推理作为安全的自适应防御
- 带回溯反馈的强化学习(RLBF)
- 仅用负样本从文生图模型中移除概念Hanwen Liu, Yadong MUOpenReview
- 残差流分析:过拟合与结构破坏Quan Liu, Han Zhou, Wenquan Wu 等OpenReview
- RespoDiff:面向负责任且忠实的文生图双模块瓶颈变换Silpa Vadakkeeveetil Sreelatha, Sauradip Nag, Muhammad Awais 等OpenReview
- 面向自回归音频生成模型的鲁棒无失真水印Yihan Wu, Georgios Milis, Ruibo Chen 等OpenReview
- RoMa:保护扩散模型知识产权的鲁棒模型水印方案
- RSafe:以主动推理构建鲁棒自适应的 LLM 护栏
- RULE:强化遗忘实现遗忘与保留的帕累托最优
- SAFEPATH:通过早期对齐防止思维链中的有害推理Wonje Jeung, Sangyeon Yoon, Minsuk Kahng 等OpenReview
- SafePTR:多模态大模型中基于先剪枝后恢复的 token 级越狱防御
- 大语言模型的安全深度:马尔可夫链视角Ching-Chia Kao, Chia-Mu Yu, Chun-Shien Lu 等OpenReview
- 安全预训练:迈向下一代安全 AIPratyush Maini, Sachin Goyal, Dylan Sam 等OpenReview
- SafeVid:面向安全对齐的视频大型多模态模型Yixu Wang, Jiaxin Song, Yifeng Gao 等OpenReview
- 基于 Hölder 优化的可扩展神经网络几何鲁棒性验证Yanghao Zhang, Panagiotis Kouvaros, Alessio LomuscioOpenReview
- SeCon-RAG:面向可信 RAG 的两阶段语义过滤与无冲突框架
- Semantic Surgery:扩散模型的零样本概念擦除Lexiang Xiong, Liu Chengyu, Jingwen Ye 等OpenReview
- Shape it Up!在微调中恢复 LLM 安全性
- 短长度对抗训练可帮助 LLM 防御长长度越狱攻击Shaopeng Fu, Liang Ding, Jingfeng Zhang 等OpenReview
- 简单取胜:重新思考用于 LLM 遗忘的 Negative Preference OptimizationChongyu Fan, Jiancheng Liu, Licong Lin 等OpenReview
- T2SMark:在扩散模型 Noise-as-Watermark 中平衡鲁棒性与多样性
- 有理论保证的 LLM 水印框架:分布自适应方法
- 面向扩散模型的抗下游微调的安全遗忘Boheng Li, Renjie Gu, Junjie Wang 等OpenReview
- 面向扩散模型安全使用的免训练安全去噪器
- 文生图扩散模型的免训练安全文本嵌入引导
- 理解并提升神经概率电路的对抗鲁棒性Weixin Chen, Han ZhaoOpenReview
- 理解并改进针对 l0 有界扰动的快速对抗训练Xuyang Zhong, Yixiao Huang, Chen LiuOpenReview
- 理解并纠正 VLM 中的安全感知失真
- 揭穿操纵者:利用生物特征泄露识别 AI 视频会议中的冒充Danial Samadi Vahdati, Tai Duc Nguyen, Ekta Prashnani 等OpenReview
- 脆弱数据感知的对抗训练
- 自回归图像生成的水印Nikola Jovanović, Ismail Labiad, Tomas Soucek 等OpenReview
对齐
15- 超越期望:面向风险校准语言模型的分位数引导对齐
- Deep Value Benchmark:衡量模型泛化的是深层价值还是浅层偏好
- 效用工程:分析与控制 AI 中涌现的价值体系
- 谁的安全观?面向文生图模型多元对齐的 DIVE 数据集
- 通过系统级 DPO 对齐复合 AI 系统Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding 等OpenReview
- DPO 能学习多样的人类价值观吗?一个理论缩放律
- 资源约束下理性智能体涌现的风险意识Daniel Jarne Ornia, Nicholas George Bishop, Joel Dyer 等OpenReview
- 通过修正策略优化增强 RLHF 中的安全性
- 可解释的 RLHF:改进对齐
- Generative RLHF-V:从多模态人类偏好中学习原则Jiayi Zhou, Jiaming Ji, Boyuan Chen 等OpenReview
- LLM 安全对齐本质上是散度估计
- 面向多元对齐的成对校准奖励Daniel Halpern, Evi Micha, Ariel D. Procaccia 等OpenReview
- Safe RLHF-V:基于多模态人类反馈的安全强化学习Jiaming Ji, Xinyu Chen, Rui Pan 等OpenReview
- 通过可证明鲁棒的模型对齐实现人类反馈的可扩展估值Masahiro Fujisawa, Masaki Adachi, Michael A OsborneOpenReview
- 抗策略性操纵的人类反馈强化学习
- Among Us:衡量与检测 Agent 欺骗的沙盒
- 推理模型中的霍桑效应:评测并操控测试感知
- 为什么有些语言模型会伪装对齐而另一些不会?
- DeceptionBench:真实场景下 AI 欺骗行为的综合基准Yao Huang, Yitong Sun, Yichi Zhang 等OpenReview
- 噪声注入揭示 sandbagging 语言模型的隐藏能力Cameron Tice, Philipp Alexander Kreer, Nathan Helm-Burger 等OpenReview
- 用测谎器做偏好学习:可能诱导诚实,也可能诱导规避
奖励作弊
4- 大语言模型的推理时奖励作弊
- 探索 RLHF 中的数据扩展趋势与效应
- 纠正基于偏好的奖励学习中的捷径行为Wenqian Ye, Guangtao Zheng, Aidong ZhangOpenReview
- 停止求和:过程奖励模型只需 min-form 信用分配
- CoT Red-Handed:对思维链监控的压力测试Benjamin Arnav, Pablo Bernabeu-Perez, Nathan Helm-Burger 等OpenReview
- 大模型能在过程监督下学会并泛化隐写式思维链
- 推理模型有时会输出难以阅读的思维链Arun JoseOpenReview
可解释性
14- Angular Steering:通过激活空间旋转控制行为
- 度量并引导单义性:Guided Sparse Autoencoders
- 用激活探针检测高风险交互Alex McKenzie, Urja Pawar, Phil Blandfort 等OpenReview
- 语言模型能够对自身内部激活进行元认知监控与控制Li Ji-An, Hua-Dong Xiong, Robert Wilson 等OpenReview
- 语言模型能预测自身行为
- Learning to Steer:面向多模态 LLM 的输入相关 steeringJayneel Parekh, Pegah KHAYATAN, Mustafa Shukor 等OpenReview
- LinEAS:基于分布损失的端到端激活 steering 学习
- LLM 对有害性与拒答的编码是分离的
- 用 Gradient Slingshots 操纵特征可视化Dilyara Bareeva, Marina MC Höhne, Alexander Warnecke 等OpenReview
- 克服 Crosscoder 的稀疏性伪影以解释 Chat 微调Julian Minder, Clément Dumas, Caden Juang 等OpenReview
- 重新定义专家:用于缓解毒性的语言模型可解释分解Zuhair Hasan Shaik, Abdullah Mazhar, Aseem Srivastava 等OpenReview
- 拒答方向在各安全对齐语言间具有普遍性
- SAFEx:通过稳定的安全关键专家识别分析 MoE 大模型漏洞ZhengLin Lai, Mengyao Liao, Bingzhe Wu 等OpenReview
- 理解安全对齐:从安全神经元看机制可解释性Jianhui Chen, Xiaozhi Wang, Zijun Yao 等OpenReview
- CTRL-ALT-DECEIT:自动化 AI 研发中的破坏评测
- 可扩展监督的缩放律
- 为 AI 安全组合有成本约束的运行时监控器Tim Tian Hua, James Baskerville, Henri Lemoine 等OpenReview
后门与投毒
30- 结构化状态空间模型的隐式偏置可被干净标签投毒
- 对 LLM 的病毒感染攻击:投毒经合成数据传播
- 协同样本选择与触发器的通用组件:高效的仅投毒干净标签后门攻击
- Attack by Yourself:基于子图触发器池的多类别图后门攻击Jiangtong Li, Dongyi Liu, Kun Zhu 等OpenReview
- MLLM 微调中无需外部指导的后门清除Xuankun Rong, Wenke Huang, Jian Liang 等OpenReview
- 基于可逆剪枝掩码的后门缓解
- BackdoorDM:扩散模型后门学习的综合基准
- BackdoorLLM:大语言模型后门攻击与防御综合基准
- BadVLA:通过目标解耦优化对视觉-语言-动作模型实施后门攻击
- 针对去中心化联邦学习的竞争优势攻击
- 通过排斥式视觉提示调优防御多模态后门模型
- FedRACE:面向鲁棒联邦学习的分层统计框架Gang Yan, Sikai Yang, Wan DuOpenReview
- ICLScan:通过定向上下文学习检测黑盒大语言模型中的后门Xiaoyi Pang, Xuanyi Hao, Song Guo 等OpenReview
- Lie Detector:基于交叉检验框架的统一后门检测Xuan Wang, Siyuan Liang, Dongping Liao 等OpenReview
- LoSplit:基于损失引导动态划分的图后门攻击训练期防御
- MARS:联邦学习中的恶意度感知后门防御
- MIBP-Cert:基于混合整数双线性规划的抗数据扰动认证训练Tobias Lorenz, Marta Kwiatkowska, Mario FritzOpenReview
- NeuroGenPoisoning:基于神经元引导与遗传优化的 RAG 投毒攻击
- 一个 token embedding 就能让大型推理模型陷入死锁Mohan Zhang, Yihua Zhang, Jinghan Jia 等OpenReview
- 为数据投毒攻击提供可证明的水印
- RepGuard:大语言模型后门防御的自适应特征解耦
- SNEAKDOOR:针对分布匹配式数据集浓缩的隐蔽后门攻击He Yang, Dongyi Lv, Song Ma 等OpenReview
- 隐蔽而有效:保持分布的图分类后门攻击
- 教得好学得坏:蒸馏条件式后门攻击Yukun Chen, Boheng Li, Yu Yuan 等OpenReview
- 基于时序逻辑的多车后门攻击:针对端到端自动驾驶离线 RL 智能体Xuan Chen, Shiwei Feng, Zikang Xiong 等OpenReview
- 水印、可迁移攻击与对抗防御的元分析
- ToxicTextCLIP:针对 CLIP 预训练的文本投毒与后门攻击Xin Yao, Haiyang Zhao, Yimin Chen 等OpenReview
- 联邦学习投毒攻击中的恶意客户端溯源
- VLM 能聚合分散的训练图像补丁Zhanhui Zhou, Lingjie Chen, Chao Yang 等OpenReview
- 谁为触发器发声?MoE Transformer 后门中的动态专家路由Xin Zhao, Xiaojun Chen, Bingshan Liu 等OpenReview
隐私与数据泄露
72- 基于 Palimpsestic 成员推断的黑盒模型溯源
- 能否从 LLM 推断训练数据的机密属性?
- 完全动态数据流上的差分隐私
- 从反事实到决策树:模型提取攻击的竞争分析
- 单次运行能多精确地审计差分隐私?
- 通过 f-差分隐私缓解去中心化联邦学习的隐私-效用权衡
- 随机分配带来的隐私放大
- 通过随机后处理将近似差分隐私净化为纯差分隐私
- TokenSwap:打断 LLM 记忆序列的轻量方法
- 面向经验性机器遗忘评估的可靠密码学框架Yiwen Tu, Pingbang Hu, Jiaqi W. MaOpenReview
- AC-LoRA:近乎免训练的访问控制感知多模态 LLMLara Magdalena Lazier, Aritra Dhar, Vasilije Stambolic 等OpenReview
- 自适应 Sigmoid 裁剪:平衡差分隐私学习中的方向-幅度失配Faeze Moradi Kalarde, Ali Bereyhi, Ben Liang 等OpenReview
- AgentDAM:自主网页智能体的隐私泄露评测Arman Zharmagambetov, Chuan Guo, Ivan Evtimov 等OpenReview
- 医疗基础模型的记忆化风险调查
- 基于先验知识校准记忆探测的 LVLM 黑盒成员推断攻击Jinhua Yin, Peiru Yang, Chen Yang 等OpenReview
- BridgePure:有限的保护泄露即可攻破黑盒数据保护Yihan Wang, Yiwei Lu, Xiao-Shan Gao 等OpenReview
- 约束熵遗忘:面向 LLM 的原始-对偶框架
- 通过推理与强化学习实现 LLM 的情境完整性Guangchen Lan, Huseyin A Inan, Sahar Abdelnabi 等OpenReview
- 用于隐藏状态差分隐私的两层 ReLU 网络凸近似
- CryptoMoE:通过均衡专家路由实现隐私保护的可扩展 MoE 推理Yifan Zhou, Tianshi Xu, Jue Hong 等OpenReview
- 基于图卷积的黑盒推荐系统无数据模型窃取Zeyu Wang, Yidan Song, Shihao Qin 等OpenReview
- 具有合理可否认性的深度学习Wenxuan Bao, Shan Jin, Hadi Abdullah 等OpenReview
- DictPFL:加密梯度上的高效隐私联邦学习Jiaqi Xue, Mayank Kumar, Yuzhang Shang 等OpenReview
- 欧几里得 Jordan 代数的差分隐私及其在私有对称锥规划中的应用Zhao Song, Jianfei Xue, Lichen ZhangOpenReview
- 超越固定矩阵的差分隐私联邦 LoRA
- 具有实体级隐私保证的差分隐私关系学习Yinan Huang, Haoteng Yin, Eli Chien 等OpenReview
- LLM 真的遗忘了吗?基于知识关联与置信度的遗忘评测Rongzhe Wei, Peizhi Niu, Hans Hao-Hsun Hsu 等OpenReview
- 真的需要公开数据吗?表格数据差分隐私的替代公开数据Shlomi Hod, Lucas Rosenblatt, Julia StoyanovichOpenReview
- 基于隐式梯度手术的高效保效用机器遗忘Shiji Zhou, Tianbai Yu, Zhi Zhang 等OpenReview
- 面向蒸馏的高效可验证遗忘
- 语音识别的差分隐私联邦学习:基准、自适应优化器与梯度裁剪
- 探索大语言模型上强成员推断攻击的极限Jamie Hayes, Ilia Shumailov, Christopher A. Choquette-Choo 等OpenReview
- 从流形假设视角看生成式模型反演Xiong Peng, Bo Han, Fengfei Yu 等OpenReview
- GeoClip:差分隐私 SGD 的几何感知裁剪Atefeh Gilani, Naima Tasnim, Lalitha Sankar 等OpenReview
- ImageSentinel:保护视觉数据集免受未授权检索增强图像生成Ziyuan Luo, Yangyi Zhao, Ka Chun Cheung 等OpenReview
- 数据集属性对深度迁移学习成员推断脆弱性的影响Marlon Tobaben, Hibiki Ito, Joonas Jälkö 等OpenReview
- InvisibleInk:高效用低成本的差分隐私文本生成Vishnu Vinod, Krishna Pillutla, Abhradeep Guha ThakurtaOpenReview
- 通过神经激活重定向实现 LLM 遗忘William F. Shen, Xinchi Qiu, Meghdad Kurmanji 等OpenReview
- LOMIA:针对预训练视觉语言大模型的仅标签成员推断攻击Yihao LIU, Xinqi LYU, Dong Wang 等OpenReview
- LoRO:基于 TEE 低秩混淆的 LLM 端侧实时安全推理Gaojian Xiong, Yu Sun, Jianhua Liu 等OpenReview
- 3D 生成中的机器遗忘:视角一致的加速框架Shixuan Wang, Jingwen Ye, Xinchao WangOpenReview
- 基于任务单纯形算术的机器遗忘Junhao Dong, Hao Zhu, Yifei Zhang 等OpenReview
- 带差分隐私的多类支持向量机Jinseong Park, Yujin Choi, Jaewook LeeOpenReview
- ObCLIP:保护隐私的云端-设备混合图像生成Haoqi Wu, Wei Dai, Ming Xu 等OpenReview
- 基于二元询问的在线局部差分隐私共形预测
- OpenGU:图遗忘学习综合基准Bowen Fan, Yuming Ai, Xunkai Li 等OpenReview
- OpenUnlearning:统一方法与指标基准以加速 LLM 遗忘研究
- Permissioned LLMs:在大语言模型中强制执行访问控制
- 扰动模型而非图像:基于反个性化扩散模型的稳健隐私保护Tae-Young Lee, Juwon Seo, Jong Hwan Ko 等OpenReview
- 实用的贝叶斯最优成员推断攻击Marcus Lassila, Johan Östman, Khac-Hoang Ngo 等OpenReview
- PREAMBLE:基于块稀疏向量的私有高效聚合
- 歧义语境下的隐私推理Ren Yi, Octavian Suciu, Adrian Gascon 等OpenReview
- 利用公开数据的私有零阶优化Xuchen Gong, Tian LiOpenReview
- 视觉语言模型中的跨模态记忆量化Yuxin Wen, Yangsibo Huang, Tom Goldstein 等OpenReview
- 重新审视逐字记忆在 LLM 隐私中的作用Tom Sander, Bargav Jayaraman, Mark Ibrahim 等OpenReview
- RUAGO:基于对抗攻击与 OOD 生成器的无保留数据遗忘SangYong Lee, Sangjun Chung, Simon S. WooOpenReview
- 差分隐私的序贯审计Tomás González, Mateo Dulce Rubio, Aaditya Ramdas 等OpenReview
- 基于谱方法的子图联邦学习Javad Aliakbari, Johan Östman, Ashkan Panahi 等OpenReview
- 个性化本地差分隐私下的求和估计Dajun Sun, Wei Dong, Yuan Qiu 等OpenReview
- 通过私有文本中介合成保护隐私的高分辨率图像Haoxiang Wang, Zinan Lin, Da Yu 等OpenReview
- 看不见的威胁:扰动样本下机器遗忘中的残留知识Hsiang Hsu, Pradeep Niroula, Zichang He 等OpenReview
- 迈向高效推断攻击:基于 Mixture-of-Experts 的影子模型共享Li Bai, Qingqing Ye, Xinwei Zhang 等OpenReview
- 追根溯源:利用扩散轨迹的时间动态做来源归属
- Train to Defend:首个针对密码分析式神经网络参数提取攻击的防御Ashley Kurian, Aydin AysuOpenReview
- UMU-Bench:弥合多模态遗忘评测中的模态差距Chengye Wang, Yuyuan Li, XiaoHua Feng 等OpenReview
- 统一差分隐私下的重识别、属性推断与数据重建风险Bogdan Kulynych, Juan Felipe Gomez, Georgios Kaissis 等OpenReview
- 遗忘了但没忘干净:精确遗忘后 LLM 的数据提取攻击Xiaoyu Wu, Yifei Pang, Terrance Liu 等OpenReview
- Unlearning-Aware Minimization:遗忘感知最小化Hoki Kim, Keonwoo Kim, Sungwon Chae 等OpenReview
- 通用可迁移的不可学习样本生成器Zhihao Li, Jiale Cai, Gezheng Xu 等OpenReview
- Vid-SME:针对大型视频理解模型的成员推断攻击Qi Li, Runpeng Yu, Xinchao WangOpenReview
- 成员究竟是什么?通过投毒使成员推断失信Neal Mangaokar, Ashish Hooda, Zhuohang Li 等OpenReview
- 智者知所不言:基于注意力转移的无幻觉 LLM 遗忘Chenchen Tan, Youyang Qu, Xinghao Li 等OpenReview
- CoreGuard:在边缘部署中保护 LLM 核心能力免遭模型窃取Qinfeng Li, Tianyue Luo, Xuhong Zhang 等OpenReview
危险能力
2- 进攻性网络安全智能体的动态风险评估Boyi Wei, Benedikt Stroebl, Jiacen Xu 等OpenReview
- PurpCode:通过推理实现更安全的代码生成
- 蒸馏使遗忘更稳健
- ErrorTrace:基于模型家族错误空间的黑盒溯源机制
- 过拟合攻击:仅用 10 条良性样本微调即可越狱 LLM
- 从休眠到删除:基于权重空间正则化的抗篡改遗忘
- 逐点防御 LLM 微调 API 的根本局限Xander Davies, Eric Winsor, Alexandra Souly 等OpenReview
红队
7- SAGE-Eval:评测大模型对安全常识的系统性泛化
- AutoRedTeamer:支持终身攻击集成的自主红队框架Andy Zhou, Kevin Wu, Francesco Pinto 等OpenReview
- CoP:基于原则组合的 LLM 智能体红队测试Chen Xiong, Pin-Yu Chen, Tsung-Yi HoOpenReview
- 留意 LLM 遗忘学习:隐藏风险与对策Jie Ren, Zhenwei DAI, Xianfeng Tang 等OpenReview
- PolyJuice:针对合成图像检测器的黑盒通用红队方法
- 基于规则偏好建模的文生图系统红队测试Yichuan Cao, Yibo Miao, Xiao-Shan Gao 等OpenReview
- VMDT:解码视频基础模型的可信性