顶会安全论文
共 39 篇
- 从零到英雄:多模态推荐系统对抗性推广攻击Mengyu Yao, Ziqi Zhang, Yifeng Cai 等会议页面
- 具有理论基础的低成本硬标签对抗攻击Jun Liu, Leo Yu Zhang, Fengpeng Li 等会议页面
- 用非定向模态对齐破坏攻击评估视觉语言模型鲁棒性Zhichao Li, Hongshan Yang, Zhibo Wang 等会议页面
- 攻击者后手:自适应攻击绕过LLM防御Milad Nasr, Nicholas Carlini, Chawin Sitawarin 等会议页面
提示注入
4- BadGraph:针对GraphRAG的结构知识隔离攻击Leiming Yan, Xinlong Xu, Ziqiang Li会议页面
- 网络安全日志LLM分析中的上下文污染Rabimba Karanjai, Yang Lu, Hemanth Hegadehalli Madhavarao 等会议页面
- 真实世界求职筛选中的提示注入攻击测量Mohan Zhang, Yuqi Jia, Zhen Tan 等会议页面
- 突破检索障碍:真实环境中的间接提示注入Hongyan Chang, Ergute Bao, Xinjian Luo 等会议页面
- AttriGuard:用因果归因防御Agent间接提示注入Yu He, Haozhe Zhu, Yiming Li 等会议页面
- FragFuse:通过记忆碎片化融合绕过Agent访问控制Zixin Rao, Wentian Zhu, Chan Aristella Lu 等会议页面
- 当AIOps变成AI事故:通过遥测操纵颠覆LLM运维Dario Pasquini, Evgenios M. Kornaropoulos, Giuseppe Ateniese 等会议页面
- AI供应商漏洞赏金与负责任披露政策研究
- 技术促成虐待场景下的LLM回复质量评估
- DualSentinel:基于双重熵停滞模式检测LLM定向攻击Xiaoyi Pang, Xuanyi Hao, Pengyu Liu 等会议页面
- Sy-FAR:基于对称性的公平对抗鲁棒性Haneen Najjar, Eyal Ronen, Mahmood Sharif会议页面
可解释性
1- 从模型认知视角量化大语言模型攻击Xiuming Liu, Chaoxiang He, Xuanran Yu 等会议页面
- 文本到图像扩散模型近似缓存攻击Desen Sun, Shuncheng Jie, Sihang Liu会议页面
- Cordyceps:数据投毒驱动的LLM隐蔽控制攻击Zedian Shao, Charles Fleming, Teodora Baluta会议页面
- HijackKV:与位置无关的KV缓存复用新威胁Yichi Zhang, Zhiqi Wang, Huan Zhang 等会议页面
隐私与数据泄露
11- Behind Bars:利用内存屏障攻击NVIDIA MIG缓存隔离
- 五次查询即可:RAG成员推断攻击Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo 等会议页面
- 模仿式成员推断攻击Yuntao Du, Yuetian Chen, Hanshen Xiao 等会议页面
- 图生成扩散模型的推断攻击Xiuling Wang, Xin Huang, Guibo Luo 等会议页面
- 针对大语言模型分词器的成员推断攻击Meng Tong, Yuntao Du, Kejiang Chen 等会议页面
- 私有Transformer模型推理综述Yuntian Chen, Tianpei Lu, Zhanyong Tang 等会议页面
- 安全隐私控制对生成式AI聊天机器人情感参与的影响
- 提示窃取谬误:重新思考指标、攻击与防御Zehang Deng, Haoyang Li, Wanlun Ma 等会议页面
- VidLeaks:文本生成视频模型的成员推断攻击Li Wang, Wenyu Chen, Ning Yu 等会议页面
- 用户隐私诉求与LLM服务商政策的差距
- 针对微调大语言模型的窗口式成员推断攻击Yuetian Chen, Yuntao Du, Kaiyuan Zhang 等会议页面
危险能力
1红队
1- MUZZLE:针对Web Agent间接提示注入的自适应红队Georgios Syros, Evan Rose, Brian Grinstead 等会议页面