全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文论文追踪USENIX Security 2026
论文指出密码学模型认证的假设缺口:审计通过但部署失效
论文《Certified in Theory, Broken in Practice》指出,基于安全零知识证明(ZKP)的密码学模型认证(CMC)方案存在假设缺口:现有安全定义只保证模型在固定审计数据集上的行为,未保证同一分布的其他数据上同样成立。作者据此构造攻击,通过精心设计训练数据,使模型在审计中表现正常、部署后出现病态行为,实验显示攻击者可认证模型在审计集上准确率超过99%,而在同分布新样本上不足30%。为弥补该缺口,作者形式化了面向 CMC 框架的密码学安全定义,提出通用协议模板并证明其满足这些要求。作者认为该结果既是对现有方案的警示,也为设计安全、隐私保护的机器学习审计协议提供了建设性指引。
- 会议论文SPY LabICLR 2025
SPY Lab 研究:预训练数据投毒可穿透对齐阶段
SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。
- 会议论文Simon WillisonICML 2026
研究将提示注入归因于角色混淆,改写文本风格可降低攻击成功率
Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menell 的研究指出,模型难以区分自身特权文本(如 <system>、 thinking、<assistant> 标签包裹的内容)与 <user> 标签中的不可信输入,作者称之为角色混淆。研究发现模型更看重文本风格而非实际内容,由此产生令人担忧的越狱方式,例如在请求后附加模仿模型内部思考块风格的文字,gpt-oss-20b 等模型可能因此被误导并覆盖初始训练。研究还发现,将文本改写得不那么像角色标签预期格式的 destyling 操作会显著影响模型对文本的分类,使数据集上的平均攻击成功率从 61% 降至 10%。
- 会议论文ACL 2026
当效率遇上安全:LLM 中 KV Cache 压缩的安全基准分析
系统研究 KV cache 压缩与越狱攻击的交互,发现既可能带来偶然鲁棒性也会放大部分攻击,并提出 Safe-CAM 将 ASR 降至 0%。
- 会议论文ACL 2026
步入灰色地带:领域上下文会模糊 LLM 的安全边界
发现领域与安全研究语境会放松模型防御,据此提出 Jargon 多轮攻击,对七个前沿模型 ASR 超 93%,并给出策略引导的防护微调。
- 会议论文ACL 2026
用多片段视频越狱多模态大语言模型
构建 MCV SafetyBench,发现攻击成功率随片段数上升,视频比图像更脆弱,并提出利用图像模态相对鲁棒性的防御。
- 会议论文ACL 2026
Audio Jailbreak:大型音频语言模型越狱的开放综合基准
构建含 1,495 条对抗音频提示的 AJailBench,并用音频扰动工具包生成优化变体;评测显示没有模型表现出一致的鲁棒性,微小扰动即可显著降低安全性。
- 会议论文ACL 2026
SoundBreak:对三模态模型纯音频对抗攻击的系统研究
研究针对音频-视频-语言模型的纯音频无目标对抗攻击,攻击成功率最高达 96%,在低感知失真及房间混响下仍有效,跨模型迁移性有限。
- 会议论文ACL 2026
超越显式拒答:针对 RAG 的软失效攻击
提出 DEJA 黑盒进化攻击,生成对抗文档诱使 RAG 输出流畅但无信息量的回答,可绕过困惑度检测和输入扰动等防御。
- 会议论文ACL 2026
评估 LLM 辅导员在对抗性学生攻击下的答案泄露鲁棒性
将对抗与说服技巧引入教育场景,微调出可越狱 LLM 辅导员的学生 agent 作为基准核心,并提出降低答案泄露的简单防御。
- 会议论文ACL 2026
PIArena:提示注入评测平台
统一集成攻击、防御与基准,并设计自适应攻击,发现现有防御泛化性有限、易被自适应攻击突破。
- 会议论文ACL 2026
推理劫持:大语言模型推理对齐的脆弱性
通过注入虚假判断标准而不改变任务目标来操纵模型,在三类文本检测任务中揭示漏洞,并绕过针对目标偏移的防御。
- 会议论文ACL 2026
背景也重要:针对医疗视觉语言模型的可迁移攻击
提出MedFocusLeak,在非诊断背景区域施加难以察觉的扰动以转移注意力,在六类医学影像上诱导错误但临床上看似合理的诊断。
- 会议论文ACL 2026
当效率成为弱点:针对网页智能体的计算成本攻击
提出CostBomb,通过网页提示注入诱发冗长推理;黑盒实验表明,攻击可在不妨碍任务完成的情况下显著增加智能体计算成本。
- 会议论文ACL 2026
ASTRA:自动发现、检索与演化大模型越狱策略
提出攻击、评估、提炼与复用的闭环框架,以三级策略库积累有效经验并规避已知失败,在黑盒越狱实验中显著优于现有基线。
- 会议论文ACL 2026
学习隐藏风险:金融领域大语言模型的可控多轮红队攻击
提出逐轮掩藏风险、诱导违规回答的黑盒攻击框架,并构建金融风险基准;完整方法在九个模型上的平均攻击成功率达95%。
- 会议论文ACL 2026
进退两难:LLM 伦理推理与安全对齐之间的张力
提出多轮红队方法 TRIAL,利用模型自身伦理推理包装有害请求取得高攻击成功率,并提出 ERR 防御框架。
- 会议论文ACL 2026
AutoRAN:自动劫持大型推理模型的安全推理
利用较弱模型模拟推理,并根据目标拒答泄露的推理模式迭代攻击,在多个推理模型与基准上实现接近100%的攻击成功率。
- 会议论文ACL 2026
SHARP:面向黑盒越狱的自适应有害类别感知提示生成
提出按有害问题类别生成越狱提示的SHARP,结合两阶段LoRA微调与DPO,提高攻击成功率及跨类别鲁棒性。
- 会议论文ACL 2026
TROJail:以过程奖励优化多轮大模型越狱轨迹
将多轮越狱建模为轨迹级强化学习,以两类过程奖励缓解监督稀疏,在多个模型和基准上提高攻击成功率。
- 会议论文ACL 2026
利用重参数化不变性提升 LLM 越狱攻击的可迁移性
提出基于自然梯度的 RIGJ 框架,按输出分布差异更新 token,跨模型攻击成功率提升 14.9,平均有害度提升 1.23。
- 会议论文ACL 2026
GAMBIT:面向多模态大模型的游戏化越狱框架
把有害视觉语义拆解重组并包装成游戏场景,诱导模型自行重建意图并作答,在 Gemini 2.5 Flash 上攻击成功率达 92.13%。
- 会议论文ACL 2026
VIGIL:以先验证后提交防御 LLM Agent 的工具流注入
提出 verify-before-commit 防御框架和含 959 个案例的 SIREN 基准,攻击成功率比动态防御降低 22% 以上,受攻击下可用性翻倍。
- 会议论文ACL 2026
DMN:面向多图输入多模态 LLM 的组合式越狱框架
利用多图输入分散指令、提供多模态证据并加入数字链任务,在 GPT-4o、Gemini-2.5-pro 和 Claude Sonnet 4 上攻击成功率超 90%。