全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
Audio Jailbreak:大型音频语言模型越狱的开放综合基准
构建含 1,495 条对抗音频提示的 AJailBench,并用音频扰动工具包生成优化变体;评测显示没有模型表现出一致的鲁棒性,微小扰动即可显著降低安全性。
- 会议论文ACL 2026
SoundBreak:对三模态模型纯音频对抗攻击的系统研究
研究针对音频-视频-语言模型的纯音频无目标对抗攻击,攻击成功率最高达 96%,在低感知失真及房间混响下仍有效,跨模型迁移性有限。
- 会议论文ACL 2026
评估 LLM 辅导员在对抗性学生攻击下的答案泄露鲁棒性
将对抗与说服技巧引入教育场景,微调出可越狱 LLM 辅导员的学生 agent 作为基准核心,并提出降低答案泄露的简单防御。
- 会议论文ACL 2026
背景也重要:针对医疗视觉语言模型的可迁移攻击
提出MedFocusLeak,在非诊断背景区域施加难以察觉的扰动以转移注意力,在六类医学影像上诱导错误但临床上看似合理的诊断。
- 会议论文ACL 2026
ASTRA:自动发现、检索与演化大模型越狱策略
提出攻击、评估、提炼与复用的闭环框架,以三级策略库积累有效经验并规避已知失败,在黑盒越狱实验中显著优于现有基线。
- 会议论文ACL 2026
学习隐藏风险:金融领域大语言模型的可控多轮红队攻击
提出逐轮掩藏风险、诱导违规回答的黑盒攻击框架,并构建金融风险基准;完整方法在九个模型上的平均攻击成功率达95%。
- 会议论文ACL 2026
进退两难:LLM 伦理推理与安全对齐之间的张力
提出多轮红队方法 TRIAL,利用模型自身伦理推理包装有害请求取得高攻击成功率,并提出 ERR 防御框架。
- 会议论文ACL 2026
AutoRAN:自动劫持大型推理模型的安全推理
利用较弱模型模拟推理,并根据目标拒答泄露的推理模式迭代攻击,在多个推理模型与基准上实现接近100%的攻击成功率。
- 会议论文ACL 2026
SHARP:面向黑盒越狱的自适应有害类别感知提示生成
提出按有害问题类别生成越狱提示的SHARP,结合两阶段LoRA微调与DPO,提高攻击成功率及跨类别鲁棒性。
- 会议论文ACL 2026
TROJail:以过程奖励优化多轮大模型越狱轨迹
将多轮越狱建模为轨迹级强化学习,以两类过程奖励缓解监督稀疏,在多个模型和基准上提高攻击成功率。
- 会议论文ACL 2026
利用重参数化不变性提升 LLM 越狱攻击的可迁移性
提出基于自然梯度的 RIGJ 框架,按输出分布差异更新 token,跨模型攻击成功率提升 14.9,平均有害度提升 1.23。
- 会议论文ACL 2026
GAMBIT:面向多模态大模型的游戏化越狱框架
把有害视觉语义拆解重组并包装成游戏场景,诱导模型自行重建意图并作答,在 Gemini 2.5 Flash 上攻击成功率达 92.13%。
- 会议论文ACL 2026
DMN:面向多图输入多模态 LLM 的组合式越狱框架
利用多图输入分散指令、提供多模态证据并加入数字链任务,在 GPT-4o、Gemini-2.5-pro 和 Claude Sonnet 4 上攻击成功率超 90%。
- 会议论文ACL 2026
SHAPE:统一教育 LLM 的安全、有用与教学性
提出教学越狱问题(学生诱导模型直接给答案)与含 9,087 对样本的 SHAPE 基准,图增强辅导流程显著提升安全性且保持有用性。
- 会议论文ACL 2026
上下文表征劫持:Doublespeak 越狱攻击
用上下文示例把有害词替换为无害词,使其内部表征趋同于有害语义,从而绕过安全对齐;无需优化,可跨模型迁移,在 Llama-3.3-70B-Instruct 上成功率达 74%。
- 会议论文ACL 2026
AGILE:基于激活引导局部编辑的越狱攻击
两阶段框架:先用场景化改写掩盖恶意意图,再用隐藏状态引导细粒度编辑,使内部表征由恶意转向良性;攻击成功率较最强基线最高提升 37.74%,迁移性好。
- 会议论文ACL 2026
Reference Attack:针对多模态大模型的跨模态越狱攻击
把恶意提示嵌入图像、表格等非文本模态,并用递归符号引用让模型逐层还原有害内容,绕过内容审核;在主流 MLLM 上成功率超 93%,较基线最高提升 70.8%。
- 会议论文ACL 2026
Seeing No Evil:通过对抗性注意力劫持让视觉语言模型对安全指令“失明”
通过压制对系统提示的注意力并锚定对抗图像特征实现视觉越狱,在 Qwen-VL 上成功率 94.4%;发现“安全失明”,即模型因未检索到安全规则而输出有害内容。
- 会议论文ACL 2026
NaturalSloth:重新审视针对大模型的拒绝服务攻击
发现无需对抗扰动,看似正常但无意义的自然指令就能诱发过长生成;构建 NaturalSloth 数据集,与越狱技术结合效果更强,并暴露现有防御的不足。
- 会议论文ACL 2026
在潜空间中探测 LLM 的安全鲁棒性
提出 Activation Steering Attack,用 NLL 作为诊断信号探测隐层扰动下安全行为的敏感度,发现最脆弱层不稳定、部分输入在所有层都脆弱,并可累积产生越狱效果。
- 会议论文ACL 2026
HauntAttack:当攻击如影随形地嵌入推理
将有害指令嵌入推理题的关键条件,在11个推理模型上实现超过70%的平均攻击成功率,较最强基线最高提升13个百分点。
- 会议论文ACL 2026
让多模态大模型失明:内容审核中的对抗走私攻击
将有害内容编码为人类可读而模型难识别的视觉形式,构建1700例基准,发现多款领先模型的攻击成功率超过90%。
- 会议论文ACL 2026
超越固定印记:大语言模型水印的自适应窃取
提出结合位置式印记构建与动态攻击视角选择的水印窃取方法,在相同实验条件下显著提升窃取效率。
- 会议论文ACL 2026
FLASH:聚焦层的注意力汇劫持
通过干预浅层注意力汇并结合查询改写与动态解码绕过安全机制,在多个模型上攻击成功率超过77%,平均查询1.53次。