全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
MSIA:自适应医疗多模态多轮语义越狱
通过自适应策略与医学证据反馈,在多轮胸片对话中累积隐蔽语义偏移,在GPT-4o、Claude和Gemini上平均攻击成功率达76.67%。
- 会议论文ACL 2026
模式增强多轮越狱:利用大语言模型的结构性弱点
提出五类对话模式构建多轮越狱,在十二个模型、十类危害上发现模式特异性弱点,针对一种模式的防御难以泛化至其他模式。
- 会议论文ACL 2026
经验驱动的多智能体大语言模型黑盒越狱优化
提出结合三智能体协作与动态经验库的EMJO,实验中攻击成功率最高提升11个百分点,平均查询成本最多降低7.9倍。
- 会议论文ACL 2026
OSCR-Attack:自优化连续松弛的单次字符级攻击
将离散字符插入转化为可学习的连续优化,在三个开源模型上使攻击成功率最高提升21.45个百分点,攻击速度最高提升至3.66倍。
- 会议论文ACL 2026
偏离拒答:基于首词元分布的黑盒越狱方法
提出利用首词元分布偏离拒答模式来优化攻击的方法,在全部受测开源模型上成功率超过90%,在GPT-4.1上超过94%。
- 会议论文ACL 2026
大语言模型安全护栏易受价值驱动对抗提示攻击
提出利用模型迎合倾向的价值驱动黑盒越狱,在五个模型上单次查询的平均成功率达91.8%和95.2%,分别对应两个测试集。
- 会议论文ACL 2026
通过道德攻击越狱大语言模型
构建涵盖价值模糊与冲突的1.04万条数据并设计四类对抗攻击,发现大语言模型和护栏模型的道德判断存在显著漏洞。
- 会议论文ACL 2026
大语言模型中的不完整提示越狱
系统研究不完整有害提示触发的越狱,发现模型往往延迟至句末才拒答,且针对性微调难以跨内容领域和续写类型泛化。
- 会议论文ACL 2026
Chimera:通过判定驱动的异构策略搜索构造组合越狱
将越狱建模为异构策略组合搜索,并用相关性感知指标抑制无关回答造成的成功误判,在多种模型上提高攻击成功率与迁移性。
- 会议论文ACL 2026
大模型如何信任未知知识?一种基于未知知识的越狱攻击
研究影响模型采信未知知识的因素并据此构造越狱攻击,报告在有无防御的测试场景中,对包括GPT-5.1在内的模型达到99%至100%成功率。
- 会议论文ACL 2026
TinyAttack:探索大语言模型的字符样式漏洞
提出基于五类Unicode字符样式变换的对抗攻击,在保持文本语义和句法的同时,使开源与闭源模型的任务表现显著下降。
- 会议论文ACL 2026
StanceAttack:针对立场检测的对抗攻击
利用ChatGPT生成保持语义和自然度的对抗文本,在两个基准上攻击立场检测模型,相比传统方法成功率更高、重试更少。
- 会议论文ACL 2026
让护栏失声:通过动态上下文表征消融实现推理时越狱
提出CRA,在解码时抑制与拒答相关的低秩激活模式,无需训练或更新参数,便在多个安全对齐开源模型上取得优于基线的越狱效果。
- 会议论文ACL 2026
词典引导的稀疏Logit编辑实现可靠越狱攻击
提出无需梯度或辅助模型的白盒推理时攻击SIBI,通过稀疏修改Logit绕过护栏,在标准基准上保持较高成功率并降低计算与空间开销。
- 会议论文ACL 2026
增加智能体改善数学解题,但对抗鲁棒性差距依然存在
在六个模型、四个数学基准上评测输入扰动,发现增加智能体可提高准确率,却无法消除对抗性能差距,人类式拼写错误尤其棘手。
- 会议论文ACL 2026
逻辑越狱:通过形式逻辑表达绕过大模型安全限制
提出将有害请求转换为形式逻辑表达的黑盒越狱方法,并构建多语言评测数据集,在五种语言中验证其有效性与泛化能力。
- 会议论文ACL 2026
StructBreak:结构性认知过载引发多模态模型安全失效
提出利用结构性认知过载的黑盒攻击,在六个多模态模型上平均攻击成功率达92%,并分析其绕过安全机制的内部原因。
- 会议论文ACL 2026
明知仍为:以道德脱离诊断与防御角色扮演越狱
发现模型在角色扮演中即使识别安全风险仍可能执行有害请求,并提出内省式防御,在保持角色忠实度的同时降低攻击成功率。
- 会议论文ACL 2026
以自适应叠加密码越狱大型推理模型
提出自适应多重加密越狱框架SEAL,在GPT o4-mini上攻击成功率达85.6%,并在多种推理模型上验证有效性。
- 会议论文ACL 2026
非对称关系几何驱动的视觉语言模型通用对抗扰动
提出ARG-Attack,以非对称关系几何目标学习通用扰动,在保持有竞争力的白盒攻击效果的同时显著提升黑盒迁移效果。
- 会议论文ACL 2026
水印消退:针对大语言模型水印的自适应进化改写攻击
提出免训练的进化改写框架TSAPA,在多种水印方案上攻击成功率超过90%,同时保持较高语义保真度,揭示现有水印的脆弱性。
- 会议论文ACL 2026
目标冲突使大型推理模型更易遭受攻击
在三个推理模型上发现,价值冲突与两难选择显著提高攻击成功率,层级与神经元分析显示安全表征和功能表征发生偏移与重叠。
- 会议论文ACL 2026
透视防护盾:识别大语言模型中的安全护栏
提出AP-Test,利用护栏特异的对抗提示识别黑盒智能体部署的护栏,在四种开源护栏的多种测试场景中达到完全准确识别。
- 会议论文ACL 2026
MultiCodeAttack:多语言代码模板驱动的迭代越狱
通过自适应选择编程语言和迭代演化代码模板实施越狱,在多个大模型上比基线诱导出更多有害文本与恶意代码。