全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
安全对齐何时无法泛化:语言游戏越狱探测
提出AutoLanJail自动发现和优化语言游戏越狱,发现安全微调高度依赖语言形式,难以泛化到仅有微小变化的表达。
- 会议论文ACL 2026
ECHA:利用隐式语义重建与显式安全对齐错位越狱视觉语言模型
利用模型从碎片化视觉线索重建有害意图而护栏未能识别的缺陷,在七种视觉语言模型上评测,单次攻击绕过率超过81%。
- 会议论文ACL 2026
RAMP:用于越狱红队测试的风险感知多轮规划
将多轮越狱建模为风险感知规划问题,通过闭环规划执行组合攻击策略,在开源和闭源模型上兼顾攻击效果与查询效率。
- 会议论文ACL 2026
从攻击面到实际操作:现代大语言模型越狱综述
提出技术与操作双重分类体系,分析越狱漏洞与实际攻击约束的关联,梳理现有研究缺口。
- 会议论文ACL 2026
难读却易越狱:视觉退化如何绕过多模态模型安全对齐
发现降低图像分辨率等视觉扰动会削弱安全防御,即使文字仍可读;将转录与安全评估串行分离可缓解风险。
- 会议论文ICLR 2026
PLAGUE:用于终身自适应生成多轮越狱的即插即用框架
提出多轮越狱攻击框架PLAGUE,将攻击解构为引导、规划与完成三阶段,利用终身学习智能体在o3和Opus 4.1等高防御模型上实现了高攻击成功率。
- 会议论文ICLR 2026
JailbreakLoRA:从共享平台下载的LoRA可能并不安全
提出JailbreakLoRA多任务越狱训练方法,通过不确定性加权与梯度冲突缓解平衡任务效用与攻击能力,显著提升越狱成功率。
- 会议论文ICLR 2026
隐形安全威胁:基于隐写术的大语言模型恶意微调
提出一种隐写恶意微调方法,使大模型表面维持安全对齐假象,却能在掩护文本中隐蔽生成有害内容,绕过OpenAI微调护栏和安全分类器。
- 会议论文ICLR 2026
SEMA:简单高效的多轮越狱攻击学习框架
提出结合预填充自微调与意图漂移感知强化学习的攻击框架SEMA,无需外部数据即可高效训练多轮越狱攻击模型并显著提升攻击成功率。
- 会议论文ICLR 2026
JailNewsBench:越狱攻击下虚假新闻生成的多语言与区域基准
提出首个评估大模型抵御越狱攻击生成虚假新闻的跨语言基准JailNewsBench,覆盖34个地区与22种语言,发现主流模型在英语及涉美主题上防御表现显著较弱。
- 会议论文ICLR 2026
抵御对抗性行为操纵的鲁棒深度强化学习
针对通过状态观测对抗扰动操纵受害者行为的行为目标攻击,提出基于模仿学习的黑盒攻击方法,并基于策略敏感性分析提出时间折扣正则化防御策略。
- 会议论文ICLR 2026
JALMBench:语音语言模型越狱脆弱性基准评测
构建了首个针对语音大语言模型的越狱评估基准,系统测试了多种跨模态越狱攻击与防御手段,揭示了其安全脆弱性及对齐机制的局限。
- 会议论文ICLR 2026
SlotGCG:利用大模型位置脆弱性进行越狱攻击
提出位置脆弱性评估指标VSS及SlotGCG攻击,通过在提示词最脆弱位置优化插入对抗词元,显著提高了大语言模型的越狱成功率与防御鲁棒性。
- 会议论文ICLR 2026
成本不对称下黑盒攻击的通用框架
针对内容审核等存在不对称查询成本的场景,提出一套新型基于决策的黑盒对抗攻击算法,能在减少高成本查询的同时以更小的扰动成功实现对抗攻击。
- 会议论文ICLR 2026
有限计算预算下的细粒度迭代对抗攻击
针对算力受限下的对抗攻击难题,提出选择性重计算层激活的细粒度控制机制,在同等成本下最大化攻击强度,并使对抗训练仅需30%计算预算即可达到相当表现。
- 会议论文ICLR 2026
错位角色与图像:结构化输入扰动暴露多模态对齐盲区
提出角色-模态攻击(RMA),通过混淆用户与助手角色及改变图像标记位置等结构扰动诱发有害输出,并提出对抗训练策略使模型聚焦查询内容以降低攻击成功率。
- 会议论文ICLR 2026
JULI:利用模型自我内省越狱大语言模型
提出JULI越狱方法,仅需利用目标模型的Top-5标记对数概率,即可在黑盒API设置下有效突破大语言模型的安全对齐。
- 会议论文ICLR 2026
SafeDialBench:多轮对话多样越狱攻击下的大模型安全评测基准
构建包含6大安全维度和7种越狱策略的多轮对话基准SafeDialBench,评测19个模型发现Yi与GLM表现优异,而Llama3.1与o3-mini存在安全漏洞。
- 会议论文ICLR 2026
VEAttack:针对大视觉语言模型的下游无关视觉编码器攻击
仅攻击视觉编码器的灰盒无目标攻击,通过扰动 patch token,使图像描述任务性能下降 94.5%、VQA 下降 75.7%。
- 会议论文ICLR 2026
隐晦却高效:基于仿生搜索的文言文越狱提示词优化
利用文言文的精炼隐晦特性与果蝇优化算法构建CC-BOS框架,实现了高效自动化的黑盒越狱攻击。
- 会议论文ICLR 2026
SeRI:基于决策黑盒攻击的无梯度敏感区域识别方法
提出首个基于决策黑盒设置的像素级敏感区域识别方法SeRI,无需梯度即可递归精细定位关键区域,显著提升了针对深度神经网络的黑盒对抗攻击效率与成功率。
- 会议论文ICLR 2026
绕过Token级安全机制的深度微调攻击
提出先拒答后遵从的深度微调攻击策略,成功绕过浅层防御与输出过滤器,对GPT-4o和Claude Haiku实现高成功率越狱。
- 会议论文ICLR 2026
基于概念的对抗攻击:概率视角
提出一种基于概念的对抗攻击框架,从概率分布视角生成保持类别概念但在姿态、视角或背景上多样化的对抗样本,以更高效率误导分类器。
- 会议论文ICLR 2026
迈向面向视觉语言模型的通用且可迁移越狱攻击
提出跨模型通用且可迁移的VLM越狱攻击框架UltraBreak,结合视觉空间正则化与语义目标平滑损失曲面,显著提升黑盒越狱成功率。