全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
对抗性分词
发现无需修改有害请求文本,仅改变分词方式即可绕过安全限制,并在三个大模型上验证其攻击效果可与现有先进方法竞争。
- 会议论文ACL 2025
JailbreakRadar:大语言模型越狱攻击综合评估
在九个对齐模型和八种防御下评估17种越狱攻击,建立攻击分类,并发现启发式攻击虽可取得高成功率,却较易被防御缓解。
- 会议论文ACL 2025
大模型知晓自身弱点:通过自然分布偏移揭示安全漏洞
提出ActorBreaker,利用与有害内容语义相关的多轮提示绕过防护;攻击在多样性、效果与效率上优于既有方法,衍生训练数据可增强鲁棒性。
- 会议论文ACL 2025
LLM 能欺骗 CLIP 吗?以文本更新评测多模态组合漏洞
提出 MAC 基准,用语言模型生成欺骗性文本揭示多模态表征的组合漏洞,并通过自训练同时提高攻击成功率与样本多样性。
- 会议论文ACL 2025
Con Instruction:通过非文本模态通用越狱多模态大模型
提出通过对抗图像或音频传递有害指令的灰盒攻击,在多种视觉与音频语言模型上绕过安全机制,并发现现有防御存在明显缺口。
- 会议论文ACL 2025
面向文生图模型的多模态语用越狱
利用单独安全的图像与文字组合形成有害含义,九种文生图模型的不安全生成率约为10%至70%,常见过滤器未能有效防御。
- 会议论文ACL 2025
从无害到有害:通过对抗隐喻越狱语言模型
提出AVATAR框架,诱导模型将无害隐喻校准为有害内容,在多个先进模型上展示较高攻击成功率与跨模型迁移能力。
- 会议论文ACL 2025
大语言模型的逐步推理扰乱攻击
提出SEED攻击,在先前推理步骤中隐蔽注入错误而不修改指令,在四个数据集和四种模型上诱导后续推理与最终答案出错。
- 会议论文ACL 2025
冰山之尖:揭示大语言模型的提示内任务对抗攻击
提出将序列转换任务嵌入提示以间接构造违规输入的TIP攻击及PHRYGE基准,实验表明该攻击可绕过六种先进语言模型的安全防护。
- 会议论文ACL 2025
评估大模型被滥用于生成个性化虚假信息的漏洞
评测开放与闭源模型生成个性化虚假新闻的行为,发现多数模型安全过滤不足,个性化要求还会降低过滤触发率,形成越狱效果。
- 会议论文ACL 2025
越狱?一步就够了!
提出将攻击意图伪装成防御任务的 REDA,结合少量上下文示例实现单次迭代越狱,并在开源和闭源模型上优于现有方法。
- 会议论文ACL 2025
大语言模型水印能否可靠防止未经授权的知识蒸馏?
研究蒸馏前改写与蒸馏后水印中和,发现定向改写和推理时中和均可消除继承水印,后者还能保持知识迁移效率与较低计算开销。
- 会议论文ACL 2025
少量查询下针对黑盒模型的多任务对抗攻击
提出利用跨任务迁移性的 CEMA 黑盒攻击,仅需100次查询即可取得显著攻击效果,并可攻击商业翻译接口、语言模型和图像生成模型。
- 会议论文ACL 2025
通过多模态联动越狱大型视觉语言模型
MML通过跨文本与图像的编码及隐蔽引导降低恶意意图暴露,在三个安全基准上对GPT-4o取得约99%的攻击成功率。
- 会议论文ACL 2025
VLMInferSlow:视觉语言模型服务的效率鲁棒性评测
在黑盒条件下生成带有不可感知扰动的对抗图像,使视觉语言模型推理计算成本最高增加128.47%。
- 会议论文ACL 2025
M2S:将多轮越狱转化为单轮攻击
将多轮越狱对话重构为单轮提示,攻击成功率达70.6%至95.9%,最高比原攻击增加17.5个百分点,平均令牌用量减少逾半。
- 会议论文ACL 2025
利用对抗反馈开展实时事实性评估
利用检索增强检测器的反馈迭代改写实时新闻,生成欺骗性样本,使GPT-4o检测器的ROC-AUC下降17.5个百分点。
- 会议论文ACL 2025
披着羊皮的狼:大语言模型能识别隐喻式隐性仇恨吗?
结合越狱与能量约束解码生成隐喻式隐性仇恨言论,发现GPT-4o及专用安全模型常将其误判为无害内容。
- 会议论文ACL 2025
理解大语言模型面对社会偏见攻击的脆弱性
评测多种诱导偏见的攻击及其迁移性,发现模型通常更易受性别偏见攻击,较大模型与预训练基础模型也往往更脆弱。
- 会议论文ACL 2025
引导而非强迫:移除多余约束提升越狱攻击迁移性
分析并移除梯度越狱优化中的多余约束,将跨模型攻击成功率从18.4%提升至50.3%,同时改善攻击行为的稳定性与可控性。
- 会议论文ACL 2025
大语言模型面对纵向排列文本操纵的脆弱性
发现纵向排列文本显著降低模型分类准确率,带来绕过有害内容检测的潜在风险;思维链无助于缓解,而结合细致分析的少样本学习有效。
- 会议论文ACL 2025
SATA:通过简单辅助任务链接实现 LLM 越狱的新范式
先遮蔽恶意查询中的有害关键词,再用简单辅助任务编码其语义完成越狱;在 AdvBench 上 ASR 最高达 85%,优于基线。
- 会议论文ACL 2025
通过意图隐藏与转移探索 LLM 越狱攻击
提出黑盒越狱方法 ICE 和评测集 BiSceneEval,单次查询即达高攻击成功率并具跨模型迁移性,暴露现有防御的关键漏洞。
- 会议论文ACL 2025
结构化安全泛化问题
针对语义等价输入上安全性不泛化的问题,发现多轮、多图和翻译式攻击带来新漏洞,并提出结构重写护栏,显著提升有害输入拒答且不增加过度拒答。