全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
结构化安全泛化问题
针对语义等价输入上安全性不泛化的问题,发现多轮、多图和翻译式攻击带来新漏洞,并提出结构重写护栏,显著提升有害输入拒答且不增加过度拒答。
- 会议论文ACL 2025
Don't Say No:通过抑制拒答来越狱 LLM
提出 DSN 攻击,结合余弦衰减调度与拒答抑制改进优化式越狱的损失目标,攻击成功率达 SOTA,并可迁移到未见数据集和黑盒模型。
- 会议论文ACL 2025
Red Queen:揭示大语言模型中潜在的多轮风险
提出多轮隐藏恶意意图的 Red Queen 攻击,在 GPT-4o 上 ASR 达 87.6%,且大模型更易受攻击;所提 Red Queen Guard 可将 ASR 降至 1% 以下。
- 会议论文ACL 2025
机器生成文本检测的压力测试:转变语言模型写作风格以欺骗检测器
用 DPO 微调使生成文本风格趋近人类写作,仅需少量样本即可显著降低 Mage、Radar 等主流检测器的检测性能。
- 会议论文ACL 2025
GOODLIAR:基于强化学习的欺骗性 Agent,用于扰乱 LLM 对基础原则的信念
提出 RL 框架生成欺骗性上下文,改写 LLM 对数学或哲学等基本公理的信念,效果优于简单多轮提示方法。
- 会议论文ACL 2025
Rewrite to Jailbreak:发现可学习且可迁移的隐式有害指令
提出黑盒越狱方法 R2J,仅通过改写原指令并迭代优化策略即可越狱,无额外特征、更难识别,并可迁移到多种数据集和模型。
- 会议论文ACL 2025
高效但脆弱:LLM 批量提示攻击的评测与防御
构建 BatchSafeBench,发现所有 LLM 都易受批量提示中注入指令的干扰;基于探针的检测准确率约 95%,并分析了相关注意力头。
- 会议论文ACL 2025
QueryAttack:用结构化非自然查询语言越狱对齐模型
将恶意请求转换为结构化非自然查询语言以绕过安全对齐,在主流模型及多种防御下取得较高攻击成功率。
- 会议论文ACL 2025
思维链推理真的能降低越狱危害吗?
理论分析表明思维链推理对越狱危害具有双重作用,并提出FicDetail越狱方法,以实验验证理论发现。
- 会议论文ACL 2025
CAVGAN:通过内部表征生成对抗攻击统一越狱与防御
利用生成对抗网络学习模型内部安全判别边界,在三款模型上平均越狱成功率为88.85%,防御成功率为84.17%。
- 会议论文ACL 2025
SQL注入式越狱:大语言模型的结构性安全缺陷
提出针对输入提示构造方式的SIJ越狱,五款开源模型攻击成功率接近100%,五款闭源模型平均超过85%。
- 会议论文ACL 2025
Mousetrap:通过迭代混沌链越狱大型推理模型
将迭代生成的混沌映射嵌入推理链实施越狱,在Trotter数据集上对三款模型的攻击成功率分别达96%、86%和98%。
- 会议论文ACL 2025
突破上限:通过扩展策略空间探索越狱攻击潜力
通过分解攻击策略并结合遗传优化扩展搜索空间,在所测Claude-3.5上取得超过90%的越狱成功率,并展现跨模型迁移性。
- 会议论文ACL 2025
Chain of Attack:通过多轮审讯隐藏意图的越狱攻击
提出 CoA,从审讯视角生成多轮攻击链以隐藏越狱意图,对黑盒 LLM 的攻击成功率达 83%,高于对比方法的 64%。
- 会议论文ACL 2025
Chain-of-Jailbreak:通过逐步编辑攻击图像生成模型
将恶意查询拆成多个子查询并逐步编辑图像,绕过防护的比例超 60%(其他方法 14%),并提出 Think-Twice Prompting 防御超 95% 的攻击。
- 会议论文ACL 2025
Crabs:黑盒场景下自动生成提示的 LLM-DoS 资源消耗攻击
提出 AutoDoS,在黑盒下构建 DoS 攻击树并迭代优化,使服务响应延迟放大超 250 倍,并可借 Length Trojan 绕过现有防御。
- 会议论文ACL 2025
大语言模型中的提示威胁:系统提示与用户提示视角
综述提示泄露与提示越狱等攻击方法,总结其实验设置,并探讨提示威胁与提示注入攻击之间的关系。
- 会议论文ACL 2025
沉默的破坏者:针对黑盒 RAG 系统的不可察觉对抗攻击
提出基于强化学习的 ReGENT,用人眼难以察觉的小扰动让目标文档被检索并误导 RAG 的最终回答,效果优于现有攻击方法。
- 会议论文ACL 2025
SemanticCamo:通过语义伪装越狱大语言模型
提出 SemanticCamo,用语义特征替换不安全内容以隐藏恶意意图,对 GPT-4o、Claude-3.5 等平均超过 80% 的情况诱导出有害回答,且对多种防御有效。
- 会议论文ACL 2025
谁能抵御聊天音频攻击?大型音频语言模型评测基准
提出含四类音频攻击的 CAA 基准,评估六个语音交互 LALM 的鲁棒性,结果显示 GPT-4o 抗攻击能力最强。
- 会议论文ACL 2025
效率之下的暗礁:小语言模型中越狱攻击的隐藏威胁
实证评估 13 个 SLM 在多种越狱攻击下的安全性,多数易受攻击;防御方法有效,并分析了压缩、量化、蒸馏等技术造成的安全退化。
- 会议论文ACL 2025
MVTamperBench:评测视觉语言模型对视频篡改的鲁棒性
构建含约 1.7 万篡改视频片段的基准,评测 45 个 MLLM 对五类篡改的抵抗力,发现鲁棒性差异大且参数量更大不一定更稳健。
- 会议论文ACM CCS 2025
SecAlign:用偏好优化防御提示注入
- 会议论文ACM CCS 2025
一个代理骗所有模型:基于 CLIP 的通用、可迁移、定向对抗攻击