全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
Red Queen:揭示大语言模型中潜在的多轮风险
提出多轮隐藏恶意意图的 Red Queen 攻击,在 GPT-4o 上 ASR 达 87.6%,且大模型更易受攻击;所提 Red Queen Guard 可将 ASR 降至 1% 以下。
- 会议论文ACL 2025
机器生成文本检测的压力测试:转变语言模型写作风格以欺骗检测器
用 DPO 微调使生成文本风格趋近人类写作,仅需少量样本即可显著降低 Mage、Radar 等主流检测器的检测性能。
- 会议论文ACL 2025
GOODLIAR:基于强化学习的欺骗性 Agent,用于扰乱 LLM 对基础原则的信念
提出 RL 框架生成欺骗性上下文,改写 LLM 对数学或哲学等基本公理的信念,效果优于简单多轮提示方法。
- 会议论文ACL 2025
Rewrite to Jailbreak:发现可学习且可迁移的隐式有害指令
提出黑盒越狱方法 R2J,仅通过改写原指令并迭代优化策略即可越狱,无额外特征、更难识别,并可迁移到多种数据集和模型。
- 会议论文ACL 2025
QueryAttack:用结构化非自然查询语言越狱对齐模型
将恶意请求转换为结构化非自然查询语言以绕过安全对齐,在主流模型及多种防御下取得较高攻击成功率。
- 会议论文ACL 2025
思维链推理真的能降低越狱危害吗?
理论分析表明思维链推理对越狱危害具有双重作用,并提出FicDetail越狱方法,以实验验证理论发现。
- 会议论文ACL 2025
CAVGAN:通过内部表征生成对抗攻击统一越狱与防御
利用生成对抗网络学习模型内部安全判别边界,在三款模型上平均越狱成功率为88.85%,防御成功率为84.17%。
- 会议论文ACL 2025
SQL注入式越狱:大语言模型的结构性安全缺陷
提出针对输入提示构造方式的SIJ越狱,五款开源模型攻击成功率接近100%,五款闭源模型平均超过85%。
- 会议论文ACL 2025
Mousetrap:通过迭代混沌链越狱大型推理模型
将迭代生成的混沌映射嵌入推理链实施越狱,在Trotter数据集上对三款模型的攻击成功率分别达96%、86%和98%。
- 会议论文ACL 2025
突破上限:通过扩展策略空间探索越狱攻击潜力
通过分解攻击策略并结合遗传优化扩展搜索空间,在所测Claude-3.5上取得超过90%的越狱成功率,并展现跨模型迁移性。
- 会议论文ACL 2025
Chain of Attack:通过多轮审讯隐藏意图的越狱攻击
提出 CoA,从审讯视角生成多轮攻击链以隐藏越狱意图,对黑盒 LLM 的攻击成功率达 83%,高于对比方法的 64%。
- 会议论文ACL 2025
Chain-of-Jailbreak:通过逐步编辑攻击图像生成模型
将恶意查询拆成多个子查询并逐步编辑图像,绕过防护的比例超 60%(其他方法 14%),并提出 Think-Twice Prompting 防御超 95% 的攻击。
- 会议论文ACL 2025
Crabs:黑盒场景下自动生成提示的 LLM-DoS 资源消耗攻击
提出 AutoDoS,在黑盒下构建 DoS 攻击树并迭代优化,使服务响应延迟放大超 250 倍,并可借 Length Trojan 绕过现有防御。
- 会议论文ACL 2025
沉默的破坏者:针对黑盒 RAG 系统的不可察觉对抗攻击
提出基于强化学习的 ReGENT,用人眼难以察觉的小扰动让目标文档被检索并误导 RAG 的最终回答,效果优于现有攻击方法。
- 会议论文ACL 2025
SemanticCamo:通过语义伪装越狱大语言模型
提出 SemanticCamo,用语义特征替换不安全内容以隐藏恶意意图,对 GPT-4o、Claude-3.5 等平均超过 80% 的情况诱导出有害回答,且对多种防御有效。
- 会议论文ACL 2025
谁能抵御聊天音频攻击?大型音频语言模型评测基准
提出含四类音频攻击的 CAA 基准,评估六个语音交互 LALM 的鲁棒性,结果显示 GPT-4o 抗攻击能力最强。
- 会议论文ACL 2025
效率之下的暗礁:小语言模型中越狱攻击的隐藏威胁
实证评估 13 个 SLM 在多种越狱攻击下的安全性,多数易受攻击;防御方法有效,并分析了压缩、量化、蒸馏等技术造成的安全退化。
- 会议论文ACL 2025
MVTamperBench:评测视觉语言模型对视频篡改的鲁棒性
构建含约 1.7 万篡改视频片段的基准,评测 45 个 MLLM 对五类篡改的抵抗力,发现鲁棒性差异大且参数量更大不一定更稳健。
- 会议论文ACM CCS 2025
一个代理骗所有模型:基于 CLIP 的通用、可迁移、定向对抗攻击
- 会议论文ACM CCS 2025
攻破纸质选票:投票遇上对抗机器学习
- 会议论文ACM CCS 2025
天气预报中的对抗性观测
- 会议论文ACM CCS 2025
GASLITE:探索基于稠密嵌入的检索中的漏洞
- 会议论文ACM CCS 2025
评估生产级恶意软件检测系统对可迁移对抗攻击的鲁棒性
- 会议论文ICLR 2025
AdvWave:针对大音频语言模型的隐蔽对抗越狱攻击
提出首个针对大音频语言模型的越狱攻击框架AdvWave,通过双阶段梯度优化和自然环境音伪装,在保持音频自然隐蔽的同时大幅提高了越狱成功率。