全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
CrossGuard:保护 MLLM 免受联合模态隐式恶意攻击
用 RL 红队管线 ImpForge 生成隐式多模态样本,训练意图感知护栏 CrossGuard,对显式与隐式攻击防御均优于现有护栏。
- 会议论文ACL 2026
ImF:在大语言模型中嵌入隐式指纹
形式化针对模型指纹的移除攻击 GRI,并提出基于语言隐写的隐式指纹 ImF,在 15 个 LLM 上更隐蔽且可抵御更新与提示干预。
- 会议论文ACL 2026
用多片段视频越狱多模态大语言模型
构建 MCV SafetyBench,发现攻击成功率随片段数上升,视频比图像更脆弱,并提出利用图像模态相对鲁棒性的防御。
- 会议论文ACL 2026
别再盯着提示词:面向 LLM Agent 红队的推理劫持与约束收紧
提出 JailAgent,不修改用户提示,而是操纵 Agent 的推理轨迹与记忆检索,在跨模型、跨场景下表现突出。
- 会议论文ACL 2026
通过零空间约束将激活 steering 编译进权重以实现隐蔽后门
把拒答与顺从行为的 steering 向量编译为仅在触发器出现时生效的权重修改,并用零空间约束保持隐蔽,在多个对齐模型上实现高触发越狱成功率。
- 会议论文ACL 2026
针对 LLM 后门式指纹的抑制攻击
针对 LLM ensemble 场景提出 token filter 与 sentence verification 两种攻击,在保持集成性能的同时有效抑制后门指纹响应,优于现有攻击方法。
- 会议论文ACL 2026
剪除不安全彩票:让 LLM 更安全更稳健的资源高效框架
用无梯度归因找出并剪除与不安全行为相关的参数,在几乎不损失效用的情况下显著减少不安全生成并提升对越狱攻击的鲁棒性。
- 会议论文ACL 2026
TriPlay-RL:面向 LLM 安全对齐的三角色自博弈强化学习
攻击者、防御者、评估者三角色闭环强化学习,几乎无需人工标注;攻击有效性提升 20%–50%,防御安全性提升 10%–30% 且不损害通用推理。
- 会议论文ACL 2026
壳中的假朋友:揭示 LLM 的颜文字语义混淆漏洞
发现 LLM 会误读 ASCII 颜文字而执行非预期甚至破坏性操作,6 个模型平均混淆率超 38%,且该漏洞可迁移到 agent 框架,提示词缓解基本无效。
- 会议论文ACL 2026
超越表层检测:基于元操作推理的认知驱动越狱防御
提出 CDD 框架,通过结构化推理链识别掩盖有害意图的元操作,并用熵引导强化学习提升对未见越狱攻击的泛化防御。
- 会议论文ACL 2026
Audio Jailbreak:大型音频语言模型越狱的开放综合基准
构建含 1,495 条对抗音频提示的 AJailBench,并用音频扰动工具包生成优化变体;评测显示没有模型表现出一致的鲁棒性,微小扰动即可显著降低安全性。
- 会议论文ACL 2026
当个性化使风险合法化:个性化对话 Agent 的安全漏洞
发现良性个人记忆会使模型把有害请求当作合理,相对无状态基线攻击成功率提升 15.8%–243.7%;提供表示空间证据,并提出轻量检测-反思方法。
- 会议论文ACL 2026
SoundBreak:对三模态模型纯音频对抗攻击的系统研究
研究针对音频-视频-语言模型的纯音频无目标对抗攻击,攻击成功率最高达 96%,在低感知失真及房间混响下仍有效,跨模型迁移性有限。
- 会议论文ACL 2026
OASIS:通过正交自适应安全对齐策略缓解 LLM 有害微调攻击
将扰动投影到与有害梯度正交的方向,并只优化自适应选出的安全关键层;在 4 个 LLM 上将 Harmful Score 降低约 60%,下游效用保持稳定。
- 会议论文ACL 2026
用偏差拟合缓解 RLHF 中奖励模型的长度偏差
提出 FiMi-RM,拟合并校正奖励模型中长度与奖励的非线性关系,缓解长度偏差型奖励作弊,在 DPO 和 BoN 上降低冗长。
- 会议论文ACL 2026
N-GLARE:非生成式的潜表示高效 LLM 安全评估器
仅基于隐层表示的轨迹和 JSS 指标评估安全鲁棒性,在 40 多个模型和 20 种红队策略上与红队排名高度一致,开销不到 1%。
- 会议论文ACL 2026
检测查询意图:用 FFN 输出激活监测实现 LLM 安全 steering
以 FFN 输出激活区分有害与良性查询并选择性干预,在多种越狱攻击下达到领先防御效果,同时基本保持良性任务性能。
- 会议论文ACL 2026
超越显式拒答:针对 RAG 的软失效攻击
提出 DEJA 黑盒进化攻击,生成对抗文档诱使 RAG 输出流畅但无信息量的回答,可绕过困惑度检测和输入扰动等防御。
- 会议论文ACL 2026
用特征叠加几何理解涌现式错位
用 SAE 发现诱发错位的数据特征与有害特征在几何上更近,据此过滤最接近有毒特征的训练样本,使错位降低 34.5%。
- 会议论文ACL 2026
基于双层图异常检测的 LLM 多智能体系统可解释细粒度防护
提出 XG-Guard,结合句子级与 token 级表示和主题异常检测来识别多智能体系统中的恶意 agent,并给出可解释依据。
- 会议论文ACL 2026
评估 LLM 辅导员在对抗性学生攻击下的答案泄露鲁棒性
将对抗与说服技巧引入教育场景,微调出可越狱 LLM 辅导员的学生 agent 作为基准核心,并提出降低答案泄露的简单防御。
- 会议论文ACL 2026
反转护盾:从策略规范系统化生成安全测试
POLARIS 把自然语言策略编译为一阶逻辑并构建语义策略图,生成可追溯的测试查询,策略覆盖率和攻击成功数均优于基线。
- 会议论文ACL 2026
好人难说真话:角色扮演语言模型中由宜人性驱动的谄媚
在 13 个小型开源模型上测试发现,9 个模型中人设宜人性与谄媚率显著正相关,相关系数最高达 0.87。
- 会议论文ACL 2026
LLM 文化禁忌安全中的“知识—行为鸿沟”
提出覆盖 77 个国家和地区、2000 多条禁忌的 CulShield 基准,发现模型知道禁忌却常在交互中不遵守。