全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 论文arXiv:越狱、提示注入、投毒与防御
研究者提出 Controlled Decoding Attacks,通过纯文本接口越狱黑盒 LLM
研究者提出一种针对黑盒大语言模型的越狱框架,仅通过允许重复采样和助手前缀续写的纯文本接口实施攻击,无需模型权重或数值 token 概率。该方法用采样输出结合未观测动作先验重建分布,再依据响应前缀决定在哪些位置重建和修改分布,并用推测式多 token 执行摊薄目标调用成本。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。
- 动态DeepMind Safety Research
DeepMind 提出一致性训练,可限制谄媚与越狱
DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。
- 论文arXiv:越狱、提示注入、投毒与防御
ACTR:对齐推理与回答以提升推理大语言模型的多语言安全
研究者提出 ACTR 框架,通过强化推理大语言模型已有的安全推理来提升多语言安全对齐。方法先用 think gap score(TGS)比较不同语言下推理痕迹对注意力输出的归一化贡献,并用推理痕迹替换衡量跨语言安全差距;再用越狱查询语料,通过神经元掩码引起的回答表示变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理的安全 think 神经元;最后提出 neuron-selective consistency optimization(NSCO),用冻结的评判模型奖励推理痕迹与回答在安全类别上的一致,只更新选定神经元相关参数,无需人工标注回答或偏好数据。
- 论文arXiv:越狱、提示注入、投毒与防御
ToolFence:为工具调用 LLM Agent 提供细粒度授权
ToolFence 通过在执行前编译类型化授权蓝图并由确定性监控器执行,把用户授权值与不可信观测区分开,以应对保留工具但篡改参数的 within-tool 攻击。
- 动态Google DeepMind
Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆
Google DeepMind 公布 Private AI Compute 架构更新,新增服务端持久记忆层,让 AI 助手跨设备保留上下文,同时维持端侧级别的隐私标准。
- 会议论文ACL 2026
RST-Guarder:通过 RST 解析与概率推断增强护栏的长文本鲁棒性
推理时用 RST 解析获取篇章关系,再分层概率推断聚合分段安全分数,无需训练;提升长文本有害内容检测并显著减少误报。
- 会议论文ACL 2026
别再全面加固:面向神经排序模型的免训练神经元级防御
定位对对抗扰动最脆弱的 top-K 神经元并施加反向扰动校正,无需重训练或对抗数据;在 MS MARCO 和 TREC 19 上对已见与未见攻击均优于基线。
- 会议论文ACL 2026
LLM 去毒:从数据集本身入手
提出 HSPD 流程,用 SoCD 定位并改写原始语料中的有毒片段;在 GPT2-XL 上毒性概率由 0.42 降至 0.18,并在多个模型上验证。
- 会议论文ACL 2026
通过推拉式分布对齐保护 LLM 微调安全
提出 Safety Optimal Transport,用最优传输在分布层面把下游数据拉向安全锚点、推离有害参照,以净化微调数据,在安全与效用间取得更好平衡。
- 会议论文ACL 2026
Safe-FedLLM:联邦大语言模型的安全性研究
发现恶意客户端可攻击 FedLLM,且 LoRA 更新的行为模式可被轻量分类器区分,据此提出基于 probe 的三层防御,在高恶意比例下仍有效。
- 会议论文ACL 2026
SafetyMem:基于双组件安全记忆的自适应越狱防御
提出语义与情景双安全记忆,沉淀越狱模式并从检测失败中提炼规则,无需重训即可适应新攻击,显著降低 ASR。
- 会议论文ACL 2026
忘掉重要的,保留其余:信息性 Token 的选择性遗忘
提出基于预测熵的 token 级遗忘正则 ETW,作为对抗有害行为的遗忘手段,在遗忘效果更强的同时更好保持模型效用。
- 会议论文ACL 2026
CrossGuard:保护 MLLM 免受联合模态隐式恶意攻击
用 RL 红队管线 ImpForge 生成隐式多模态样本,训练意图感知护栏 CrossGuard,对显式与隐式攻击防御均优于现有护栏。
- 会议论文ACL 2026
剪除不安全彩票:让 LLM 更安全更稳健的资源高效框架
用无梯度归因找出并剪除与不安全行为相关的参数,在几乎不损失效用的情况下显著减少不安全生成并提升对越狱攻击的鲁棒性。
- 会议论文ACL 2026
TriPlay-RL:面向 LLM 安全对齐的三角色自博弈强化学习
攻击者、防御者、评估者三角色闭环强化学习,几乎无需人工标注;攻击有效性提升 20%–50%,防御安全性提升 10%–30% 且不损害通用推理。
- 会议论文ACL 2026
超越表层检测:基于元操作推理的认知驱动越狱防御
提出 CDD 框架,通过结构化推理链识别掩盖有害意图的元操作,并用熵引导强化学习提升对未见越狱攻击的泛化防御。
- 会议论文ACL 2026
检测查询意图:用 FFN 输出激活监测实现 LLM 安全 steering
以 FFN 输出激活区分有害与良性查询并选择性干预,在多种越狱攻击下达到领先防御效果,同时基本保持良性任务性能。
- 会议论文ACL 2026
DIA-HARM:50 种英语方言下有害内容检测的差异
构建覆盖 50 种方言的虚假信息检测基准,评测 16 个检测模型,发现方言内容使检测性能下降,部分模型严重失效。
- 会议论文ACL 2026
ReasoningGuard:用推理时安全顿悟时刻保护大型推理模型
利用注意力定位推理关键点并注入安全反思,配合采样策略,无需微调即可抵御四类越狱,优于九种现有防护。
- 会议论文ACL 2026
HiddenGuard:基于专用表征路由器的细粒度安全生成
利用隐藏状态做 token 级有害内容检测与遮蔽,不必整体拒答,有害内容检测与遮蔽 F1 超过 90%。
- 会议论文ACL 2026
基于大模型的孟加拉语仇恨言论多任务检测
构建涵盖类型、严重程度与目标的孟加拉语仇恨言论数据集,发现LoRA微调大模型可媲美BanglaBERT,但文化语境预训练仍很重要。
- 会议论文ACL 2026
可审计潜在思维链对齐:化解安全与可审计性困境
ALCA将安全推理移入潜在空间,并通过受限自解码支持审计,相比强基线使自适应越狱成功率降低超过40%,同时保持性能。
- 会议论文ACL 2026
多思少言:将审慎安全推理内化到大模型参数
HIAR通过逐层LoRA更新内化安全推理,无需生成显式安全思维链,相比强基线将越狱攻击成功率降低43%。
- 会议论文ACL 2026
SMARTER:大模型自增强的低数据可解释毒性检测
结合合成解释、偏好优化和跨模型训练,仅使用6%至57%的训练数据,宏平均F1较少样本基线最高提升13%。