全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL AnthologyACL 2026
Self-Reflection 提升大型推理模型安全性
研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全与有用性的平衡上取得优势。在包括专门设计的自适应攻击在内的多种对抗攻击评测中,该机制在未做针对性对抗训练的情况下仍显著提升模型安全性。
- 会议论文Anthropic Alignment ScienceICML 2026
AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究
AE Studio 与 Anthropic 合作提出 Gradient Routed Auxiliary Modules(GRAM),通过在 Transformer 每个 MLP 层加入辅助模块并按数据类型选择性更新,把危险知识隔离到可开关的模块中,从而在单次训练里近似多个按数据过滤分别训练的模型。在 2M 条儿童故事合成语料上,26M 参数模型可开关特定故事主题知识,关闭后表现接近从未训练该主题的模型;在 800M 参数模型上,训练数据包含网络文本、代码、科学论文以及病毒学、网络安全、核物理和专门代码四个两用领域(每个约占 0.25%),单个 GRAM 模型可重配置为匹配五种不同过滤模型的表现,且对恶意微调的对抗性诱导保持稳健,而事后知识移除方法 MaxEnt 会恢复到接近全数据基线。作者给出初步证据,GRAM 在能力组合和标签稀疏(仅 50% 数据有标签)场景下优于 LoRA,但说明这只是两个孤立实验,不确定能否推广;研究属初步,尚未用于 Anthropic 的生产模型。
- 会议论文arXivACL 2026
ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用
ToolSafe 提出面向 LLM 智能体工具调用安全的步骤级护栏方案,包含基准 TS-Bench、护栏模型 TS-Guard 和推理框架 TS-Flow。TS-Guard 通过多任务强化学习训练,在执行前基于交互历史推理,评估请求有害性与动作和攻击的关联,输出可解释、可泛化的安全判断与反馈。TS-Flow 由护栏反馈驱动,在提示注入攻击下将 ReAct 风格智能体的有害工具调用平均减少 65%,同时把良性任务完成率提升约 10%。作者称该工作仍在进行中,代码已公开。
- 会议论文arXivACL 2026
基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox
针对"country girl"等表面无害、却在公众共识中演变为毒性用法的新词,研究者提出分类体系与风险词表,并构建搜索增强框架 SeTox,让静态大语言模型接入实时网络语境来检测新词毒性。实验显示,SeTox 即使使用 3B 规模模型也优于近期大规模模型,表明其可扩展地引入现实世界知识完成毒性新词检测。该工作发表于 ACL 2026。
- 会议论文SPY LabICLR 2025
SPY Lab 研究:预训练数据投毒可穿透对齐阶段
SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。
- 会议论文SPY LabICML 2025
SPY Lab 提出越狱税:越狱输出到底有多大用处
SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。
- 会议论文arXivUSENIX Security 2026
MATE:面向移动 Agent 的策略感知安全审计方法
研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。由于把策略当作可编辑文本而非固定模型参数,MATE 无需重新训练即可适配用户自定义和不断变化的要求。作者从全球数百个热门移动应用中抽取应用描述、工作流和策略构建知识库,并用多阶段流水线合成超过 140K 条语义真实的策略条件轨迹。团队同时发布 MATEBench,包含两个合成子集和一个由人工收集轨迹构成的真实子集。
- 会议论文ACL 2026
RST-Guarder:通过 RST 解析与概率推断增强护栏的长文本鲁棒性
推理时用 RST 解析获取篇章关系,再分层概率推断聚合分段安全分数,无需训练;提升长文本有害内容检测并显著减少误报。
- 会议论文ACL 2026
别再全面加固:面向神经排序模型的免训练神经元级防御
定位对对抗扰动最脆弱的 top-K 神经元并施加反向扰动校正,无需重训练或对抗数据;在 MS MARCO 和 TREC 19 上对已见与未见攻击均优于基线。
- 会议论文ACL 2026
LLM 去毒:从数据集本身入手
提出 HSPD 流程,用 SoCD 定位并改写原始语料中的有毒片段;在 GPT2-XL 上毒性概率由 0.42 降至 0.18,并在多个模型上验证。
- 会议论文ACL 2026
通过推拉式分布对齐保护 LLM 微调安全
提出 Safety Optimal Transport,用最优传输在分布层面把下游数据拉向安全锚点、推离有害参照,以净化微调数据,在安全与效用间取得更好平衡。
- 会议论文ACL 2026
Safe-FedLLM:联邦大语言模型的安全性研究
发现恶意客户端可攻击 FedLLM,且 LoRA 更新的行为模式可被轻量分类器区分,据此提出基于 probe 的三层防御,在高恶意比例下仍有效。
- 会议论文ACL 2026
SafetyMem:基于双组件安全记忆的自适应越狱防御
提出语义与情景双安全记忆,沉淀越狱模式并从检测失败中提炼规则,无需重训即可适应新攻击,显著降低 ASR。
- 会议论文ACL 2026
忘掉重要的,保留其余:信息性 Token 的选择性遗忘
提出基于预测熵的 token 级遗忘正则 ETW,作为对抗有害行为的遗忘手段,在遗忘效果更强的同时更好保持模型效用。
- 会议论文ACL 2026
CrossGuard:保护 MLLM 免受联合模态隐式恶意攻击
用 RL 红队管线 ImpForge 生成隐式多模态样本,训练意图感知护栏 CrossGuard,对显式与隐式攻击防御均优于现有护栏。
- 会议论文ACL 2026
剪除不安全彩票:让 LLM 更安全更稳健的资源高效框架
用无梯度归因找出并剪除与不安全行为相关的参数,在几乎不损失效用的情况下显著减少不安全生成并提升对越狱攻击的鲁棒性。
- 会议论文ACL 2026
TriPlay-RL:面向 LLM 安全对齐的三角色自博弈强化学习
攻击者、防御者、评估者三角色闭环强化学习,几乎无需人工标注;攻击有效性提升 20%–50%,防御安全性提升 10%–30% 且不损害通用推理。
- 会议论文ACL 2026
超越表层检测:基于元操作推理的认知驱动越狱防御
提出 CDD 框架,通过结构化推理链识别掩盖有害意图的元操作,并用熵引导强化学习提升对未见越狱攻击的泛化防御。
- 会议论文ACL 2026
检测查询意图:用 FFN 输出激活监测实现 LLM 安全 steering
以 FFN 输出激活区分有害与良性查询并选择性干预,在多种越狱攻击下达到领先防御效果,同时基本保持良性任务性能。
- 会议论文ACL 2026
DIA-HARM:50 种英语方言下有害内容检测的差异
构建覆盖 50 种方言的虚假信息检测基准,评测 16 个检测模型,发现方言内容使检测性能下降,部分模型严重失效。
- 会议论文ACL 2026
ReasoningGuard:用推理时安全顿悟时刻保护大型推理模型
利用注意力定位推理关键点并注入安全反思,配合采样策略,无需微调即可抵御四类越狱,优于九种现有防护。
- 会议论文ACL 2026
HiddenGuard:基于专用表征路由器的细粒度安全生成
利用隐藏状态做 token 级有害内容检测与遮蔽,不必整体拒答,有害内容检测与遮蔽 F1 超过 90%。
- 会议论文ACL 2026
基于大模型的孟加拉语仇恨言论多任务检测
构建涵盖类型、严重程度与目标的孟加拉语仇恨言论数据集,发现LoRA微调大模型可媲美BanglaBERT,但文化语境预训练仍很重要。
- 会议论文ACL 2026
可审计潜在思维链对齐:化解安全与可审计性困境
ALCA将安全推理移入潜在空间,并通过受限自解码支持审计,相比强基线使自适应越狱成功率降低超过40%,同时保持性能。