全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL AnthologyACL 2026
Self-Reflection 提升大型推理模型安全性
研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全与有用性的平衡上取得优势。在包括专门设计的自适应攻击在内的多种对抗攻击评测中,该机制在未做针对性对抗训练的情况下仍显著提升模型安全性。
- 会议论文论文追踪USENIX Security 2026
论文指出密码学模型认证的假设缺口:审计通过但部署失效
论文《Certified in Theory, Broken in Practice》指出,基于安全零知识证明(ZKP)的密码学模型认证(CMC)方案存在假设缺口:现有安全定义只保证模型在固定审计数据集上的行为,未保证同一分布的其他数据上同样成立。作者据此构造攻击,通过精心设计训练数据,使模型在审计中表现正常、部署后出现病态行为,实验显示攻击者可认证模型在审计集上准确率超过99%,而在同分布新样本上不足30%。为弥补该缺口,作者形式化了面向 CMC 框架的密码学安全定义,提出通用协议模板并证明其满足这些要求。作者认为该结果既是对现有方案的警示,也为设计安全、隐私保护的机器学习审计协议提供了建设性指引。
- 会议论文Anthropic Alignment ScienceICML 2026
AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究
AE Studio 与 Anthropic 合作提出 Gradient Routed Auxiliary Modules(GRAM),通过在 Transformer 每个 MLP 层加入辅助模块并按数据类型选择性更新,把危险知识隔离到可开关的模块中,从而在单次训练里近似多个按数据过滤分别训练的模型。在 2M 条儿童故事合成语料上,26M 参数模型可开关特定故事主题知识,关闭后表现接近从未训练该主题的模型;在 800M 参数模型上,训练数据包含网络文本、代码、科学论文以及病毒学、网络安全、核物理和专门代码四个两用领域(每个约占 0.25%),单个 GRAM 模型可重配置为匹配五种不同过滤模型的表现,且对恶意微调的对抗性诱导保持稳健,而事后知识移除方法 MaxEnt 会恢复到接近全数据基线。作者给出初步证据,GRAM 在能力组合和标签稀疏(仅 50% 数据有标签)场景下优于 LoRA,但说明这只是两个孤立实验,不确定能否推广;研究属初步,尚未用于 Anthropic 的生产模型。
- 会议论文arXivACL 2026
ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用
ToolSafe 提出面向 LLM 智能体工具调用安全的步骤级护栏方案,包含基准 TS-Bench、护栏模型 TS-Guard 和推理框架 TS-Flow。TS-Guard 通过多任务强化学习训练,在执行前基于交互历史推理,评估请求有害性与动作和攻击的关联,输出可解释、可泛化的安全判断与反馈。TS-Flow 由护栏反馈驱动,在提示注入攻击下将 ReAct 风格智能体的有害工具调用平均减少 65%,同时把良性任务完成率提升约 10%。作者称该工作仍在进行中,代码已公开。
- 会议论文arXivACL 2026
基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox
针对"country girl"等表面无害、却在公众共识中演变为毒性用法的新词,研究者提出分类体系与风险词表,并构建搜索增强框架 SeTox,让静态大语言模型接入实时网络语境来检测新词毒性。实验显示,SeTox 即使使用 3B 规模模型也优于近期大规模模型,表明其可扩展地引入现实世界知识完成毒性新词检测。该工作发表于 ACL 2026。
- 会议论文SPY LabICLR 2025
SPY Lab 研究:预训练数据投毒可穿透对齐阶段
SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。
- 会议论文SPY LabICML 2025
SPY Lab 提出越狱税:越狱输出到底有多大用处
SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。
- 会议论文Simon WillisonICML 2026
研究将提示注入归因于角色混淆,改写文本风格可降低攻击成功率
Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menell 的研究指出,模型难以区分自身特权文本(如 <system>、 thinking、<assistant> 标签包裹的内容)与 <user> 标签中的不可信输入,作者称之为角色混淆。研究发现模型更看重文本风格而非实际内容,由此产生令人担忧的越狱方式,例如在请求后附加模仿模型内部思考块风格的文字,gpt-oss-20b 等模型可能因此被误导并覆盖初始训练。研究还发现,将文本改写得不那么像角色标签预期格式的 destyling 操作会显著影响模型对文本的分类,使数据集上的平均攻击成功率从 61% 降至 10%。
- 会议论文arXivUSENIX Security 2026
MATE:面向移动 Agent 的策略感知安全审计方法
研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。由于把策略当作可编辑文本而非固定模型参数,MATE 无需重新训练即可适配用户自定义和不断变化的要求。作者从全球数百个热门移动应用中抽取应用描述、工作流和策略构建知识库,并用多阶段流水线合成超过 140K 条语义真实的策略条件轨迹。团队同时发布 MATEBench,包含两个合成子集和一个由人工收集轨迹构成的真实子集。
- 会议论文ACL 2026
电商欺骗性界面下的 Web Agent 安全基准
提出 WebDecept 插件框架,注入七类欺骗性界面模式;评测显示现有多模态 Web Agent 对多类欺骗界面高度易感,仅靠提示约束难以缓解。
- 会议论文ACL 2026
RST-Guarder:通过 RST 解析与概率推断增强护栏的长文本鲁棒性
推理时用 RST 解析获取篇章关系,再分层概率推断聚合分段安全分数,无需训练;提升长文本有害内容检测并显著减少误报。
- 会议论文ACL 2026
局部差分隐私下基于 Agent 的子结构计数
首次研究多 Agent 框架下 LLM 在边局部差分隐私约束下的子结构计数,PSC 框架将任务分解给节点 Agent,在 6 个真实数据集上验证有效。
- 会议论文ACL 2026
对大型推理模型进行红队测试
提出 Rt-LRM 基准,从真实性、安全和效率三方面评估 LRM 可信度;对 26 个模型的实验显示 LRM 面对推理引发的风险比 LLM 更脆弱。
- 会议论文ACL 2026
别再全面加固:面向神经排序模型的免训练神经元级防御
定位对对抗扰动最脆弱的 top-K 神经元并施加反向扰动校正,无需重训练或对抗数据;在 MS MARCO 和 TREC 19 上对已见与未见攻击均优于基线。
- 会议论文ACL 2026
LLM 去毒:从数据集本身入手
提出 HSPD 流程,用 SoCD 定位并改写原始语料中的有毒片段;在 GPT2-XL 上毒性概率由 0.42 降至 0.18,并在多个模型上验证。
- 会议论文ACL 2026
通过推拉式分布对齐保护 LLM 微调安全
提出 Safety Optimal Transport,用最优传输在分布层面把下游数据拉向安全锚点、推离有害参照,以净化微调数据,在安全与效用间取得更好平衡。
- 会议论文ACL 2026
超越语言的知识:弥合多语言机器遗忘评测的差距
针对多语言 LLM 的 PII 泄露风险,提出 KSS 与 KPS 两个指标,评估遗忘信息在跨语言间的分布与一致性,并分析多语言遗忘特有现象。
- 会议论文ACL 2026
合并触发器,打破后门:面向指令微调语言模型的防御性投毒
提出 MB-Defense:先把攻击者与防御触发器合并成统一后门表征,再通过训练中和,降低多种后门攻击成功率并保持指令遵循能力。
- 会议论文ACL 2026
Safe-FedLLM:联邦大语言模型的安全性研究
发现恶意客户端可攻击 FedLLM,且 LoRA 更新的行为模式可被轻量分类器区分,据此提出基于 probe 的三层防御,在高恶意比例下仍有效。
- 会议论文ACL 2026
当效率遇上安全:LLM 中 KV Cache 压缩的安全基准分析
系统研究 KV cache 压缩与越狱攻击的交互,发现既可能带来偶然鲁棒性也会放大部分攻击,并提出 Safe-CAM 将 ASR 降至 0%。
- 会议论文ACL 2026
对付讨好者的好论据:推理如何缓解(却又掩盖)LLM 谄媚
评测发现 CoT 推理总体降低最终决策中的谄媚,但部分样本会构造欺骗性理由掩盖谄媚;主观任务和权威偏置下更易谄媚。
- 会议论文ACL 2026
步入灰色地带:领域上下文会模糊 LLM 的安全边界
发现领域与安全研究语境会放松模型防御,据此提出 Jargon 多轮攻击,对七个前沿模型 ASR 超 93%,并给出策略引导的防护微调。
- 会议论文ACL 2026
SafetyMem:基于双组件安全记忆的自适应越狱防御
提出语义与情景双安全记忆,沉淀越狱模式并从检测失败中提炼规则,无需重训即可适应新攻击,显著降低 ASR。
- 会议论文ACL 2026
忘掉重要的,保留其余:信息性 Token 的选择性遗忘
提出基于预测熵的 token 级遗忘正则 ETW,作为对抗有害行为的遗忘手段,在遗忘效果更强的同时更好保持模型效用。