全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv
研究者提出梯度封堵实现 LLM 发布前的预防性遗忘
研究者提出梯度封堵(gradient sealing)方法,用于在开放权重 LLM 发布前阻止下游微调重新习得被禁能力。作者先验证现有回顾式遗忘方法在发布前防护上不足:即使当前输出已抑制被禁能力,被禁领域数据仍能通过内部通路产生梯度,使能力在后续微调中被重新获得。梯度封堵的原理是把相关预激活推入负区间,使 ReLU 族激活的导数变为零或接近零,从而阻断这些通路。在多个 LLM 系列上的实验显示,该方法对下游能力习得的抵抗强于回顾式基线。
- 论文arXiv:后门、投毒与隐私
Unmerge:用任务算术实现高效机器遗忘
Unmerge 将机器遗忘重构为任务算术的逆运算:微调得到的合并任务向量减去低秩遗忘分量即可恢复保留任务向量,因为遗忘激活在每层都集中在少数主方向构成的子空间内。在 CIFAR-100 和 Tiny ImageNet 上对 ResNet-50 做类别级遗忘时,其 Tug-of-War 指标比同等运行时间的基线最高提升约 24%,比运行慢约 5 倍的更强基线最高提升约 18%,成员推断暴露维持在重训练水平。该方法同样适用于 ViT-S/16,并可扩展到 Llama-3.2-3B,其逐层基几何还可作为判断遗忘何时何地结构性困难的诊断工具。
- 论文arXiv:后门、投毒与隐私
NDDL:用正常扩散动力学为文生图模型做后门防御
研究者提出 Normal Diffusion Dynamics Learning(NDDL),一种仅用正常样本训练的文生图扩散模型后门防御框架。该方法观察到正常扩散轨迹在 cross-attention、潜空间和噪声空间中呈现结构化且随 timestep 变化的转移模式,而后门攻击会使其偏离这种正常演化。NDDL 构建紧凑的多空间轨迹表示,训练一个以 timestep 为条件的动力学模型来预测扩散演化,推理时用观测转移与预测转移之间的偏差量化动力学不一致性以检测后门。该框架还能在无需任何后门先验知识的情况下,通过低语义词替换实现触发器定位。多种后门攻击上的实验显示其有效性与泛化性。
- 动态arXiv:Agent 与 MCP 安全
可验证操作卡 VAC:为自主 Agent 提供可信人在回路控制
论文提出可验证操作卡(VAC),一种从真实待执行的浏览器操作和可信意图来源重建审批信息、在可信浏览器界面中带外渲染、并把审批绑定到派发时重新验证的同一操作的架构级防护。VAC 结合来源隔离、真实操作描述符、默认拒绝确认、来源感知风险门控和执行绑定,并在一个完整的智能体浏览器中实现。在覆盖混淆代理攻击、Lies-in-the-Loop 对话伪造、间接提示注入、自适应操作替换、来源规避和正常任务的 24 场景基准上,无 VAC 时各评测 LLM 的攻击成功率为 68% 至 100%,VAC 将每个模型的攻击成功率降至 0%,正常任务完成率 78%,误拦截率 0%。
- 动态arXiv:越狱、提示注入、投毒与防御
ACTR:对齐推理链与回答以提升推理大模型的多语言安全
研究者提出 ACTR 框架,通过强化推理大模型已有的安全推理来提升多语言安全对齐。该框架先用 think gap score(TGS)比较不同语言下推理链对注意力输出的归一化贡献,并用推理链替换衡量跨语言安全差距;再借助越狱查询语料,通过神经元掩码引起的回答表征变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理使用的 safety think neurons;最后提出 neuron-selective consistency optimization(NSCO),用冻结的 judge 模型奖励推理链与回答在安全类别上的一致,只更新选定神经元的参数,无需人工标注回答或偏好数据。
- 论文arXiv:越狱、提示注入、投毒与防御
CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱
研究者提出 CodeMimicry,一个全自动黑盒越狱框架,把恶意意图嵌入语法合法的面向对象代码,借代码补全任务诱导模型输出有害内容。在 8 个商用大语言模型上,该方法在 AdvBench 上达到 96.25% 攻击成功率、平均仅 1.51 次查询,在 HarmBench 上为 96.07% 与 1.46 次查询,明显优于模板类和优化类基线。作者将这一现象归因于安全泛化滞后,即主要在自然语言上训练的对齐难以迁移到代码域,形成代码补全盲区。潜空间分析显示,成功的越狱样本在表示上接近良性代码,并系统性地避开拒答方向;激活引导实验进一步支持这一解释。作者也指出,该方法依赖目标模型的代码生成能力,且对注释与 docstring 这类字符串侧信道有依赖,正则过滤注释后攻击成功率降至 20% 至 26%。
- 论文arXiv:危险能力与安全评测
研究评估语言模型在长对抗对话中的安全性
研究测试了三个开源权重、指令微调模型在长对抗对话中能否持续安全回应,用第二个语言模型扮演持续对抗用户,由安全分类器标注每条回复是否安全。在全部模型与有害提示组合中,首轮安全回复率为 85% 至 100%,到第 11 轮降至 38% 至 61%,到第 101 轮降至 15% 至 44%。这一下降跨模型出现,并远超多轮安全评测通常采用的短交互长度。作者认为,这提供了单轮安全表现未必延续到持续对抗交互的概念验证证据,说明需要长时程评测和考虑跨轮风险累积的对话级防护。
- 论文arXiv:越狱、提示注入、投毒与防御
推理层安全:防御对抗性推理与基础设施滥用
论文研究 LLM 服务在推理层面临的对抗性交互,包括越狱、拒绝服务与知识蒸馏攻击,并以假设的前沿实验室 Five Elements Inc. 为例展开。由于缺少公开的对抗性 LLM 使用标注数据集,作者提出结构因果模型(SCM)生成带标签的用户会话数据集,包含协同多账号活动、平台反馈和三个层级的标签可观测性。在该数据集上训练的梯度提升检测器对 oracle 标签的二元分类 AUPRC 达 0.993,但面对真实 Trust & Safety 团队持有的运营标签时 AUPRC 仅 0.313,说明检测器比用于评估它的标签更准确。攻击类型归因方面,朴素 argmax 受 98% 良性先验主导,macro-F1 仅 0.295,改用简单阈值决策引擎后提升到 0.489 且不损失准确率。数据集已公开。
- 论文arXiv:越狱、提示注入、投毒与防御
ContractWarden:用人类授权契约在内核层为 AI Agent 划定损害边界
ContractWarden 是一个 Linux 参考监视器,通过人类授权的契约在内核层为 AI Agent 划定损害边界,不信任 Agent 本身或其策略建议。模型可以提出 allow、deny 或 no_egress 三态资产契约,但由人类做最终选择;执行门在不可信代码运行前把契约绑定到具体任务,再由基于 eBPF 的 LSM 数据平面执行文件与网络决策,并将 no_egress 沿进程、普通文件、管道、FIFO 和受支持的 Unix-domain socket 单调传播。在 19 项安全测试的 570 次运行中,全部满足预设的返回值与副作用标准。在三项同机文件 I/O 负载上,Linux 6.15 虚拟机中的中位开销为 11.96%–12.89%,物理平台为 35.79%–61.54%,低于所评估的冻结版 ActPlane 基线。
- 论文arXiv
S³:用多阶段防御提升 LLM 智能体安全
论文提出 Stage-Specific Safety Skills 抽象,把异构安全设计表示为带明确阶段语义的可复用、可组合组件,并给出自动化转换流程和社区驱动的安全技能库。在此基础上提出 S³ 多阶段防御框架,由 guard agent 编排各阶段安全技能,在智能体工作流的记忆、规划、工具执行等环节做风险检测与缓解。作者同时构建 Multi-Stage Risk Benchmark(MSRB)评估各阶段代表性风险,实验显示 S³ 在安全有效性和效用保持上均优于代表性 SOTA 基线。论文认为阶段特定安全技能可作为构建韧性智能体系统的可扩展、可组合基础。
- 论文arXiv
互补 LLM 水印如何追踪来源并检测篡改
针对现有 LLM 水印在保留来源归属的同时可被"搭便车欺骗"篡改关键内容的问题,研究者提出一种同时提供来源证明与篡改证据的水印,在每个生成 token 中共同嵌入一个鲁棒信号和一个脆弱信号。两个信号机制相同但使用独立密钥和不同种子窗口,脆弱信号对读者可见的改动敏感;检测时两个分数构成二维空间,支持 Intact、Tampered、No-Watermark 三种判定。在两个大语言模型和两个提示数据集上,该方法在评测方法中取得最高篡改检测率,同时保持有竞争力的归属鲁棒性和困惑度。
- 论文arXiv
Tripwire:通过统计认证的安全神经元触发对齐拒答
Tripwire 是一种免训练防御方法,通过逐神经元假设检验并在错误发现率控制下识别安全特异性神经元,再用效用特异性过滤器排除对模型效用重要的神经元。识别后采用触发式钳制,将选定神经元固定在有害条件下的平均激活值上,注入内部有害输入信号以触发对齐阶段学到的拒答行为。该钳制有两种可证明等价的部署方式,即检测器门控的推理时干预和离线 bias-patch 权重编辑。在四个安全对齐 LLM 和四类代表性攻击上的实验显示,Tripwire 将平均攻击成功率降至最高 2.0%,在 MT-Bench 上的效用损失仅为 0.5% 至 5.3%,为所有防御方法中最小。代码已公开。
- 论文arXiv
RACER:面向多模态大模型后门的区域感知一致性修复框架
论文提出 RACER,一个模型级的多模态大模型后门修复框架,通过抑制内部表征的层级不一致异常来从源头移除后门。作者观察到后门会在内部表征中引发层级间演化异常,即层级不一致异常,且该异常与模态相关,主要集中在编码触发特征的 token 区域。RACER 据此把融合表征拆分为视觉与文本 token 区域,分别归一化其层级不一致性,再在深层窗口内以模态感知权重重组,形成区域感知的不一致目标,并通过 min-max 优化合成最坏情况扰动、对扰动做对抗微调来修复模型。该方法只需 100 条干净样本,不需要知道触发器、攻击目标,甚至不需要知道输入模型是否含后门。
- 论文arXiv
AdaGuard:支持用户自定义策略的自适应护栏模型
作者提出 AdaGuard,一组 0.6B、4B 和 8B 的护栏模型,可在推理时按用户提供的策略评估 Agent 轨迹是否违规。为支持这一能力,作者构建 AdaptiveSafety 数据集,包含 10,939 条训练样本和 1,000 条测试样本,覆盖 1 至 100 条规则的策略,并结合策略与行为反事实,为每条样本配解释和完整违规规则集合。训练方法 SafePO 是一种强化学习算法,用结构化奖励评估预测正确性,在响应层面保留组相对优势,并用单独训练的价值模型调节解释与判定区域的 token 权重。4B 模型在 AdaptiveSafety 上二分类准确率为 89.30%,在 DynaBench 上为 71.82%。
- 论文arXiv
DenMark:面向扩散语言模型的鲁棒语义水印
DenMark 是面向扩散语言模型(DLM)的语义水印框架,将密钥相关信号直接注入去噪过程。它把输出划分为固定 token 区域,用临时 rollout 作为语义前瞻,估计未完成区域的最终语义,从而优先选择语义水印得分更高的局部更新,并在检测时通过校准扫描候选单元尺寸应对语义攻击带来的边界偏移。在 4 个 DLM、3 个数据集和 4 种语义攻击共 48 种组合中,DenMark 在所有检测指标上均取得最佳结果。
- 论文arXiv:后门、投毒与隐私
DP-BR-FedAvg:面向银行与医疗的差分隐私拜占庭鲁棒联邦学习框架
针对联邦学习中参数更新泄露隐私与恶意客户端投毒两大问题,研究者提出 DP-BR-FedAvg 框架,将高斯机制差分隐私层与逐坐标截断均值拜占庭鲁棒聚合规则结合,在模拟跨机构欺诈与临床风险评分任务上评估。在 20 个客户端、其中四分之一为拜占庭节点、共 60 轮通信的设置下,FedAvg 在少数类上崩溃(F1 仅 0.030),该框架恢复至 F1 0.119,同时限制单个客户端贡献的隐私损失。无隐私层的拜占庭鲁棒聚合器原始准确率最高,量化了隐私对鲁棒性的代价,表明两类机制是相互作用而非简单叠加。
- 论文arXiv:后门、投毒与隐私
TRIM:面向多种后门触发器的黑盒检测与净化方法
研究者提出 TRIM(Trigger Removal by Identifying Manipulated Regions),一种面向部署的黑盒后门防御方法,可在推理时检测并选择性移除后门触发器,无需模型内部信息、训练数据或干净样本。TRIM 通过基于区域的分割与深度特征表示、结合 inpainting 和扩散模型重建的自适应触发器发现,以及选择性区域净化三个组件,在不假设触发器类型、形状或位置的前提下定位导致误分类的区域并只净化这些区域。为便于部署,TRIM 还缓存已识别触发器的特征嵌入,避免重复检测与净化。
- 论文arXiv:后门、投毒与隐私
FedMAST:用多轴结构痕迹检测并遏制联邦学习后门
作者提出 FedMAST,一种面向联邦学习的多轴结构痕迹后门检测与遏制防御,对客户端提交的更新从结构、谱和历史三类互补证据打分,再做分层过滤与轮级遏制。方法引入 squeeze-pair 一致性评分以暴露耦合特征畸变,并用带符号的谱漂移跟踪捕捉持续的方向性变化。在六种后门攻击、九组对比中,FedMAST 的攻击成功率均低于基线,完整 200 轮运行平均 ASR 为 1.51%、主任务准确率 94.84%。
- 论文arXiv
RAPID:面向文生图服务的实时防未授权蒸馏防御
RAPID 是一种针对文生图服务的实时防御方法,用于阻止攻击者通过黑盒查询收集提示词-图像对来训练未授权的替代模型。现有基于扰动的方法需要逐样本优化,带来大量计算和延迟,影响在线服务可用性;作者尝试把防御扰动集成进 VAE 解码器,但发现逐样本目标难以迁移到共享解码器场景,因为共享解码器造成的潜空间偏移明显更小。RAPID 采用自参考的潜空间最大化框架,去除外部依赖,让同一次模型更新在不同训练样本上产生一致的破坏效果,并用重建引导的颜色正则化阻断潜空间捷径。在四个文生图模型和四个数据集上,与五个代表性基线对比,RAPID 在保持服务视觉保真度的同时持续降低替代模型的生成质量。
- 论文arXiv
VisER:面向 LVLM 物体幻觉检测的视觉证据与视觉依赖双面指标
VisER 是一种免训练的双面指标,用于大视觉语言模型(LVLM)的物体级幻觉检测,通过 Visual Evidence 衡量物体与上下文的兼容性是否有图像 token 的物体专属证据支撑,通过 Visual Reliance 衡量物体更多由图像而非已生成文本前缀支持,两者结合得到更关注来源的 grounding 分数,且无需额外的物体级验证生成。在多个 LVLM 和基准上,VisER 的 AUROC 与 AUPR 均优于一系列基线。该工作已被 EMNLP 2026 主会接收。
- 论文arXiv:后门、投毒与隐私
面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复
针对增量任务中混入少量后门投毒样本的持续学习场景(CLUBA),研究者提出一个融合样本净化、选择性恢复与鲁棒专家路由的动态扩展框架。其中 Bi-Prototype Purification(BPP)利用特征空间语义差异识别可疑样本,Gradient Discrepancy-based Robustness Optimization(GDBRO)通过伪标签纠正与梯度一致性评估选择性恢复含信息量的投毒样本,Robust Feature Consistency-based Expert Selection(RFCBES)构建扰动感知类原型以支持受损输入下的专家路由。该工作旨在同时缓解灾难性遗忘、保持适应能力并阻止模型吸收恶意监督。
- 论文arXiv
EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏
EvoSafeHarness 是一个面向 LLM Agent 的安全优化框架,可为冻结模型在目标领域合成可部署的安全护栏,同时抵御间接提示注入和直接有害请求。它联合搜索自然语言策略与可执行代码逻辑,依据模型行为、领域规范和全新上下文的对抗审查来剔除只针对特定基准的规则。在 DecodingTrust-Agent 上,平均攻击成功率从 45.6% 降至 10.0%,效用仅损失 3.3 个百分点,15 个单元格中 14 个取得最佳成绩;在 AgentDojo 上以 0.0% ASR 达到 82.8% 效用,同一工作点下效用为 CaMeL 的两倍,并可原样迁移到未见过的 AgentDyn 套件。
- 论文arXiv:后门、投毒与隐私
VERITAS:抗投毒的本地差分隐私图学习协议
针对本地差分隐私(LDP)图学习协议易受数据投毒攻击的问题,研究者提出抗投毒协议 VERITAS,采用"信任但验证"范式。该协议在用户侧引入编码分级信任等级的验证列表,对节点特征与图结构联合私有化,并在服务端利用双向证明不对称性识别和剪除恶意节点,流程包括本地数据扰动、证明驱动的恶意节点剪枝、双重去噪恢复效用和鲁棒隐私图学习四个阶段。在四个真实基准数据集、多种 LDP 机制与 GNN 架构上的实验显示,VERITAS 能有效防御数据投毒攻击,并在严格隐私保证下显著提升下游图学习效用。
- 论文arXiv:后门、投毒与隐私
Adaptive Diffusion Freezing:抵御成员推理攻击的隐私保护扩散模型
针对扩散模型训练中的成员推理攻击(MIA)隐私风险,研究者提出隐私保护框架 Adaptive Diffusion Freezing(ADF)。该方法通过跨时间步自适应冻结训练,用掩码矩阵控制不同数据子集在各扩散时间步的参与,并基于预训练的风险感知冻结策略抑制高 MIA 风险子集-时间步对的贡献,从而减少过度记忆。在多个数据集上,ADF 取得了优于多种基线的隐私-效用-效率权衡表现。