跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 281–300 条 · 共 414 条
10月1日周四
  1. arXiv · 收录 · 原文 论文50

    Tripwire:通过统计认证的安全神经元触发对齐拒答

    Tripwire 是一种免训练防御方法,通过逐神经元假设检验并在错误发现率控制下识别安全特异性神经元,再用效用特异性过滤器排除对模型效用重要的神经元。识别后采用触发式钳制,将选定神经元固定在有害条件下的平均激活值上,注入内部有害输入信号以触发对齐阶段学到的拒答行为。该钳制有两种可证明等价的部署方式,即检测器门控的推理时干预和离线 bias-patch 权重编辑。在四个安全对齐 LLM 和四类代表性攻击上的实验显示,Tripwire 将平均攻击成功率降至最高 2.0%,在 MT-Bench 上的效用损失仅为 0.5% 至 5.3%,为所有防御方法中最小。代码已公开。

  2. arXiv · 收录 · 原文 论文43

    RACER:面向多模态大模型后门的区域感知一致性修复框架

    论文提出 RACER,一个模型级的多模态大模型后门修复框架,通过抑制内部表征的层级不一致异常来从源头移除后门。作者观察到后门会在内部表征中引发层级间演化异常,即层级不一致异常,且该异常与模态相关,主要集中在编码触发特征的 token 区域。RACER 据此把融合表征拆分为视觉与文本 token 区域,分别归一化其层级不一致性,再在深层窗口内以模态感知权重重组,形成区域感知的不一致目标,并通过 min-max 优化合成最坏情况扰动、对扰动做对抗微调来修复模型。该方法只需 100 条干净样本,不需要知道触发器、攻击目标,甚至不需要知道输入模型是否含后门。

  3. arXiv · 收录 · 原文 论文43

    AdaGuard:支持用户自定义策略的自适应护栏模型

    作者提出 AdaGuard,一组 0.6B、4B 和 8B 的护栏模型,可在推理时按用户提供的策略评估 Agent 轨迹是否违规。为支持这一能力,作者构建 AdaptiveSafety 数据集,包含 10,939 条训练样本和 1,000 条测试样本,覆盖 1 至 100 条规则的策略,并结合策略与行为反事实,为每条样本配解释和完整违规规则集合。训练方法 SafePO 是一种强化学习算法,用结构化奖励评估预测正确性,在响应层面保留组相对优势,并用单独训练的价值模型调节解释与判定区域的 token 权重。4B 模型在 AdaptiveSafety 上二分类准确率为 89.30%,在 DynaBench 上为 71.82%。

  4. arXiv · 收录 · 原文 论文22

    DenMark:面向扩散语言模型的鲁棒语义水印

    DenMark 是面向扩散语言模型(DLM)的语义水印框架,将密钥相关信号直接注入去噪过程。它把输出划分为固定 token 区域,用临时 rollout 作为语义前瞻,估计未完成区域的最终语义,从而优先选择语义水印得分更高的局部更新,并在检测时通过校准扫描候选单元尺寸应对语义攻击带来的边界偏移。在 4 个 DLM、3 个数据集和 4 种语义攻击共 48 种组合中,DenMark 在所有检测指标上均取得最佳结果。

  5. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    DP-BR-FedAvg:面向银行与医疗的差分隐私拜占庭鲁棒联邦学习框架

    针对联邦学习中参数更新泄露隐私与恶意客户端投毒两大问题,研究者提出 DP-BR-FedAvg 框架,将高斯机制差分隐私层与逐坐标截断均值拜占庭鲁棒聚合规则结合,在模拟跨机构欺诈与临床风险评分任务上评估。在 20 个客户端、其中四分之一为拜占庭节点、共 60 轮通信的设置下,FedAvg 在少数类上崩溃(F1 仅 0.030),该框架恢复至 F1 0.119,同时限制单个客户端贡献的隐私损失。无隐私层的拜占庭鲁棒聚合器原始准确率最高,量化了隐私对鲁棒性的代价,表明两类机制是相互作用而非简单叠加。

  6. arXiv:后门、投毒与隐私 · 收录 · 原文 论文37

    TRIM:面向多种后门触发器的黑盒检测与净化方法

    研究者提出 TRIM(Trigger Removal by Identifying Manipulated Regions),一种面向部署的黑盒后门防御方法,可在推理时检测并选择性移除后门触发器,无需模型内部信息、训练数据或干净样本。TRIM 通过基于区域的分割与深度特征表示、结合 inpainting 和扩散模型重建的自适应触发器发现,以及选择性区域净化三个组件,在不假设触发器类型、形状或位置的前提下定位导致误分类的区域并只净化这些区域。为便于部署,TRIM 还缓存已识别触发器的特征嵌入,避免重复检测与净化。

  7. arXiv:后门、投毒与隐私 · 收录 · 原文 论文39

    FedMAST:用多轴结构痕迹检测并遏制联邦学习后门

    作者提出 FedMAST,一种面向联邦学习的多轴结构痕迹后门检测与遏制防御,对客户端提交的更新从结构、谱和历史三类互补证据打分,再做分层过滤与轮级遏制。方法引入 squeeze-pair 一致性评分以暴露耦合特征畸变,并用带符号的谱漂移跟踪捕捉持续的方向性变化。在六种后门攻击、九组对比中,FedMAST 的攻击成功率均低于基线,完整 200 轮运行平均 ASR 为 1.51%、主任务准确率 94.84%。

  8. arXiv · 收录 · 原文 论文42

    RAPID:面向文生图服务的实时防未授权蒸馏防御

    RAPID 是一种针对文生图服务的实时防御方法,用于阻止攻击者通过黑盒查询收集提示词-图像对来训练未授权的替代模型。现有基于扰动的方法需要逐样本优化,带来大量计算和延迟,影响在线服务可用性;作者尝试把防御扰动集成进 VAE 解码器,但发现逐样本目标难以迁移到共享解码器场景,因为共享解码器造成的潜空间偏移明显更小。RAPID 采用自参考的潜空间最大化框架,去除外部依赖,让同一次模型更新在不同训练样本上产生一致的破坏效果,并用重建引导的颜色正则化阻断潜空间捷径。在四个文生图模型和四个数据集上,与五个代表性基线对比,RAPID 在保持服务视觉保真度的同时持续降低替代模型的生成质量。

  9. arXiv · 收录 · 原文 论文20

    VisER:面向 LVLM 物体幻觉检测的视觉证据与视觉依赖双面指标

    VisER 是一种免训练的双面指标,用于大视觉语言模型(LVLM)的物体级幻觉检测,通过 Visual Evidence 衡量物体与上下文的兼容性是否有图像 token 的物体专属证据支撑,通过 Visual Reliance 衡量物体更多由图像而非已生成文本前缀支持,两者结合得到更关注来源的 grounding 分数,且无需额外的物体级验证生成。在多个 LVLM 和基准上,VisER 的 AUROC 与 AUPR 均优于一系列基线。该工作已被 EMNLP 2026 主会接收。

  10. arXiv:后门、投毒与隐私 · 收录 · 原文 论文29

    面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复

    针对增量任务中混入少量后门投毒样本的持续学习场景(CLUBA),研究者提出一个融合样本净化、选择性恢复与鲁棒专家路由的动态扩展框架。其中 Bi-Prototype Purification(BPP)利用特征空间语义差异识别可疑样本,Gradient Discrepancy-based Robustness Optimization(GDBRO)通过伪标签纠正与梯度一致性评估选择性恢复含信息量的投毒样本,Robust Feature Consistency-based Expert Selection(RFCBES)构建扰动感知类原型以支持受损输入下的专家路由。该工作旨在同时缓解灾难性遗忘、保持适应能力并阻止模型吸收恶意监督。

  11. arXiv:后门、投毒与隐私 · 收录 · 原文 论文22

    VERITAS:抗投毒的本地差分隐私图学习协议

    针对本地差分隐私(LDP)图学习协议易受数据投毒攻击的问题,研究者提出抗投毒协议 VERITAS,采用"信任但验证"范式。该协议在用户侧引入编码分级信任等级的验证列表,对节点特征与图结构联合私有化,并在服务端利用双向证明不对称性识别和剪除恶意节点,流程包括本地数据扰动、证明驱动的恶意节点剪枝、双重去噪恢复效用和鲁棒隐私图学习四个阶段。在四个真实基准数据集、多种 LDP 机制与 GNN 架构上的实验显示,VERITAS 能有效防御数据投毒攻击,并在严格隐私保证下显著提升下游图学习效用。

  12. arXiv · 收录 · 原文 论文50

    EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏

    EvoSafeHarness 是一个面向 LLM Agent 的安全优化框架,可为冻结模型在目标领域合成可部署的安全护栏,同时抵御间接提示注入和直接有害请求。它联合搜索自然语言策略与可执行代码逻辑,依据模型行为、领域规范和全新上下文的对抗审查来剔除只针对特定基准的规则。在 DecodingTrust-Agent 上,平均攻击成功率从 45.6% 降至 10.0%,效用仅损失 3.3 个百分点,15 个单元格中 14 个取得最佳成绩;在 AgentDojo 上以 0.0% ASR 达到 82.8% 效用,同一工作点下效用为 CaMeL 的两倍,并可原样迁移到未见过的 AgentDyn 套件。

  13. arXiv:后门、投毒与隐私 · 收录 · 原文 论文35

    Adaptive Diffusion Freezing:抵御成员推理攻击的隐私保护扩散模型

    针对扩散模型训练中的成员推理攻击(MIA)隐私风险,研究者提出隐私保护框架 Adaptive Diffusion Freezing(ADF)。该方法通过跨时间步自适应冻结训练,用掩码矩阵控制不同数据子集在各扩散时间步的参与,并基于预训练的风险感知冻结策略抑制高 MIA 风险子集-时间步对的贡献,从而减少过度记忆。在多个数据集上,ADF 取得了优于多种基线的隐私-效用-效率权衡表现。

  14. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    基于神经形态时序嵌入与混合 SNN-XGBoost 的工业信息物理系统鲁棒分类:面向机器遗忘攻击

    研究提出一种混合 SNN 与 XGBoost 架构,用脉冲神经网络做固定时序特征提取器、仅重训 XGBoost 分类器,以提升电力系统入侵检测对机器遗忘攻击的鲁棒性。在两个真实电力系统数据集上,Synchrophasor 达 99.9% 准确率(F1-macro 0.999),MSU/ORNL 达 95.0% 准确率(F1-macro 0.943)。在选择性标签翻转攻击下,10% 投毒时 F1-macro 仅下降 0.9%,目标类崩溃阈值从 60% 投毒推迟到 70%。

  15. arXiv · 收录 · 原文 论文46

    HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架

    HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。

  16. arXiv:后门、投毒与隐私 · 收录 · 原文 论文16

    基于 Hessian 分析的相关性引导快速机器遗忘

    一种面向网络与分布式安全系统的机器遗忘框架通过识别训练集中的相关数据点并应用闭式参数更新规则,相比标准影响函数遗忘实现 82 倍墙钟加速,准确率较 SOTA 基线提升 10^-2。该方法借助 Hessian 阻尼保证数值稳定性,在包括 CIFAR-100 与 ResNet-50 在内的七种数据集-架构组合上评估,成员推理攻击成功率为 0.660,tug-of-war 得分为 0.950。

  17. arXiv:后门、投毒与隐私 · 收录 · 原文 论文38

    QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御

    作者提出 QPriv-VL,一个面向联邦学习、拆分学习和 U 型拆分学习的问题引导隐私感知 token 裁剪框架,在传输前按任务效用与隐私敏感度裁剪视觉 token。其核心是轻量级 Dynamic Threshold Predictor(DTP),在一次前向中同时估计样本级裁剪比例和 token 级保留掩码,结合视觉 patch 与问题嵌入的跨模态相似度,以及来自冻结 DINOv2 特征的敏感度信号,无需敏感度标签即可抑制潜在敏感区域。

  18. arXiv:后门、投毒与隐私 · 收录 · 原文 论文25

    ODPure:通过集成破坏共识实现目标检测后门净化

    ODPure 是一种面向目标检测的输入阶段黑盒后门防御方法,通过破坏-重建-选择(CRS)范式净化输入,无需丢弃恶意数据或模型即可维持稳定的感知流。该方法利用多种破坏方式中和触发器、生成大量冗余候选框,再借助生成先验恢复细粒度结构线索,最后通过投票对检测结果达成共识。实验表明,ODPure 能抵御多种后门攻击与触发器类型,同时保持基线精度。

  19. arXiv:后门、投毒与隐私 · 收录 · 原文 论文32

    CLIPGuard:针对 CLIP 嵌入空间隐蔽后门的区域级黑盒防御

    CLIPGuard 是一种轻量、完全黑盒的防御方法,通过测量分段嵌入扰动定位恶意区域,并仅对可疑片段做语义修复,以抵御 CLIP 嵌入空间后门攻击。在 STL-10、ImageNet 及 BadCLIP、BadNets、blended、patch-based、typographic 等触发家族上,该方法将攻击成功率降至最低 1.05%,干净准确率最高保持 86.34%,持续优于 CleanCLIP 和 CleanerCLIP 等黑盒防御。

  20. arXiv:危险能力与安全评测 · 收录 · 原文 论文42

    REINS:用 SAE 特征同时抑制有害续写并增强拒答的引导方法

    论文提出 REINS(Refusal-Enhanced INhibitory Steering),在同一个 SAE 特征空间内抑制有害续写特征、增强安全拒答特征,用于推理阶段的行为引导。作者同时构建了 GUISE 数据集,由带复杂包装的有害提示组成,用于系统评估这一失效模式。实验显示,既有单方向 SAE 引导方法在有害提示上无法稳定产生拒答,说明仅增强拒答在有害续写路径仍活跃时可能过弱;而先前方法要么干预力度不足,要么通过模型崩塌获得表面安全。在 GUISE 及其他数据集上,REINS 大幅减少有害回复、明显提升安全拒答,并基本保留通用能力。该工作已被 EMNLP 2026 主会接收。