跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 261–280 条 · 共 414 条
10月1日周四
  1. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    CapScope:面向编码 Agent 的抗提示注入能力范围授权机制

    研究者提出 CapScope,一种在 harness 层限制工具调用的授权机制,无需模型自行识别恶意文本。它先从可信输入推导任务级权限上限,再为每个 Agent 分配独立的能力集合,存放在模型上下文之外,每次工具调用都按发起该调用的 Agent 的能力进行检查,因此某个子 Agent 获得的权限不会自动传给另一个。作者在 Pi 编码 Agent 上实现该机制,并在一个由编排者向子 Agent 分派子任务的修复流程中评测,覆盖 5 个 Python 任务、5 个注入面、4 种授权条件和每格 3 次试验共 300 次运行。

  2. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文39

    面向 AI-SOC 的神经符号防御框架:用 SIEM 解码器与 NeMo Guardrails 阻断日志投毒提示注入

    论文提出一种神经符号纵深防御架构,用于保障 LLM 接入安全运营中心(SOC)后的管道完整性,应对通过日志投毒实施的间接提示注入。作者指出,攻击者可在系统日志中嵌入恶意载荷,形成多步 promptware 攻击链,劫持 LLM 的操作逻辑;而确定性防御语义盲、纯神经评估延迟高且存在概率性缺陷。该框架第一层用定制 SIEM 解码器作为确定性预过滤,在数据摄入边缘做结构化清洗,消除体量填充和基于签名的注入;第二层用 NeMo Guardrails 在 LLM 处理前对结构化 SIEM 告警做自检式语义边界校验;同时集成闭环遥测系统,在 SOC 仪表盘中为人工介入提供被拦截攻击的可见性。

  3. arXiv:可解释性 · 收录 · 原文 论文29

    RISA:面向大语言模型拒答校准的响应检查与选择性干预

    RISA 是一个推理时框架,通过检查 LLM 的初始响应并选择性纠正拒答错误,在不更新基座模型参数的前提下提升拒答可靠性。它先用固定上下文规则为明确案例打拒答分数,未匹配案例则由末层提示词隐藏状态经校准线性探针得出分数,并分别校准探针分数、表征支持边界与动作阈值以适配不同基座模型。运行时结合提示词分数与初始拒答状态,仅在必要时干预,实验显示其在提升拒答可靠性的同时基本保持模型效用。

  4. arXiv:可解释性 · 收录 · 原文 论文29

    GAPS:面向条件激活引导的维度级门控

    GAPS(Gated Activation steering via Posterior and Separability)通过维度级条件选择决定对哪些神经元施加激活引导,由两个免训练门控组成:静态可分性门控用 AUROC 筛选携带可靠概念信息的神经元,动态后验门控仅当神经元当前激活更符合目标概念时才干预。

  5. arXiv:可解释性 · 收录 · 原文 论文29

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    EraseSAE 通过稀疏自编码器在 DiT 架构的文生视频扩散模型中实现精准概念擦除,先以 Partitioned Convolutional Sparse Autoencoder 将稠密时空激活分解为可解释稀疏特征,再用对比归因机制定位概念专属特征核,推理时按时间步生成时空掩码限制擦除范围。实验显示该方法在多种扩散模型和概念擦除任务上实现精确稳健的移除,生成质量损失极小,显著优于现有方法。该工作已被 ECCV 2026 接收,代码已公开。

  6. arXiv:可解释性 · 收录 · 原文 论文43

    研究揭示细粒度危害信号在 LLM 安全中的作用

    研究通过从各风险类别的危害表征中移除共享的通用危害表征,得到与通用危害性在每一层都正交的类别残差,并用激活引导在 3 个指令微调 LLM 的 11 个风险类别上测试。结果显示,类别残差是否编码危害性因类别而异,且这一类别模式在不同模型间相似;类别残差是否引发拒答同样因类别而异,但这一模式更依赖具体模型。研究还发现类别残差会增强 LLM 下游内部与共享通用危害表征的对齐。作者据此认为,理解 LLM 安全不能只看共享的通用危害表征,还需考虑更细粒度的类别残差;即使某一层上与某概念正交的方向,也可能促进该概念在下游的放大。

  7. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文29

    现代图像后置水印信道的优化与安全:SNW 方案

    针对现代多比特后置图像水印方案,研究提出其编码器-解码器对隐含定义了并行 AWGN 信道、以 BPSK 调制传输消息,因而受限于二进制字母表、容量被严重压缩,且因缺少密钥而本质不安全。为此提出 SNW 后置水印系统,不依赖固定码本或二进制字母表,借助可达容量的纠错码使速率接近香农容量,在容量上显著优于现有 SOTA 基线并提供强安全保证。

  8. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文28

    SURE:构建可信 AI 的安全框架

    研究提出 SURE(A Safe and Unified AI Framework foR Everyone)框架,用于按国家、文化和企业政策定制 AI 安全属性并加以保障。该框架建立对抗性提示词分类体系并据此构造提示词,定义理想 AI 回复模板与绝对安全评分方案,再通过数据集进行 AI 对齐。在多种基座模型上的实验验证了 SURE 的有效性,论文已被 KDD 2025 EAI Workshop 接收。

  9. arXiv · 收录 · 原文 论文32

    MiniRep:面向多智能体辩论的鲁棒声誉聚合方法

    MiniRep 是一种面向多智能体辩论(MAD)的声誉聚合系统,用于在存在恶意智能体时提升最终答案的可靠性。它基于声誉系统攻击与软件测试变异算子构建攻击分类体系,同时依据智能体在当前任务上的行为和长期声誉进行评估,并抑制高度相似回答的智能体群体主导决策。在 MATH 等任务上,MiniRep 无论是否遭受攻击都优于传统 MAD 聚合与常规声誉方法;在 10 个异构智能体的 MATH 设置下,于全部 28 种攻击条件下均优于所有基线。

  10. arXiv · 收录 · 原文 论文43

    研究者提出梯度封堵实现 LLM 发布前的预防性遗忘

    研究者提出梯度封堵(gradient sealing)方法,用于在开放权重 LLM 发布前阻止下游微调重新习得被禁能力。作者先验证现有回顾式遗忘方法在发布前防护上不足:即使当前输出已抑制被禁能力,被禁领域数据仍能通过内部通路产生梯度,使能力在后续微调中被重新获得。梯度封堵的原理是把相关预激活推入负区间,使 ReLU 族激活的导数变为零或接近零,从而阻断这些通路。在多个 LLM 系列上的实验显示,该方法对下游能力习得的抵抗强于回顾式基线。

  11. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    Unmerge:用任务算术实现高效机器遗忘

    Unmerge 将机器遗忘重构为任务算术的逆运算:微调得到的合并任务向量减去低秩遗忘分量即可恢复保留任务向量,因为遗忘激活在每层都集中在少数主方向构成的子空间内。在 CIFAR-100 和 Tiny ImageNet 上对 ResNet-50 做类别级遗忘时,其 Tug-of-War 指标比同等运行时间的基线最高提升约 24%,比运行慢约 5 倍的更强基线最高提升约 18%,成员推断暴露维持在重训练水平。该方法同样适用于 ViT-S/16,并可扩展到 Llama-3.2-3B,其逐层基几何还可作为判断遗忘何时何地结构性困难的诊断工具。

  12. arXiv:后门、投毒与隐私 · 收录 · 原文 论文40

    NDDL:用正常扩散动力学为文生图模型做后门防御

    研究者提出 Normal Diffusion Dynamics Learning(NDDL),一种仅用正常样本训练的文生图扩散模型后门防御框架。该方法观察到正常扩散轨迹在 cross-attention、潜空间和噪声空间中呈现结构化且随 timestep 变化的转移模式,而后门攻击会使其偏离这种正常演化。NDDL 构建紧凑的多空间轨迹表示,训练一个以 timestep 为条件的动力学模型来预测扩散演化,推理时用观测转移与预测转移之间的偏差量化动力学不一致性以检测后门。该框架还能在无需任何后门先验知识的情况下,通过低语义词替换实现触发器定位。多种后门攻击上的实验显示其有效性与泛化性。

  13. arXiv:Agent 与 MCP 安全 · 收录 · 原文 52

    可验证操作卡 VAC:为自主 Agent 提供可信人在回路控制

    论文提出可验证操作卡(VAC),一种从真实待执行的浏览器操作和可信意图来源重建审批信息、在可信浏览器界面中带外渲染、并把审批绑定到派发时重新验证的同一操作的架构级防护。VAC 结合来源隔离、真实操作描述符、默认拒绝确认、来源感知风险门控和执行绑定,并在一个完整的智能体浏览器中实现。在覆盖混淆代理攻击、Lies-in-the-Loop 对话伪造、间接提示注入、自适应操作替换、来源规避和正常任务的 24 场景基准上,无 VAC 时各评测 LLM 的攻击成功率为 68% 至 100%,VAC 将每个模型的攻击成功率降至 0%,正常任务完成率 78%,误拦截率 0%。

  14. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 43

    ACTR:对齐推理链与回答以提升推理大模型的多语言安全

    研究者提出 ACTR 框架,通过强化推理大模型已有的安全推理来提升多语言安全对齐。该框架先用 think gap score(TGS)比较不同语言下推理链对注意力输出的归一化贡献,并用推理链替换衡量跨语言安全差距;再借助越狱查询语料,通过神经元掩码引起的回答表征变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理使用的 safety think neurons;最后提出 neuron-selective consistency optimization(NSCO),用冻结的 judge 模型奖励推理链与回答在安全类别上的一致,只更新选定神经元的参数,无需人工标注回答或偏好数据。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  15. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文58

    CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱

    研究者提出 CodeMimicry,一个全自动黑盒越狱框架,把恶意意图嵌入语法合法的面向对象代码,借代码补全任务诱导模型输出有害内容。在 8 个商用大语言模型上,该方法在 AdvBench 上达到 96.25% 攻击成功率、平均仅 1.51 次查询,在 HarmBench 上为 96.07% 与 1.46 次查询,明显优于模板类和优化类基线。作者将这一现象归因于安全泛化滞后,即主要在自然语言上训练的对齐难以迁移到代码域,形成代码补全盲区。潜空间分析显示,成功的越狱样本在表示上接近良性代码,并系统性地避开拒答方向;激活引导实验进一步支持这一解释。作者也指出,该方法依赖目标模型的代码生成能力,且对注释与 docstring 这类字符串侧信道有依赖,正则过滤注释后攻击成功率降至 20% 至 26%。

    推荐理由论文提出安全泛化滞后这一失效模式,并给出自动化黑盒越狱框架与潜空间机制分析,做代码域对齐的团队可据此检查拒答迁移情况。

  16. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究评估语言模型在长对抗对话中的安全性

    研究测试了三个开源权重、指令微调模型在长对抗对话中能否持续安全回应,用第二个语言模型扮演持续对抗用户,由安全分类器标注每条回复是否安全。在全部模型与有害提示组合中,首轮安全回复率为 85% 至 100%,到第 11 轮降至 38% 至 61%,到第 101 轮降至 15% 至 44%。这一下降跨模型出现,并远超多轮安全评测通常采用的短交互长度。作者认为,这提供了单轮安全表现未必延续到持续对抗交互的概念验证证据,说明需要长时程评测和考虑跨轮风险累积的对话级防护。

  17. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文40

    推理层安全:防御对抗性推理与基础设施滥用

    论文研究 LLM 服务在推理层面临的对抗性交互,包括越狱、拒绝服务与知识蒸馏攻击,并以假设的前沿实验室 Five Elements Inc. 为例展开。由于缺少公开的对抗性 LLM 使用标注数据集,作者提出结构因果模型(SCM)生成带标签的用户会话数据集,包含协同多账号活动、平台反馈和三个层级的标签可观测性。在该数据集上训练的梯度提升检测器对 oracle 标签的二元分类 AUPRC 达 0.993,但面对真实 Trust & Safety 团队持有的运营标签时 AUPRC 仅 0.313,说明检测器比用于评估它的标签更准确。攻击类型归因方面,朴素 argmax 受 98% 良性先验主导,macro-F1 仅 0.295,改用简单阈值决策引擎后提升到 0.489 且不损失准确率。数据集已公开。

  18. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    ContractWarden:用人类授权契约在内核层为 AI Agent 划定损害边界

    ContractWarden 是一个 Linux 参考监视器,通过人类授权的契约在内核层为 AI Agent 划定损害边界,不信任 Agent 本身或其策略建议。模型可以提出 allow、deny 或 no_egress 三态资产契约,但由人类做最终选择;执行门在不可信代码运行前把契约绑定到具体任务,再由基于 eBPF 的 LSM 数据平面执行文件与网络决策,并将 no_egress 沿进程、普通文件、管道、FIFO 和受支持的 Unix-domain socket 单调传播。在 19 项安全测试的 570 次运行中,全部满足预设的返回值与副作用标准。在三项同机文件 I/O 负载上,Linux 6.15 虚拟机中的中位开销为 11.96%–12.89%,物理平台为 35.79%–61.54%,低于所评估的冻结版 ActPlane 基线。

  19. arXiv · 收录 · 原文 论文37

    S³:用多阶段防御提升 LLM 智能体安全

    论文提出 Stage-Specific Safety Skills 抽象,把异构安全设计表示为带明确阶段语义的可复用、可组合组件,并给出自动化转换流程和社区驱动的安全技能库。在此基础上提出 S³ 多阶段防御框架,由 guard agent 编排各阶段安全技能,在智能体工作流的记忆、规划、工具执行等环节做风险检测与缓解。作者同时构建 Multi-Stage Risk Benchmark(MSRB)评估各阶段代表性风险,实验显示 S³ 在安全有效性和效用保持上均优于代表性 SOTA 基线。论文认为阶段特定安全技能可作为构建韧性智能体系统的可扩展、可组合基础。

  20. arXiv · 收录 · 原文 论文33

    互补 LLM 水印如何追踪来源并检测篡改

    针对现有 LLM 水印在保留来源归属的同时可被"搭便车欺骗"篡改关键内容的问题,研究者提出一种同时提供来源证明与篡改证据的水印,在每个生成 token 中共同嵌入一个鲁棒信号和一个脆弱信号。两个信号机制相同但使用独立密钥和不同种子窗口,脆弱信号对读者可见的改动敏感;检测时两个分数构成二维空间,支持 Intact、Tampered、No-Watermark 三种判定。在两个大语言模型和两个提示数据集上,该方法在评测方法中取得最高篡改检测率,同时保持有竞争力的归属鲁棒性和困惑度。