跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 321–340 条 · 共 414 条
10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文35

    SafeMol:分子多模态模型的双模态安全对齐

    分子多模态模型在纯文本与图条件输入下均存在显著越狱漏洞,安全鲁棒性需跨输入模态成立并兼顾安全、过度拒答与效用。为此研究者构建 SafeMolBench 基准,含 3702 个样本、覆盖 618 种独特危险分子,分为危险有害、危险允许与效用回放三个子集。基于该基准提出的参数高效对齐框架 SafeMol 联合优化两种模态的轻量模块,用 MMD 做分布级表示对齐并显式建模分子危险性与有害操作意图,实验显示攻击成功率下降数十个百分点,同时保持较低过度拒答与分子任务效用。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    研究者提出面向结构化 Agent 动作的多源完整性认证方法

    论文提出一种面向 LLM 智能体结构化动作的多源完整性认证器,用于抵御间接提示注入篡改动作关键字段。该方法要求每个字段满足其证据结构支持的规则:在腐败可区分的证据类别上设定有界腐败半径并以最小命中集计数,避免重复发布或洗白副本凑出多数;对互补字段做确定性调和;证据仅剩单一来源时引入可信锚点。作者形式化两种鲁棒性概念,通过消融验证各机制,并在制裁名单(70,966 个实体)与软件供应链溯源(450 个包)上测量多源前提的成立频率,发现真实佐证在上界代理下均为少数现象,朴素证明计数会高估独立性。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    CoDeL:用协同演化防御抵御 LLM 智能体的间接提示注入

    CoDeL 是一种针对 LLM 智能体间接提示注入的协同演化防御方法,在三个 IPI 基准、九个基线和两个基座模型上把攻击成功率降低 88.5%,并比其他基线高出 38.0%。作者指出,现有训练式防御多在静态的显式注入分布上优化,学到的是表层形式线索而非区分服务用户与服从注入目标的边界,因此当恶意意图被折叠进看似合理的工作流并延迟数轮后就会失效。CoDeL 让防御方每轮通过基于 LoRA 的 GDPO 更新,在安全、任务进度和格式合规的解耦奖励下训练,使拒答注入与完成用户任务共同构成适应度。

  4. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    J4U:用越狱提示为大型推理模型做黑盒不确定性量化

    论文提出 J4U,一种由越狱衍生出的黑盒不确定性量化方法,用于大型推理模型(LRM)的问答场景。作者指出,对齐训练常带来系统性过度自信,而基于改写的自洽性和置信度口头表达等现有黑盒方法相比简单重复采样几乎没有提升,说明对齐压制了有用的输出变异性。为此论文引入提示层面的松弛算子,通过近似更强 KL 正则化参数下最优策略的效果来拓宽模型的有效输出分布,并从理论上说明松弛能改善校准。在 3 个数据集和 4 个 LRM(含一个闭源生产模型)上,J4U 相对重复采样的提升在统计显著性的 LRM-数据集-指标组合数量上最多达到最强黑盒 UQ 基线的 6 倍,平均 ECE 降幅最多达 5 倍。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文52

    SED:面向 LLM 智能体的免训练持续安全策略学习框架

    研究者提出 Self-Evolving Defense(SED),一个免训练框架,把有害的智能体轨迹蒸馏为可复用的安全策略,不更新模型权重,并在未来任务中检索相关策略以持续适应新攻击。作者在 DeepSeek V4 Flash、GLM 5.2 和 Kimi K3 三个开源模型、覆盖越狱、提示注入和不安全代码生成的八个基准上测试 SED。结果显示,SED 将 AGENTDOJO 上的定向提示注入成功率降至 0.42%,最佳基线防御为 3.7%;在 HARMBENCH 上把自适应 X-TEAMING 攻击成功率控制在 7.8%,最佳基线为 35.2%,同时保持良性任务效用。论文共 39 页、6 张图,代码已公开。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    Constitutional adapters:用推理期干预防御越狱与失准

    研究提出 constitutional adapters(CAs),把符合宪法原则的行为从合成语料蒸馏进低秩适配器和 steering vector,训练中从未见过有害请求或越狱样本。用宪法训练对象减去对照训练对象后,越狱防御成功率和测得对齐度提升,在长上下文和多轮攻击下优于提示词与 steering 基线。CAs 可在基座模型上训练、零样本迁移到后训练 checkpoint,并在推理时缩放以在防御与良性合规之间可预测地权衡。作者将其定位为 API 部署中轻量、可移植、可调的干预手段,论文共 38 页、14 图、10 表。

  7. Adversa AI · 收录 · 原文 15

    有 AI 护栏还不够:红队测试才能验证护栏是否真正有效

    AI 护栏只是运行时防御,红队测试才能验证其能否抵御自适应攻击者。绕过研究对生产护栏的攻击成功率稳定在 65-84%,Carnegie Mellon 的 GCG 攻击对 GPT-3.5 和 GPT-4 的绕过率达 84%,"policy puppetry"技术可同时绕过所有主流基础模型。智能体 AI 引入多步工具滥用、间接提示注入、目标劫持和跨智能体利用四类护栏架构上无法捕捉的攻击,EU AI Act 和 NIST AI RMF 已要求或强烈建议持续对抗测试。

  8. Adversa AI · 收录 · 原文 39

    Adversa AI 自主红队 Agent 攻破 Gandalf CTF 全部八关并进入全球榜前列

    Adversa AI 构建的自主红队 Agent 攻破了 Lakera Gandalf CTF 全部八关,35 次尝试完成,第 1 至 6 关均单条消息解决,全球排行榜位列第 4(若不计零尝试的榜首则为第 3)。该 Agent 不靠提示词模糊测试,而是先用 Attack Inventor 方法从第一性原理分析防御架构的隐含假设,再执行预先推导出的攻击树。

  9. Adversa AI · 收录 · 原文 15

    2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒

    Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。

  10. Adversa AI · 收录 · 原文 16

    2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击

    Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。

  11. Unit 42 · 收录 · 原文 50

    Unit 42 提出扰动探测方法,定位 LLM 安全拒答的少量神经元

    Unit 42 提出扰动探测方法,每个提示词只需两次前向传播,即可定位对齐 LLM 中因果上负责特定行为(如拒绝有害请求)的少量前馈神经元。在开源模型 Qwen3-4B 上,350,208 个前馈神经元中仅 50 个(约 0.014%)控制安全拒答模板,移除后 520 条标准有害提示基准中 80% 的回复格式发生变化,并在第二个标准基准的 200 条提示上复现。在更小的 Qwen3.5-2B 上,仅 20 个神经元即可让多轮对话中的错误附和行为从 36.7% 降至 0%(30 个问题)。同一计算还给出 FFN/Skip 比值,可在数秒内算出,在测试的 13 个模型中解释了安全行为脆弱性 81% 的方差,可作为量化的安全脆弱性评分。

    推荐理由研究给出一种两次前向传播即可定位安全拒答神经元的诊断方法,并附可跨模型比较的脆弱性指标。

  12. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    NVIDIA NeMo Guardrails 如何为 RAG 应用做内容审核与安全检查

    NVIDIA NeMo Guardrails 通过集成 Meta 的 LlamaGuard 和 AlignScore 等第三方安全模型,为 RAG 应用提供内容审核与安全检查。该工具以开源工具包和微服务两种形式部署,支持内容审核、越狱检测、PII 检测、幻觉检测等护栏功能,可在 LLM 输出前扫描检索内容与生成回复中的冒犯性语言、虚假信息或政策违规。NeMo Guardrails 微服务处于早期访问阶段,提供 OpenAI 兼容 API。

  13. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 40

    NVIDIA 用 WebAssembly 沙箱隔离智能体 AI 工作流

    NVIDIA 技术博客提出用 WebAssembly 沙箱隔离智能体 AI 工作流。文章指出,智能体工作流常需执行大语言模型生成的代码来完成数据可视化等任务,这类代码应先清洗并在安全环境中运行,以降低提示注入和返回代码出错带来的风险。作者认为,用正则表达式清洗 Python 并配合受限运行时并不充分,因此需要更强的隔离手段。文章由 Joseph Lucas 撰写,发布于 NVIDIA 开发者博客。

  14. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书,阐述其保障 NVIDIA AI Enterprise 软件栈容器安全所采取的措施。白皮书涵盖安全开发生命周期、容器构建生命周期管理、安全设计、安全加固、SBOM、容器签名与模型签名及 NIM 微服务。漏洞响应部分包括漏洞扫描、修补、VEX 与协同漏洞披露,并由 NGC 通知服务做安全事件监控。

  15. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 12

    如何用 NVIDIA NeMo Guardrails 保护客服 AI 智能体

    NVIDIA NeMo Guardrails 为客服场景的 AI 智能体提供安全防护。这类智能体可自动处理常规咨询、加快响应速度,从而提升客服效率与客户满意度,帮助企业在竞争中保持优势;但驱动它们的 LLM 本身存在脆弱性,文章围绕此给出防护做法。

  16. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 11

    NVIDIA NeMo Guardrails 如何衡量与优化生成式 AI 应用中的护栏效果与性能

    NVIDIA NeMo Guardrails 提供内容安全、话题控制、越狱检测等 AI 护栏,用于保障 AI 智能体及对话式 AI 应用的安全、符合品牌调性与可靠行为。该文探讨衡量与优化这些护栏效果和性能的技术方法,帮助企业在生成式 AI 应用中评估并提升护栏表现。

  17. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    在 NVIDIA NeMo Guardrails 中用 Cleanlab 可信语言模型防止 LLM 幻觉

    NVIDIA 演示了如何在 NeMo Guardrails 中集成 Cleanlab 的可信语言模型(Trustworthy Language Model),用于防止 LLM 生成看似合理但错误的幻觉回答。该方案将 Cleanlab 的可信度评分作为护栏机制接入 NeMo Guardrails,以提升企业 AI 应用的可靠性。

  18. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 14

    如何用 NVIDIA Safety Recipe 保护智能体式 AI 系统

    NVIDIA Safety Recipe 用于防护具备自主行动、工具调用与推理能力的 LLM 智能体系统。这类系统的自主性会放大目标错位、提示注入、非预期行为以及人类监督减少等风险。企业正因灵活性与低推理成本加速采用智能体系统,因此引入稳健的安全措施变得至关重要。