跳到正文

防御与护栏

今天还没有收录新动态
10月4日周日
  1. Pillar Security · 收录 · 原文 日期未知31

    AI 网关护栏 2026:如何保护 LiteLLM、Kong、TrueFoundry 与 Agent Router(附 12 家护栏提供商对比)

    一份指南梳理了 LiteLLM、Kong、TrueFoundry、Agent Router 等主流 AI 网关的护栏接入机制,并围绕同样八个问题对比了 12 家护栏提供商。LiteLLM 的 Generic Guardrail API 支持 45 家护栏提供商,Kong 提供 10 个 AI 护栏插件,TrueFoundry 开放输入、输出及 MCP 工具调用前后的钩子并接入 20 多家外部提供商。指南提醒 TrueFoundry 的输出护栏不作用于流式响应,且只读用户消息的护栏会漏掉工具结果或 MCP 描述中的注入。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月3日周六
  1. 0DIN · 收录 · 原文 28

    如何在五分钟内为 LiteLLM 接入 0DIN Defense

    0DIN 发布 litellm-shield 插件,可将护栏分类器 SusFactor 作为 LiteLLM 代理的自定义护栏运行,安装一条 pip 命令即可在 flag 模式下启用。SusFactor 对每个提示词打分以拦截提示注入和越狱,支持 block、flag(默认)、shadow 三种模式,并接入 Langfuse、Datadog、OTel 等可观测性栈。它挂载在 during_call 阶段与模型调用并行执行,分类器中位延迟约 15.6ms、P95 23.9ms、P99 26.5ms,全部在 CPU 上运行,默认失败开放。

  2. Lasso Security · 收录 · 原文 16

    AI 可观测性:工作原理、关键挑战与最佳实践

    AI 可观测性指持续追踪生产环境中大语言模型的性能、成本与行为,采集延迟、token 用量、错误率和输出质量等指标,并通过仪表盘与告警暴露问题。它需同时捕捉系统级故障(超时、限流、成本激增)与模型级故障(质量漂移、不安全输出、提示注入尝试),覆盖性能、安全、合规与威胁攻击四类监控。麦肯锡调查显示,使用 AI 的组织占比从 2023 年的 55% 升至 2025 年的 88%,而欧盟 AI Act 要求高风险系统在 2026 年 8 月 2 日前具备风险管理、日志记录与人工监督。

  3. Lasso Security · 收录 · 原文 25

    OWASP 2026 年 LLM 应用 Top 10 解读:哪些风险变了,哪些最值得关注

    OWASP 2026 版 LLM 应用 Top 10 首次以数千起真实事件数据为依据重排风险,Prompt Injection 仍居首位,Excessive Agency 从第 6 升至第 3,Unbounded Consumption 上升 4 位,Misinformation 的实际影响远超安全团队预期。报告指出智能体系统的工具委派与自主决策需纳入威胁模型,并强调运行时资产清点、行为基线与自适应防护。Lasso 按 Discover-Assess-Protect 框架给出对应防御能力。

  4. Lasso Security · 收录 · 原文 28

    Lasso Security 推出 LEAP:基于 CPU 的 AI 安全护栏,精度对标 GPU 方案

    Lasso Security 发布 LEAP,一套基于 CPU 的 AI 安全护栏,宣称在文档处理吞吐上比商用护栏 API 和闭源 LLM 判官高出约三个数量级,同时保持 GPU 级准确率。LEAP 针对的是把 LLM 判官放在每个提示词、响应、检索文档和工具调用前的成本与延迟问题:单个 GPU 实例(如 AWS ml.g7.2xlarge,$3.15/小时)持续运行每月约需 $2,300。Lasso 主张低歧义输入无需开放式推理,应将推理模型留给真正模糊的安全决策。

  5. Google ADK · 收录 · 原文 32

    Google ADK v2.8.0 发布:新增 Model Armor 护栏插件并修复 BigQuery 工具 SQL 注入

    Google ADK 发布 v2.8.0,新增 Model Armor 护栏插件,并修复 BigQuery 工具中的 SQL 注入漏洞。该版本还加入 ADK_MAX_LLM_CALLS 环境变量以限制 LLM 调用上限,为 RemoteA2aAgent 增加原生任务模式与 auth_scheme、auth_credential 认证支持,并新增对中继智能体输出的围栏处理,防止其被伪装成指令。此外引入按调用与按工作流的 token 消耗等实验性遥测指标,默认关闭,需通过 ADK_EXPERIMENTAL_TELEMETRY=true 或 RunConfig 显式开启。

10月2日周五
  1. Cloud Security Alliance(AI 相关) · 收录 · 原文 25

    NIST AI Agent Security RFI 的多智能体系统安全经验总结

    NIST 旗下 Center for AI Standards and Innovation 于 2026 年 1 月就 AI 智能体安全问题发出 RFI,一位从业者梳理其中 100 份公开回应,提炼出五条保障多智能体系统的实践经验。该总结指出,当智能体能互相调用时,安全保障的基本单元是整个配置好的系统而非孤立的模型,并强调受损组件会沿正常协作路径传播风险、委派构成信任边界、单独合规的部件组合起来未必安全、完整执行轨迹才是审计记录,以及保证应随模型、提示词、权限和拓扑的变化持续刷新。

10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    ACEA:面向红蓝队对抗的 LLM 协同演化测试平台

    研究者提出 ACEA(Adversarial Co-Evolution Arena),一个把可插拔红队适配器与蓝队适配器接到同一靶标 LLM 上、由 LLM judge 对攻防成功率打分的对抗协同演化平台。平台通过最小化的 HTTP 协议 ACEA Standard Adapter Protocol(ASAP)接入任意语言编写的红队或蓝队项目,只暴露该协议即可成为完整参与者。评测方法上,向靶标注入规范化的秘密作为可验证真值,以区分真实泄露与模型幻觉;即使防御拦截了攻击,也仍把攻击发给靶标,从而独立测量攻击的原始效力,得到每轮攻击强度与防御有效性的分解。

  2. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文28

    从注入到交互:LLM 时代及未来 Web 安全再思考

    一篇综述提出,LLM 正深度嵌入 Web 应用与浏览器智能体,使 XSS 等传统漏洞被 LLM 中介的交互放大,提示注入等 LLM 特有漏洞也会跨 Web 应用传播。该综述统一分析客户端、服务端与流水线三层中 LLM 对 Web 漏洞的放大效应,并评估现有防御的局限,同时探讨将 NIST 与 ISO/IEC AI 安全框架扩展至 LLM Web 环境。文章指出对抗性自然语言指令、自主智能体安全、部署后持续监控与适配三大未解挑战,并提出一个 LLM 感知的监控与控制框架,整合语义输入校验、提示词完整性保护、输出隔离、智能体治理与运行时监控。

  3. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文25

    可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架

    一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。

  4. Adversa AI · 收录 · 原文 15

    有 AI 护栏还不够:红队测试才能验证护栏是否真正有效

    AI 护栏只是运行时防御,红队测试才能验证其能否抵御自适应攻击者。绕过研究对生产护栏的攻击成功率稳定在 65-84%,Carnegie Mellon 的 GCG 攻击对 GPT-3.5 和 GPT-4 的绕过率达 84%,"policy puppetry"技术可同时绕过所有主流基础模型。智能体 AI 引入多步工具滥用、间接提示注入、目标劫持和跨智能体利用四类护栏架构上无法捕捉的攻击,EU AI Act 和 NIST AI RMF 已要求或强烈建议持续对抗测试。

  5. Adversa AI · 收录 · 原文 15

    2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒

    Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。

  6. Adversa AI · 收录 · 原文 16

    2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击

    Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。

  7. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    NVIDIA NeMo Guardrails 如何为 RAG 应用做内容审核与安全检查

    NVIDIA NeMo Guardrails 通过集成 Meta 的 LlamaGuard 和 AlignScore 等第三方安全模型,为 RAG 应用提供内容审核与安全检查。该工具以开源工具包和微服务两种形式部署,支持内容审核、越狱检测、PII 检测、幻觉检测等护栏功能,可在 LLM 输出前扫描检索内容与生成回复中的冒犯性语言、虚假信息或政策违规。NeMo Guardrails 微服务处于早期访问阶段,提供 OpenAI 兼容 API。

  8. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 11

    NVIDIA NeMo Guardrails 如何衡量与优化生成式 AI 应用中的护栏效果与性能

    NVIDIA NeMo Guardrails 提供内容安全、话题控制、越狱检测等 AI 护栏,用于保障 AI 智能体及对话式 AI 应用的安全、符合品牌调性与可靠行为。该文探讨衡量与优化这些护栏效果和性能的技术方法,帮助企业在生成式 AI 应用中评估并提升护栏表现。

  9. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体

    NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。

  10. SPY Lab · 收录 · 原文 46

    SPY Lab 提出越狱税:越狱输出到底有多大用处

    SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。

    推荐理由提出越狱税这一指标,用可客观评分的基准量化越狱后模型效用的下降,为比较不同越狱方法提供新维度。

  11. Google DeepMind · 收录 · 原文 26

    Gemini 3.5 Flash 内置计算机操作能力

    Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。该能力使开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境看、推理并执行操作的智能体,面向持续软件测试等长周期与企业自动化任务。针对实时环境中的提示注入风险,Gemini 3.5 Flash 采用了定向对抗训练,并提供两个可选企业防护系统:敏感或不可逆操作需用户显式确认,检测到间接提示注入则自动停止任务。

  12. Microsoft PyRIT 版本发布 · 收录 · 原文 15

    PyRIT v1.0.1 修复结构化拒答处理

    Microsoft PyRIT 发布 v1.0.1 补丁,修复 OpenAI Responses 与 Chat Completions 返回结构化拒答时被误判为解析/运行时失败的问题。此前目标模型的拒答会导致攻击目标未完成并抛出误导性的 ValueError,现在拒答会被正常记录和评分,真正的部分执行则抛出 ScenarioPartialFailureException。使用 OpenAIResponseTarget 或 OpenAIChatTarget 对接近期 OpenAI 与 Azure OpenAI 模型的用户应升级;该版本还调整了推理模型响应片段顺序,将 reasoning 排在 text 之后。

  13. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails

    NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。

  14. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 12

    NVIDIA NeMo Guardrails v0.22.0 发布:LangChain 解耦、IORails 里程碑 2

    NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。

  15. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.23.0 发布:IORails 扩展工具调用与可观测性

    NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。

  16. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.24.0 发布

    NVIDIA 发布 NeMo Guardrails v0.24.0,IORails 现可直接执行库内 67 项输入输出接口中的 59 项,并与 LLMRails 共享同一底层实现。该版本引入引擎中立的 RailOutcome 契约、声明式的 rail manifest 以及统一的对外 HTTP 客户端,同时新增 F5 Guardrails 集成、服务器健康检查端点及通过 `/v1/checks` 进行输出检查的功能。

  17. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 7

    NVIDIA NeMo Guardrails v0.24.1 发布

    NVIDIA NeMo Guardrails 发布 v0.24.1 补丁版本,集中修复若干缺陷。该版本修正了 benchmark 中 Locust 并发测量与扫描、content-safety 对 Nemotron 3.5 响应的解析、server 在 IORails 准入丢弃时返回过载响应,以及 rails 对组合配置加载 config.py 的问题。

  18. NVIDIA garak 版本发布 · 收录 · 原文 25

    NVIDIA garak v0.15.0 发布:新增多轮 GOAT、Agent breaker 与系统提示提取探针

    NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。

9月30日周三
已经到底了