全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态OpenAI Alignment Research
OpenAI 发布 LASER:用递归采样筛选安全评测对话
OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。
- 动态Pillar Security
AI 网关护栏 2026:如何保护 LiteLLM、Kong、TrueFoundry 与 Agent Router(附 12 家护栏提供商对比)
一份指南梳理了 LiteLLM、Kong、TrueFoundry、Agent Router 等主流 AI 网关的护栏接入机制,并围绕同样八个问题对比了 12 家护栏提供商。LiteLLM 的 Generic Guardrail API 支持 45 家护栏提供商,Kong 提供 10 个 AI 护栏插件,TrueFoundry 开放输入、输出及 MCP 工具调用前后的钩子并接入 20 多家外部提供商。指南提醒 TrueFoundry 的输出护栏不作用于流式响应,且只读用户消息的护栏会漏掉工具结果或 MCP 描述中的注入。
- 动态0DIN
如何在五分钟内为 LiteLLM 接入 0DIN Defense
0DIN 发布 litellm-shield 插件,可将护栏分类器 SusFactor 作为 LiteLLM 代理的自定义护栏运行,安装一条 pip 命令即可在 flag 模式下启用。SusFactor 对每个提示词打分以拦截提示注入和越狱,支持 block、flag(默认)、shadow 三种模式,并接入 Langfuse、Datadog、OTel 等可观测性栈。它挂载在 during_call 阶段与模型调用并行执行,分类器中位延迟约 15.6ms、P95 23.9ms、P99 26.5ms,全部在 CPU 上运行,默认失败开放。
- 动态Lasso Security
AI 可观测性:工作原理、关键挑战与最佳实践
AI 可观测性指持续追踪生产环境中大语言模型的性能、成本与行为,采集延迟、token 用量、错误率和输出质量等指标,并通过仪表盘与告警暴露问题。它需同时捕捉系统级故障(超时、限流、成本激增)与模型级故障(质量漂移、不安全输出、提示注入尝试),覆盖性能、安全、合规与威胁攻击四类监控。麦肯锡调查显示,使用 AI 的组织占比从 2023 年的 55% 升至 2025 年的 88%,而欧盟 AI Act 要求高风险系统在 2026 年 8 月 2 日前具备风险管理、日志记录与人工监督。
- 动态Lasso Security
OWASP 2026 年 LLM 应用 Top 10 解读:哪些风险变了,哪些最值得关注
OWASP 2026 版 LLM 应用 Top 10 首次以数千起真实事件数据为依据重排风险,Prompt Injection 仍居首位,Excessive Agency 从第 6 升至第 3,Unbounded Consumption 上升 4 位,Misinformation 的实际影响远超安全团队预期。报告指出智能体系统的工具委派与自主决策需纳入威胁模型,并强调运行时资产清点、行为基线与自适应防护。Lasso 按 Discover-Assess-Protect 框架给出对应防御能力。
- 动态Lasso Security
Lasso Security 推出 LEAP:基于 CPU 的 AI 安全护栏,精度对标 GPU 方案
Lasso Security 发布 LEAP,一套基于 CPU 的 AI 安全护栏,宣称在文档处理吞吐上比商用护栏 API 和闭源 LLM 判官高出约三个数量级,同时保持 GPU 级准确率。LEAP 针对的是把 LLM 判官放在每个提示词、响应、检索文档和工具调用前的成本与延迟问题:单个 GPU 实例(如 AWS ml.g7.2xlarge,$3.15/小时)持续运行每月约需 $2,300。Lasso 主张低歧义输入无需开放式推理,应将推理模型留给真正模糊的安全决策。
- 动态Google ADK
Google ADK v2.8.0 发布:新增 Model Armor 护栏插件并修复 BigQuery 工具 SQL 注入
Google ADK 发布 v2.8.0,新增 Model Armor 护栏插件,并修复 BigQuery 工具中的 SQL 注入漏洞。该版本还加入 ADK_MAX_LLM_CALLS 环境变量以限制 LLM 调用上限,为 RemoteA2aAgent 增加原生任务模式与 auth_scheme、auth_credential 认证支持,并新增对中继智能体输出的围栏处理,防止其被伪装成指令。此外引入按调用与按工作流的 token 消耗等实验性遥测指标,默认关闭,需通过 ADK_EXPERIMENTAL_TELEMETRY=true 或 RunConfig 显式开启。
- 动态Cloud Security Alliance(AI 相关)
NIST AI Agent Security RFI 的多智能体系统安全经验总结
NIST 旗下 Center for AI Standards and Innovation 于 2026 年 1 月就 AI 智能体安全问题发出 RFI,一位从业者梳理其中 100 份公开回应,提炼出五条保障多智能体系统的实践经验。该总结指出,当智能体能互相调用时,安全保障的基本单元是整个配置好的系统而非孤立的模型,并强调受损组件会沿正常协作路径传播风险、委派构成信任边界、单独合规的部件组合起来未必安全、完整执行轨迹才是审计记录,以及保证应随模型、提示词、权限和拓扑的变化持续刷新。
- 论文arXiv:越狱、提示注入、投毒与防御
ACEA:面向红蓝队对抗的 LLM 协同演化测试平台
研究者提出 ACEA(Adversarial Co-Evolution Arena),一个把可插拔红队适配器与蓝队适配器接到同一靶标 LLM 上、由 LLM judge 对攻防成功率打分的对抗协同演化平台。平台通过最小化的 HTTP 协议 ACEA Standard Adapter Protocol(ASAP)接入任意语言编写的红队或蓝队项目,只暴露该协议即可成为完整参与者。评测方法上,向靶标注入规范化的秘密作为可验证真值,以区分真实泄露与模型幻觉;即使防御拦截了攻击,也仍把攻击发给靶标,从而独立测量攻击的原始效力,得到每轮攻击强度与防御有效性的分解。
- 论文arXiv:Agent 与 MCP 安全
从注入到交互:LLM 时代及未来 Web 安全再思考
一篇综述提出,LLM 正深度嵌入 Web 应用与浏览器智能体,使 XSS 等传统漏洞被 LLM 中介的交互放大,提示注入等 LLM 特有漏洞也会跨 Web 应用传播。该综述统一分析客户端、服务端与流水线三层中 LLM 对 Web 漏洞的放大效应,并评估现有防御的局限,同时探讨将 NIST 与 ISO/IEC AI 安全框架扩展至 LLM Web 环境。文章指出对抗性自然语言指令、自主智能体安全、部署后持续监控与适配三大未解挑战,并提出一个 LLM 感知的监控与控制框架,整合语义输入校验、提示词完整性保护、输出隔离、智能体治理与运行时监控。
- 论文arXiv:Agent 与 MCP 安全
可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架
一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。
- 动态Adversa AI
有 AI 护栏还不够:红队测试才能验证护栏是否真正有效
AI 护栏只是运行时防御,红队测试才能验证其能否抵御自适应攻击者。绕过研究对生产护栏的攻击成功率稳定在 65-84%,Carnegie Mellon 的 GCG 攻击对 GPT-3.5 和 GPT-4 的绕过率达 84%,"policy puppetry"技术可同时绕过所有主流基础模型。智能体 AI 引入多步工具滥用、间接提示注入、目标劫持和跨智能体利用四类护栏架构上无法捕捉的攻击,EU AI Act 和 NIST AI RMF 已要求或强烈建议持续对抗测试。
- 动态Adversa AI
2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒
Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。
- 动态Adversa AI
2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击
Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA NeMo Guardrails 如何为 RAG 应用做内容审核与安全检查
NVIDIA NeMo Guardrails 通过集成 Meta 的 LlamaGuard 和 AlignScore 等第三方安全模型,为 RAG 应用提供内容审核与安全检查。该工具以开源工具包和微服务两种形式部署,支持内容审核、越狱检测、PII 检测、幻觉检测等护栏功能,可在 LLM 输出前扫描检索内容与生成回复中的冒犯性语言、虚假信息或政策违规。NeMo Guardrails 微服务处于早期访问阶段,提供 OpenAI 兼容 API。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA NeMo Guardrails 如何衡量与优化生成式 AI 应用中的护栏效果与性能
NVIDIA NeMo Guardrails 提供内容安全、话题控制、越狱检测等 AI 护栏,用于保障 AI 智能体及对话式 AI 应用的安全、符合品牌调性与可靠行为。该文探讨衡量与优化这些护栏效果和性能的技术方法,帮助企业在生成式 AI 应用中评估并提升护栏表现。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA AI 红队分享 LLM 安全实践建议
NVIDIA AI 红队(AIRT)基于多年来对多种 AI 系统在生产部署前的安全评估,总结出若干 LLM 应用中的常见漏洞与安全隐患,指出若在开发阶段加以处理可显著提升基于 LLM 应用的安全性。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体
NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。
- 会议论文SPY LabICML 2025
SPY Lab 提出越狱税:越狱输出到底有多大用处
SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。
- 动态Google DeepMind
Gemini 3.5 Flash 内置计算机操作能力
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。该能力使开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境看、推理并执行操作的智能体,面向持续软件测试等长周期与企业自动化任务。针对实时环境中的提示注入风险,Gemini 3.5 Flash 采用了定向对抗训练,并提供两个可选企业防护系统:敏感或不可逆操作需用户显式确认,检测到间接提示注入则自动停止任务。
- 动态Microsoft PyRIT 版本发布
PyRIT v1.0.1 修复结构化拒答处理
Microsoft PyRIT 发布 v1.0.1 补丁,修复 OpenAI Responses 与 Chat Completions 返回结构化拒答时被误判为解析/运行时失败的问题。此前目标模型的拒答会导致攻击目标未完成并抛出误导性的 ValueError,现在拒答会被正常记录和评分,真正的部分执行则抛出 ScenarioPartialFailureException。使用 OpenAIResponseTarget 或 OpenAIChatTarget 对接近期 OpenAI 与 Azure OpenAI 模型的用户应升级;该版本还调整了推理模型响应片段顺序,将 reasoning 排在 text 之后。
- 动态NVIDIA NeMo Guardrails 版本发布
NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails
NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。
- 动态NVIDIA NeMo Guardrails 版本发布
NVIDIA NeMo Guardrails v0.22.0 发布:LangChain 解耦、IORails 里程碑 2
NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。
- 动态NVIDIA NeMo Guardrails 版本发布
NVIDIA NeMo Guardrails v0.23.0 发布:IORails 扩展工具调用与可观测性
NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。