跳到正文

#供应链

今天还没有收录新动态
10月1日周四
  1. arXiv:越狱与提示注入 ·

    推理层安全:防御对抗性推理与基础设施滥用

    论文研究 LLM 服务在推理层面临的对抗性交互,包括越狱、拒绝服务与知识蒸馏攻击,并以假设的前沿实验室 Five Elements Inc. 为例展开。由于缺少公开的对抗性 LLM 使用标注数据集,作者提出结构因果模型(SCM)生成带标签的用户会话数据集,包含协同多账号活动、平台反馈和三个层级的标签可观测性。在该数据集上训练的梯度提升检测器对 oracle 标签的二元分类 AUPRC 达 0.993,但面对真实 Trust & Safety 团队持有的运营标签时 AUPRC 仅 0.313,说明检测器比用于评估它的标签更准确。攻击类型归因方面,朴素 argmax 受 98% 良性先验主导,macro-F1 仅 0.295,改用简单阈值决策引擎后提升到 0.489 且不损失准确率。数据集已公开。

9月29日周二
9月28日周一
  1. arXiv:后门、投毒与隐私 ·

    物理认证联邦学习:为关键水务基础设施的协同异常检测提供安全保障

    研究提出"物理认证联邦学习",将守恒定律、执行器耦合等信息物理过程不变量从运行时检测启发式改造为联邦更新的可验证准入条件,自动从干净运行数据中挖掘。在 SWaT、WADI 两个水务测试床和 BATADAL 基准上,挖掘出的不变量对 100 个诚实分片零拒绝,并全部拒绝朴素伪造更新,包括 FoolsGold 完全放行的优化扰动。

  2. arXiv:越狱与提示注入 ·

    研究者提出面向结构化 Agent 动作的多源完整性认证方法

    论文提出一种面向 LLM 智能体结构化动作的多源完整性认证器,用于抵御间接提示注入篡改动作关键字段。该方法要求每个字段满足其证据结构支持的规则:在腐败可区分的证据类别上设定有界腐败半径并以最小命中集计数,避免重复发布或洗白副本凑出多数;对互补字段做确定性调和;证据仅剩单一来源时引入可信锚点。作者形式化两种鲁棒性概念,通过消融验证各机制,并在制裁名单(70,966 个实体)与软件供应链溯源(450 个包)上测量多源前提的成立频率,发现真实佐证在上界代理下均为少数现象,朴素证明计数会高估独立性。

9月26日周六
  1. arXiv:对齐与欺骗 ·

    基于硬件 PUF 指纹的知识蒸馏设备级溯源框架

    针对知识蒸馏中教师模型易被窃取且现有水印或硬件访问控制难以定位泄露设备的问题,研究者提出一种将设备专属 PUF 签名叠加到教师 logits 上的指纹框架,使经知识蒸馏训练的学生模型继承与硬件绑定的唯一身份。该方案在 Xilinx Zynq-7020 FPGA 上测量环形振荡器(RO)PUF 生成签名,架构无关,可跨 CNN、Vision Transformer 和编码器继承身份,并通过神经解码器与汉明距离精修的两阶段恢复流程在噪声条件下保持高检测准确率,另引入多级 logit 编码支持大规模设备部署。实验显示嵌入指纹能抵抗常见的蒸馏后修改。

9月25日周五
  1. arXiv:Agent 与 MCP 安全 ·

    基于区块链的 Agentic AI 框架:面向安全软件供应链的资源优化与能耗感知

    该论文提出一个区块链支撑的 Agentic 安全框架,用于保护完整软件开发生命周期并保障负责监控的 AI 智能体本身。框架协调源码完整性、依赖与 SBOM 分析、CI 配置审计、制品验证和运行时策略评估等专用安全智能体,每个智能体由 LLM 驱动生成结构化安全报告,并通过智能合约将加密签名的证明记录到许可链的智能体注册表、不可篡改证明日志和可执行发布策略模块中。智能体与区块链节点间通信由联盟运营的证书颁发机构保障,用例演示了源码安全智能体如何上链证明并触发可验证的允许/阻止部署决策。

  2. arXiv:越狱与提示注入 ·

    基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案

    针对自主 AI 智能体面临的提示注入攻击与凭证泄露风险,该提案提出一种基于能力安全原则的框架,利用 OAuth Agent Authorization Profile 及 W3C DID 和 VC 标准,让智能体通过加密绑定其身份与签发者身份、并限定作用域的令牌访问服务。服务方可验证委托链仅涉及权限衰减后再执行令牌操作。该安全层位于语言模型上下文窗口之外的安全模块中,使智能体能在可强制执行的安全边界内行动。

9月24日周四
  1. Google Threat Intelligence(GTIG) ·

    Google GTIG 发布 CI/CD 与代码流水线主动防御蓝图

    Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。

9月23日周三
9月19日周六
  1. arXiv:Agent 与 MCP 安全 ·

    当智能体信任跨越组织边界:结构外化与信任证据参考模型

    论文提出 Trustworthiness as a Service(TaaS),用于解决智能体跨组织边界调用工具、服务与其他智能体时,依赖方无法仅凭生产域控制与记录评估被委托动作的问题。其分析单元为跨域依赖命题,通过三条件结构外化诊断识别需多域依赖、生产方独立验证且须在撤销、失败、记录冲突或争议后仍可复核的命题,并为此设计不可变工作流清单与仅追加、发行方可归属的信任证据信封。论文还给出拓扑中立的逻辑参考模型,并以三个分析场景和 TaaS-Eval 协议提案定义清单、独立消费者、硬门控、对抗性证据测试与指标。

  2. arXiv:越狱与提示注入 ·

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    论文对企业级 MCP 的授权缺口做了系统分析,并给出不改动协议与 SDK 内部实现的 FastMCP 可组合扩展。作者调研 Python、TypeScript、Go、Rust、C#、Swift 六种 MCP SDK,指出三个结构性缺陷:凭据提取绑定单一 Authorization 头,使同时服务人类用户(企业 SSO)与自动化 Agent(不同请求头上的服务账号凭据)的双角色部署需要自定义中间件;缺少认证前的工具发现;基础 SDK 缺少按工具的细粒度授权。

9月17日周四
  1. arXiv ·

    面向旧款 GPU 的可验证差分隐私训练框架:用 CPU 侧 TEE 校验 GPU 梯度

    论文提出一种在旧款 GPU 上实现可验证差分隐私(DP)训练的框架,用 CPU 侧 TEE 配合不受信任的 GPU 完成校验。作者指出,零知识证明等密码学方案开销过大,有时高出数个数量级,而支持大语言模型训练与微调的多 GPU TEE 仅限较新平台,在旧款 GPU 上缺失或效率低下。该设计把昂贵的梯度计算卸载到 GPU,由 CPU TEE 通过概率性检查验证梯度上 DP 是否被正确执行,以缓解全在 CPU TEE 内训练过慢、无限制卸载又可能被恶意偏离 DP 的效率与安全矛盾。框架能以高概率检测频繁的完全偏离;在本文评估的面向效用的伪造梯度攻击中,稀疏偏离带来的效用收益有限,也未观察到可测量的额外成员泄露。

9月10日周四
  1. arXiv:Agent 与 MCP 安全 ·

    面向 AI-SOC 的神经符号防御框架:用 SIEM 解码器与 NeMo Guardrails 阻断日志投毒提示注入

    论文提出一种神经符号纵深防御架构,用于保障 LLM 接入安全运营中心(SOC)后的管道完整性,应对通过日志投毒实施的间接提示注入。作者指出,攻击者可在系统日志中嵌入恶意载荷,形成多步 promptware 攻击链,劫持 LLM 的操作逻辑;而确定性防御语义盲、纯神经评估延迟高且存在概率性缺陷。该框架第一层用定制 SIEM 解码器作为确定性预过滤,在数据摄入边缘做结构化清洗,消除体量填充和基于签名的注入;第二层用 NeMo Guardrails 在 LLM 处理前对结构化 SIEM 告警做自检式语义边界校验;同时集成闭环遥测系统,在 SOC 仪表盘中为人工介入提供被拦截攻击的可见性。

9月9日周三
  1. OX Security Blog ·

    OX VibeSec 新增依赖审查能力,拦截 AI 编程智能体的每一次安装尝试

    OX Security 旗下 OX VibeSec 新增 Dependency Vetting 能力,可在 AI 编程智能体发起每次依赖安装时对照策略做确定性检查并阻止恶意包落地,无需改变开发者工作流。该能力现已可用,会直接阻断已知恶意包并提供可配置冷却期来拦下刚发布的软件包;基于严重 CVE 的漏洞封堵与许可证策略执行即将推出。

9月5日周六
  1. arXiv:越狱与提示注入 ·

    KITA:为 LLM Agent 设计密钥隔离的阈值签名授权架构

    研究者提出 KITA,一种从审查到授权的架构,将用户个人签名密钥和所有阈值签名密钥份额置于所有 LLM 进程之外,以阻止提示注入从判断边界跨越到执行权限。在阈值签名不可伪造性和其系统假设下,攻击者即使攻陷提案方和少于 t 个审查签名域,也无法在没有 t 个不同域签名贡献的情况下为新动作生成有效授权,因此任何此类授权都包含来自未被攻陷域的份额,并绑定到规范动作、仅在通过认证的审查者批准后释放。作者用结构化输出 LLM 适配器和阈值 BLS 实现了完整的审查者到执行者路径,通过六项系统测试验证该接口上的法定人数门控与消息绑定,并用密码学微基准测量在线签名路径及其扩展行为。

9月4日周五
  1. Cisco AI Blog ·

    你的 AI 智能体信任了你从未批准的东西:Cisco 与 OpenAI 合作扫描 Agent Skill 与 MCP 供应链风险

    Cisco 正与 OpenAI 合作,将 Daybreak 引入其 AI 安全产品组合,用于扫描 AI 供应链中的 Agent Skill 与 MCP server。该方案采用分层架构:Daybreak Blue 负责首轮扫描,对提交的 skill 和 MCP server 做网络安全专用推理,避免通用模型因拒答而漏检合法防御性内容;Daybreak Red 则处理 Blue 标记为不完整的重度混淆载荷与可用漏洞利用链。Cisco AI Defense 的 skill-scanner 覆盖 SKILL.md 及全部捆绑脚本,mcp-scanner 覆盖工具、提示词、资源及底层 PyPI 和 npm 包,重点查找工具声明与实际代码行为的差距。

8月25日周二
  1. Cisco AI Blog ·

    Cisco AI Defense 与 Armada 合作:分布式 AI 在任务所需之处安全运行

    Cisco AI Defense 与 Armada 合作,为分布式 AI 提供 AI 原生安全层:通过 Adaptive Red-Teaming 在生产前对模型做红队验证,并在运行时对提示词、响应、MCP 交互和工具调用施加护栏,覆盖提示注入、越狱、敏感数据泄露、不安全内容、工具滥用等风险。该方案面向 Armada Bridge GPU 上部署的 LLM,支持云、主权云与边缘环境,敏感 AI 载荷与运行时执行保留在客户或租户环境内,策略、可见性与报告可集中管理。

8月24日周一
8月20日周四
  1. UK NCSC(AI 相关) ·

    UK NCSC 发布《管理智能体 AI 的网络风险》指南

    UK NCSC 发布针对智能体 AI 网络风险的防护指南,建议将 AI 智能体运行于沙箱环境并管控其本地及网络的资源访问。指南提出四层网络访问成熟度模型(从无限制访问到模型本地托管且无外部网络)、四级计算隔离模型以及凭证最小化原则,并要求通过多层隔离加显式提示降低沙箱逃逸风险。 对于高风险场景,最稳健的做法是在隔离断网环境中运行智能体并使用预先下载的工具和信息;若需联网则仅放行白名单连接,必要时改用协议或服务感知代理并经人工审批。该指南还指出部分自主 AI 工具会接入大量系统与服务,访问面越大潜在 blast radius 越高,因此应将其权限收敛到完成任务所需的最小集合并持续监测越权尝试。

7月30日周四
  1. Google Threat Intelligence(GTIG) ·

    Google Threat Intelligence Group 供应链入侵缓解指南:开放源代码软件生态威胁活动激增

    Google Threat Intelligence Group(GTIG)联合 Mandiant 发布了针对软件供应链入侵的加固与缓解建议,指出 2025 年至 2026 年上半年出现了大规模的开源软件供应链入侵行动,涉及代码仓库、依赖项及开发者工具的攻陷。 其中,UNC6780(又名 TeamPCP)于 2026 年 2 月至 5 月在 PyPI、npm、Docker Hub 发动广泛攻击,滥用 GitHub Actions 的 pull_request_target 触发器获取基础仓库密钥并植入凭证窃取程序 SANDCLOCK,还试图从被感染的 AI 软件横向渗透到企业网络环境。

7月16日周四
  1. Google Threat Intelligence(GTIG) ·

    Google 详解 AI 辅助漏洞管理:从确定性管控到 ZDR 的操作蓝图

    Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。

7月15日周三
  1. Google Threat Intelligence(GTIG) ·

    Google Cloud Run 无认证公开函数的安全风险与加固指南

    Mandiant 安全评估发现大量缺乏认证的公网暴露 serverless 应用,Cloud Run 服务若含第三方依赖易遭本地文件包含(LFI)、远程文件包含及命令注入攻击,成功利用可获得容器实例完整控制权并进一步横向移动接管云环境。该博客基于客户实战经验梳理攻击场景,针对必须公网开放的 Google Cloud Run 服务和函数给出一组加固建议,相关原则同样适用于任意公有 serverless 部署。

6月1日周一
4月10日周五
  1. Microsoft PyRIT 版本发布 ·

    微软 PyRIT 发布 v0.12.1 安全补丁,修复 Jinja2 模板注入漏洞

    微软 PyRIT 发布 v0.12.1 安全补丁,修复 Jinja2 模板注入(SSTI)漏洞,建议 0.12.0 及更早版本用户升级。漏洞源于模板渲染使用未沙箱化的 Jinja2 Environment,远程数据集加载器把抓取的数据直接传入 SeedPrompt(value=...) 并在 __post_init__ 中按模板渲染,被投毒的数据集可借此实现 Python 对象遍历。

3月25日周三
  1. Simon Willison(提示注入) ·

    Claude Code 推出 auto mode,用 Claude Sonnet 4.6 分类器替代跳过权限

    Claude Code 新增 auto mode 权限模式,由 Claude 代替用户做权限决策,并在动作执行前由护栏审查,作为 --dangerously-skip-permissions 的替代方案。护栏由独立的分类器模型实现,运行在 Claude Sonnet 4.6 上,即使主会话使用其他模型也如此;分类器会拦截超出任务范围、指向不可信基础设施或疑似受文件与网页中恶意内容驱动的动作。用户可在终端运行 claude auto-mode defaults 查看完整默认规则 JSON,并可用自定义规则扩展。

1月31日周六
  1. NVIDIA 技术博客:可信 AI 与网络安全 · · 原文 62

    NVIDIA 发布智能体工作流沙箱与执行风险管理的安全实践指引

    NVIDIA 发布面向智能体工作流的安全实践指引,聚焦沙箱化与执行风险管理。文章指出,AI 编码智能体通过命令行运行工具时,会继承与用户相同的权限和授权,因而成为计算机使用智能体,带来常被忽视的攻击面。该指引围绕这一执行风险给出实践建议。

    推荐理由NVIDIA 安全团队从权限与执行风险角度给出智能体工作流的沙箱实践指引,适合部署编码智能体的团队参考。

7月29日周二
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    为 AI 模型带来可验证信任:NVIDIA NGC 中的模型签名

    NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。

12月20日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书,阐述其保障 NVIDIA AI Enterprise 软件栈容器安全所采取的措施。白皮书涵盖安全开发生命周期、容器构建生命周期管理、安全设计、安全加固、SBOM、容器签名与模型签名及 NIM 微服务。漏洞响应部分包括漏洞扫描、修补、VEX 与协同漏洞披露,并由 NGC 通知服务做安全事件监控。

10月4日周五
已经到底了