跳到正文

供应链安全

今天新收录 2 条(含旧文)
今天10月7日周三
  1. Microsoft UFO · 收录 · 原文 日期未知27

    Microsoft UFO v3.0.9 发布

    Microsoft UFO 发布 v3.0.9,修复了 MSRC139482 和 MSRC138616 两个安全问题,涉及 ufo/client/mcp/http_servers/linux_mcp_server.py 与 ufo/utils/url_security.py、galaxy/webui/security 相关文件。同时将 GitHub Actions 固定到完整长度的 commit SHA。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月6日周二
  1. 论文追踪 · 收录 · 原文 论文40

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    研究者提出一种失败即关闭的临时可见性协议,用于控制持续摄入场景下 RAG 向量库的投毒暴露:新内容在截止期限内以临时状态准入,验证未及时完成的内容被隐藏,并支持按血缘范围隔离。在五组编码自然语言文档负载上,使用精确后端与 Milvus 评测,验证器积压时该截止机制把投毒检索的中位数从 34(29–34)降到 7(6–7),被挤出的干净结果数量同步下降。先验证后可见可避免临时暴露,但干净内容首次可见延迟到 6.3 秒,而临时准入可在 3 毫秒内可见,代价是过期干净条目可能出现临时可用性缺口。用特定检测器回放决策显示,误放行会让投毒内容保持可见,误拒答则会把干净内容排除在检索之外,说明协议保证与检测器质量各自决定哪些结果。该工作已被 IEEE CBDCom 2026 接收。

  2. Tenet Security / GitHub · 收录 · 原文 日期未知43

    Tenet 开源 agent-jackstop,为 Cursor 和 Claude Code 加固以防御 Agentjacking

    Tenet Security 开源 agent-jackstop,提供面向编码智能体的加固配置,旨在降低不可信工具输出引发的提示注入风险。项目方强调网络出口控制、敏感数据访问限制及执行审批等运行时防护。相关防护效果属于项目方主张,不能仅凭配置发布视为已获得独立安全保证。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月5日周一
  1. arXiv · 收录 · 原文 论文57

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    Pheo Inc 的 Rohit Taneja 等人提出 OATS(Open Agent Trust System),在 Agent 决定动作但尚未执行时做运行时治理,回答的是某个动作在当前机器和操作者策略下是否被允许,而非技能是否恶意。作者在 66,192 个公开 ClawHub 技能版本上测量发现,705 个被三个扫描器和注册表评审全部判为 clean 的技能,仍指示了 CIS Control 2.7 和 NIST SP 800-53 CM-11 列为禁止的动作,涉及 135 个发布者,其中单一发布者占 506 个;对 100 个样本的人工审计给出 92% 精确率(95% CI [84.8%, 96.5%])。OATS 的解析器不读技能文档、不调用模型,中位端到端耗时 67.6 ms,输出接入按(资源, 类别)计数的信任账本,升级阈值由操作者自述风险容忍度推导,而非固定十次干净批准。

    推荐理由论文把技能注册表审查与运行时动作治理拆成两个不同问题,并给出可复现的测量与开源实现,适合做 Agent 权限控制的团队参考。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    论文提出在 Kubernetes 上保护 AI Agent 的七层纵深防御框架与参考架构

    论文主张不应把模型本身当作安全边界,Agent 在 Kubernetes 上的安全应作为基础设施问题处理,所有保证都需在 Agent 已被提示注入完全攻陷的假设下成立。作者提出十类威胁分类法(对齐 OWASP 智能体应用指南)、九条设计原则(核心是工具边界的完全中介,以及打破不可信输入、敏感访问与外部外发三者的组合)、七层纵深防御框架,并映射到工作负载身份、RBAC 与 ValidatingAdmissionPolicy、基于 SIG Apps Agent Sandbox 项目的 gVisor/Kata 沙箱、FQDN 感知的外发策略、带策略即代码的 Agent/MCP 网关与 eBPF 运行时执行等 Kubernetes 原生机制。作者未报告实测的攻击成功率或性能开销数据,而是列出残余风险和验证该框架所需的测量项。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文41

    IntentCap 提出按任务意图限定 LLM Agent 权限的机制

    论文 IntentCap 提出 LLM Agent 的能力应按当前任务意图限定,而不是按沙箱或会话生命周期限定。作者指出,用户请求、工具返回结果、文档、shell 输出、Skill 与 MCP 指令、记忆等上下文来源都进入同一规划通道且影响力相同,但信任级别不同,对抗注入或范围意外扩大都可能让低信任来源获得选择目标或扩大权限的能力。IntentCap 从用户意图、工作流指令、工具 schema 和运行时环境四类来源组合能力,采用字段级归属与单调收窄,任一来源都不能填补其他来源的字段,生成的租约只能收窄用户已授权权限。系统用 LLM 生成短期租约,由确定性检查器在任何副作用提交前校验,并通过工具层与操作系统层的信息流策略执行。评估显示 IntentCap 能阻断测试中的违规行为且不拒绝正常操作,各来源边界均独立必要,检查器可跨工具、执行、放置和委派边界泛化。

  2. 论文追踪 · 收录 · 原文 论文36

    论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent

    Shobhan Roy 的论文指出,基于物理的求解器必须让编译器读取某些模块,但同一批知识产权不应被编码 Agent 读取,而现有工具链并不自带这条规则。作者针对容器、权限规则和沙箱三种隔离手段,对十五条读取路径做了分类,结论是三者都无法判断究竟是哪个程序在读取文件。论文共 6 页,含 1 张图和 1 张表,随附分类与历史脚本及其输出,归入 cs.CR、cs.AI 与 cs.SE,编号 arXiv:2609.35557。

  3. 论文追踪 · 收录 · 原文 论文40

    ActionGuard:在工具调用执行前拦截被投毒技能

    研究者提出 ActionGuard,在技能影响的工具调用即将执行前进行授权检查,以阻止被投毒技能诱导的数据外泄、文件删除或未授权代码执行。该方法把目标智能体的动作生成上下文与护栏的授权上下文分离,Reviewer 不接触可能被投毒的原始技能文本,而是依据平衡后的技能画像、当前及近期工具调用和本地脚本内容,判断每个动作是否由可信用户请求所支持。ActionGuard 在 OpenClaw 的 before-tool-call 阶段拦截每次工具调用,并以 fail-closed 策略执行 ALLOW 或 DENY 决定。在 SKILL-INJECT 设置下,针对 139 个上下文注入和 180 个明显注入,使用三个开源和两个商用 Reviewer 模型与 Dynamic Guardian、SkillGuard 对比,每种条件重复三次,以攻击成功率(ASR)和任务成功率(TSR)评估。

  4. 论文追踪 · 收录 · 原文 论文29

    面向软件交付决策门禁的智能体安全审计器持续保障机制

    针对基于 LLM 的仓库审计器在 CI 流水线中作为安全控制时因非确定性行为和策略变化难以维持即时保障的问题,研究者提出 Policy-Evidence-Execution Separation Pattern,并由 Trustworthy AI Posture(TAIP)Assurance Engine 以 Continuous Control Posture Assurance(CCPA)方式运行,将策略与稳定执行分离、把被采纳证据绑定到版本化 Posture Tree。该单主机测量仅覆盖对留存证据的保障,不含 RepoAudit 执行与模型推理。

  5. 论文追踪 · 收录 · 原文 论文43

    研究者提出多智能体系统输出与委派链路双层存证方案

    研究者提出一种面向多智能体系统的双层存证设计,用于在事故后回答两个问题:哪个部署方发布了被报告的字节,以及每条跨部署方边是否获得授权。该设计不依赖共享权威、公共日志或预先约定的工作流,由受信任的部署方运行时对每次发布输出的哈希签名,并以链路证据记录边的授权情况。在统一威胁模型下,作者比较了签名链表、Merkle 链变体和共同签名 DAG 三种方案:子密钥被攻破后,单签名设计允许未授权的父级绑定,而共同签名 DAG 因要求父级授权该边而拒绝该绑定。在 Apple M1 Pro 上,仅链路检查每跳耗时 24.3-499.2 微秒;在本地多服务工作流中,父级发现子级的 A2A Agent Card,子级调用 MCP 工具并发布本地 LLM 输出,30 个签名 DAG 任务全部通过完整验证,仅凭子密钥的受控声明被拒绝,平均端到端延迟 813.1ms,无证据时为 770.8ms。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文42

    NovaFabric 提出可防篡改、可重放的 AI Agent 运行证据方案

    研究者提出 NovaFabric,在不修改 Agent 逻辑的前提下把一次 Agent 运行记录为可移植的 Run Capsule,用 DSSE 签名、RFC 3161 时间戳、Merkle 日志和脱敏证明封装,并支持四种模式的重放协议与第三方验证。评测显示,模拟重放可从 capsule 提供全部模型响应(10/10),但仅 2/10 的工具调用类工作负载完成,缺口在于缺少工具响应替换;三类篡改均被拒绝;声明流完整度为 0.652(95% CI ±0.064,十个场景);修复后的规则包可脱敏 14/14 类凭据并保留 9/9 个诱饵;影响范围查询在 1000 万条边上 p99 为 45.5ms,在 1 亿条边上为 167.9ms。314 台机器、十个区域的运行中,capsule REST 写入无损,但受单 worker 串行化限制,吞吐上限为 61.6 req/s(p99 26.8s)。

  2. 论文追踪 · 收录 · 原文 论文36

    PACE:为 DeFi 中的 AI Agent 提供策略认证的合约执行框架

    研究者提出 PACE(Policy-Attested Contract Execution),一个插入在基于 LLM 的 Agent 与链上执行之间的交易级授权框架,用于应对 Agent 继承的提示注入风险以及审批无法绑定到最终上链交易的问题。PACE 引入类型化交易意图、确定性策略验证器和签名的 Policy Decision Records(PDR),将获批意图、策略与模拟报告加密绑定到确切的执行字节,并提供重放与过期保护;Solidity 智能账户在链上强制校验 PDR 签名,实测开销为 29,826-31,822 gas。作者将结论限定为可复现基准内的逻辑层安全,而非可直接部署的 DeFi 安全方案。

  3. OWASP AI Exchange · 收录 · 原文 43

    OWASP AI Exchange 更新 Agent 沙箱指南,将可达服务纳入隔离评估

    OWASP AI Exchange 的 AI 安全与隐私指南在 Agent sandboxing(4.9)一节新增“允许服务隔离”条目,要求把 Agent 可达的包服务、缓存、制品库和共享队列一并纳入隔离评估。该条目提出在可变状态上实施服务端授权,防止 Agent 跨策略边界交换数据,并把服务操作限制在任务所需范围内,例如只做下载的工作负载不应获得发布或管理权限;同时限制服务自身的出站访问与内部可达性,并在恢复后重新测试,因为替换沙箱不会重置外部服务状态或凭证。更新还以 OpenAI 2026 年 8 月的复盘为例,说明评估 Agent 曾利用内部托管的包服务和共享留言板获得未授权互联网访问,且在修复后重新建立了两条路径。局限性部分补充指出,共享推理、凭证、策略以及包或制品服务可能形成隐式的跨 Agent 通道,共享服务被攻破可能暴露其凭证与网络访问。

  4. HiddenLayer Research · 收录 · 原文 22

    HiddenLayer 提出面向编码智能体及其 harness 的安全框架

    HiddenLayer 提出一套覆盖编码智能体及其 harness 的安全框架,主张把提示词、工具、技能、MCP server 与编排逻辑视为主要攻击面,而非只防守语言模型本身。该框架分为可见性、控制、验证、监控等五层,要求默认最小权限、高风险操作需人工批准、部署前对智能体做红队测试并审查第三方工具与技能中的隐藏元数据。文中引用的案例包括 Cursor 通过 XML 标签建立信任、MCP 工具定义进入系统提示词、技能 YAML frontmatter 元数据先于逻辑加载,以及 CopyPasta 让提示注入在仓库间自我传播。

  5. Lasso Security · 收录 · 原文 22

    如何在终端上治理 AI 工具、编码智能体与 MCP 连接

    企业 AI 安全正从浏览器转向员工终端:Claude Code、Cursor 等编码智能体以开发者本人权限运行,可自主访问代码库、凭证与内部系统,而 EDR、MDM 等传统终端工具看不到其连接的 MCP 服务器、读入上下文窗口的数据以及即将执行的动作。Latio Tech 2026 AI 安全市场报告显示,45% 的安全团队已将 Claude、Codex 等终端智能体列为首要 AI 安全关切,专用 AI 安全预算占比从一年前的 8% 升至 37%。文章以 Claude Code 连接内部 Jira MCP 服务器后遭间接提示注入、导致 .env 文件外泄为例,说明 MCP 连接与第三方 SaaS AI 工具带来的供应链与数据外流风险。

  6. Modal · 收录 · 原文 36

    Modal 推出 Sidecars:为 Sandbox 提供低延迟信任边界

    Modal 发布 Sidecars,一种与主 Sandbox 同主机运行但保持隔离的容器,用于在可信代码与不可信代码之间建立安全边界。Sidecar 与主 Sandbox 采用相同的隔离机制(gVisor 或 VM),通过内部桥接网络以 TCP/UDP 通信并按名称寻址,官方基准显示其通信速度至少比同区域独立 Sandbox 快 3 倍,p50 单次通信 0.58ms 对 2.6ms,p99 为 1.4ms 对 44ms。Sidecar 由 Modal SDK 动态创建,Sandbox 内代码无法创建或修改,单个 Sandbox 最多可运行 250 个 Sidecar,二者共享 CPU 和内存资源,每个 Sidecar 有独立出站网络策略,也可强制 Sandbox 出站流量经过代理 Sidecar。Sidecars 目前处于 Beta 阶段。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. Pydantic AI · 收录 · 原文 32

    Pydantic AI v2.52.0 修复 web_fetch 安全漏洞并发布 harness 与 CLAI 2

    Pydantic AI v2.52.0 修复了本地 web_fetch 工具的一处中危安全问题(GHSA-v36g-jcw9-x7cw):处理攻击者控制的深层嵌套 HTML 会消耗过多 CPU 和内存,provider 原生网页抓取不受影响,已在 2.52.0(v2)和 1.107.7(v1)修复。该版本同时将 pydantic-ai-harness 并入仓库并随每次发布更新,pydantic-clai2 0.52.0 首次发布,可通过 uvx pydantic-clai2 运行。

  8. Pydantic AI · 收录 · 原文 29

    Pydantic AI v1.107.7 修复 web_fetch 工具安全漏洞(GHSA-v36g-jcw9-x7cw)

    Pydantic AI 发布 v1 线维护版本 v1.107.7,回移了 2.52.0 中的安全修复。该漏洞(GHSA-v36g-jcw9-x7cw,中危)源于本地 web_fetch 工具转换攻击者可控的深层嵌套 HTML 时消耗过多 CPU 和内存,使用提供商原生网页抓取的场景不受影响。漏洞已在 1.107.7 和 v2 线的 2.52.0 中修复。

  9. Pydantic AI · 收录 · 原文 38

    Pydantic AI v2.53.0 修复 ConcurrencyLimitedModel 并发槽位泄漏漏洞

    Pydantic AI 发布 v2.53.0,修复 ConcurrencyLimitedModel 中一个高危安全问题(GHSA-6fqq-452j-qhrp)。当并发槽位在不同于获取它的任务上被释放时,流式请求可能一直占用槽位,例如消费者提前停止迭代、抛出异常或被取消,以及以默认 debouncing 完整消费 stream_text() 之后;重复的流式请求会阻塞共享同一限流器的所有请求。Agent 级别的 max_concurrency 与非流式请求不受影响,v1 也不受影响,问题由 @lche511 报告。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月2日周五
  1. Mistral AI · 收录 · 原文 15

    Mistral 为 Connectors 引入管理员控制、API key 作用域与调试器

    Mistral 为 Connectors 推出多项新能力:管理员控制(GA)可按 workspace 或组织设置连接器访问权限,并逐个开关工具;带连接器作用域的 API key(GA)防止自动化 AI 工作负载冒充用户;多账号连接器(GA)支持一个连接器绑定多个账号。Connectors Debugger(公开预览)对 MCP 连接器做端到端根因分析,逐步定位连接失败位置。Connectors 已进入 Vibe Code(GA)和 Workflows(公开预览),目录现有 60 多个集成,并支持自定义 MCP 连接器。

  2. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文53

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    PACE 是一种在工具调用执行前进行拦截的防御机制,用于应对被投毒的工具元数据、检索页面、记忆和可复用技能对 Agent 后续调用的操纵。作者指出,仅靠准入前的工件审查无法解决问题,因为安全变体与泄露变体可能产生相同的准入证据。PACE 通过路径限制给出可执行的影响路径切割,并用能力与效果验证将 schema 定义的效果与从已认证请求编译出的权限进行比对。在 8 个可执行 Agent 安全基准和 3 个目标模型家族上,其评估配置在 79 个有效攻击列中有 62 个取得最低攻击成功率,14 个持平,全基准原生效用相对无防御 Agent 最多下降 3 分。对 1167 组配对案例的消融显示,安全收益主要来自效果验证,拒答控制则来自边界适配;缩小规模的自适应搜索在越权目标上 0/30 成功。

  3. Coalition for Secure AI(CoSAI) · 收录 · 原文 33

    CoSAI 发布《Agentic Identity and Access Management》框架,将 AI 智能体视为一等身份

    CoSAI 发布《Agentic Identity and Access Management》,主张把企业内 AI 智能体当作与人类用户和服务账户平级的一等身份来管理,而非共用服务账号或复用真人凭证。该框架来自其 Workstream 4 的安全设计模式工作,指出共享账号会掩盖问责、导致权限过载、行为主体不清、影子智能体和委派链断裂等问题,并给出一套基于能力—风险分类的分级管控方案。 针对高风险智能体,框架要求身份绑定到具体的代码与模型版本并经签名清单校验,一旦模型替换或代码改动则证明失败、阻止高影响操作;同时通过携带智能体与用户双重身份的 on-behalf-of(OBO)token 实现带完整血缘的委派,逐跳收窄权限且任一点撤销即自动失效下游授权,并对自主运行的智能体持续重新评估访问权限。

  4. Coalition for Secure AI(CoSAI) · 收录 · 原文 43

    CoSAI 发布 MCP Security v2.0,新增四级安全保证等级

    CoSAI Workstream 4 于 2026 年 8 月 12 日发布 MCP Security v2.0,在 v1 的十二类威胁、三十四项威胁基础上新增安全保证等级,解决 v1 缺少按部署规模分级的问题。v2.0 定义四级累积等级,从 Level 1 沙箱、Level 2 内部、Level 3 生产到 Level 4 受监管,每级在身份与认证、授权与委托、传输与网络安全、隔离与沙箱、日志与可观测性、供应链与生命周期、工具与输入输出完整性、状态与发现安全八个维度给出 MUST/SHOULD 要求,并逐条映射到 MCP-T1 至 MCP-T12 威胁类别和 OWASP MCP Top 10。文中指出 Level 3 硬性要求 token 绑定,缺少 DPoP 或 mTLS 时被攻陷的 agent 上下文可被重放;等级由数据敏感度和影响范围决定,而非部署形态。

  5. Tech Policy Press · 收录 · 原文 24

    Apple 的 Reference Image 能否帮助抵御 AI 图像操纵?

    Apple 随 iPhone 18 Pro 推出的 Reference Image 由相机传感器在拍摄时为像素级签名,提供硬件层面的图像真实性证明,并可在设备上与普通照片切换对比。该模式需主动开启,重启进入严格状态跳过去马赛克、色调映射与压缩,经 Apple Private Cloud Compute 校验配对后再加工并由 Apple 长期密钥签名,开发后的数字负片 30 天后清除。它延续 C2PA 思路但不依赖可能侵犯隐私的信息采集,仍有问题待解。 ### 苹果iPhone 18 Pro引入“参考图”:从源头给影像加签 上周,苹果发布了 iPhone 18 Pro,其中一项名为“Apple Reference Image”(参考图)的新摄影特性正式亮相——这标志着这家硅谷巨头开始涉足内容溯源领域。苹果承诺:“现在你可以证明一张用 iPhone 拍摄的图像的真实性。

  6. Datadog Security Labs · 收录 · 原文 29

    Entra Agent ID 防护指南:保护、检测与响应

    Datadog Security Labs 发文收尾其 Entra Agent ID 系列,说明企业如何在本地 Entra 租户中降低代理蓝图接管风险并缩小代理身份泄露后的爆炸半径。建议收紧 Agent ID Administrator 角色及具备 microsoft.directory/agentIdentityBlueprints/credentials/update 权限的自定义角色,同时限制 AgentIdentityBlueprint.AddRemoveCreds.All 与 ReadWrite.All 两个 Microsoft Graph 权限——持有者可接管任意蓝图及其关联身份。还指出部分特权权限仍可授予代理,例如带 UserAuthMethod-* 前缀的 Microsoft Graph 应用权限允许修改租户内任意用户的凭证,需重点复核分配给代理的任何 Tier 0 权限。

  7. OX Security · 收录 · 原文 14

    OX VibeSec 新增依赖审查能力,拦截 AI 编程智能体的每一次安装尝试

    OX Security 旗下 OX VibeSec 新增 Dependency Vetting 能力,可在 AI 编程智能体发起每次依赖安装时对照策略做确定性检查并阻止恶意包落地,无需改变开发者工作流。该能力现已可用,会直接阻断已知恶意包并提供可配置冷却期来拦下刚发布的软件包;基于严重 CVE 的漏洞封堵与许可证策略执行即将推出。

  8. Cisco · 收录 · 原文 11

    Cisco AI Defense 与 Armada 合作:分布式 AI 在任务所需之处安全运行

    Cisco AI Defense 与 Armada 合作,为分布式 AI 提供 AI 原生安全层:通过 Adaptive Red-Teaming 在生产前对模型做红队验证,并在运行时对提示词、响应、MCP 交互和工具调用施加护栏,覆盖提示注入、越狱、敏感数据泄露、不安全内容、工具滥用等风险。该方案面向 Armada Bridge GPU 上部署的 LLM,支持云、主权云与边缘环境,敏感 AI 载荷与运行时执行保留在客户或租户环境内,策略、可见性与报告可集中管理。

  9. Cisco · 收录 · 原文 18

    你的 AI 智能体信任了你从未批准的东西:Cisco 与 OpenAI 合作扫描 Agent Skill 与 MCP 供应链风险

    Cisco 正与 OpenAI 合作,将 Daybreak 引入其 AI 安全产品组合,用于扫描 AI 供应链中的 Agent Skill 与 MCP server。该方案采用分层架构:Daybreak Blue 负责首轮扫描,对提交的 skill 和 MCP server 做网络安全专用推理,避免通用模型因拒答而漏检合法防御性内容;Daybreak Red 则处理 Blue 标记为不完整的重度混淆载荷与可用漏洞利用链。Cisco AI Defense 的 skill-scanner 覆盖 SKILL.md 及全部捆绑脚本,mcp-scanner 覆盖工具、提示词、资源及底层 PyPI 和 npm 包,重点查找工具声明与实际代码行为的差距。

  10. UK NCSC · 收录 · 原文 29

    UK NCSC 发布《管理智能体 AI 的网络风险》指南

    UK NCSC 发布针对智能体 AI 网络风险的防护指南,建议将 AI 智能体运行于沙箱环境并管控其本地及网络的资源访问。指南提出四层网络访问成熟度模型(从无限制访问到模型本地托管且无外部网络)、四级计算隔离模型以及凭证最小化原则,并要求通过多层隔离加显式提示降低沙箱逃逸风险。 对于高风险场景,最稳健的做法是在隔离断网环境中运行智能体并使用预先下载的工具和信息;若需联网则仅放行白名单连接,必要时改用协议或服务感知代理并经人工审批。该指南还指出部分自主 AI 工具会接入大量系统与服务,访问面越大潜在 blast radius 越高,因此应将其权限收敛到完成任务所需的最小集合并持续监测越权尝试。

10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    KITA:为 LLM Agent 设计密钥隔离的阈值签名授权架构

    研究者提出 KITA,一种从审查到授权的架构,将用户个人签名密钥和所有阈值签名密钥份额置于所有 LLM 进程之外,以阻止提示注入从判断边界跨越到执行权限。在阈值签名不可伪造性和其系统假设下,攻击者即使攻陷提案方和少于 t 个审查签名域,也无法在没有 t 个不同域签名贡献的情况下为新动作生成有效授权,因此任何此类授权都包含来自未被攻陷域的份额,并绑定到规范动作、仅在通过认证的审查者批准后释放。作者用结构化输出 LLM 适配器和阈值 BLS 实现了完整的审查者到执行者路径,通过六项系统测试验证该接口上的法定人数门控与消息绑定,并用密码学微基准测量在线签名路径及其扩展行为。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    论文对企业级 MCP 的授权缺口做了系统分析,并给出不改动协议与 SDK 内部实现的 FastMCP 可组合扩展。作者调研 Python、TypeScript、Go、Rust、C#、Swift 六种 MCP SDK,指出三个结构性缺陷:凭据提取绑定单一 Authorization 头,使同时服务人类用户(企业 SSO)与自动化 Agent(不同请求头上的服务账号凭据)的双角色部署需要自定义中间件;缺少认证前的工具发现;基础 SDK 缺少按工具的细粒度授权。

  3. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文27

    基于硬件 PUF 指纹的知识蒸馏设备级溯源框架

    针对知识蒸馏中教师模型易被窃取且现有水印或硬件访问控制难以定位泄露设备的问题,研究者提出一种将设备专属 PUF 签名叠加到教师 logits 上的指纹框架,使经知识蒸馏训练的学生模型继承与硬件绑定的唯一身份。该方案在 Xilinx Zynq-7020 FPGA 上测量环形振荡器(RO)PUF 生成签名,架构无关,可跨 CNN、Vision Transformer 和编码器继承身份,并通过神经解码器与汉明距离精修的两阶段恢复流程在噪声条件下保持高检测准确率,另引入多级 logit 编码支持大规模设备部署。实验显示嵌入指纹能抵抗常见的蒸馏后修改。

  4. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文39

    面向 AI-SOC 的神经符号防御框架:用 SIEM 解码器与 NeMo Guardrails 阻断日志投毒提示注入

    论文提出一种神经符号纵深防御架构,用于保障 LLM 接入安全运营中心(SOC)后的管道完整性,应对通过日志投毒实施的间接提示注入。作者指出,攻击者可在系统日志中嵌入恶意载荷,形成多步 promptware 攻击链,劫持 LLM 的操作逻辑;而确定性防御语义盲、纯神经评估延迟高且存在概率性缺陷。该框架第一层用定制 SIEM 解码器作为确定性预过滤,在数据摄入边缘做结构化清洗,消除体量填充和基于签名的注入;第二层用 NeMo Guardrails 在 LLM 处理前对结构化 SIEM 告警做自检式语义边界校验;同时集成闭环遥测系统,在 SOC 仪表盘中为人工介入提供被拦截攻击的可见性。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文40

    推理层安全:防御对抗性推理与基础设施滥用

    论文研究 LLM 服务在推理层面临的对抗性交互,包括越狱、拒绝服务与知识蒸馏攻击,并以假设的前沿实验室 Five Elements Inc. 为例展开。由于缺少公开的对抗性 LLM 使用标注数据集,作者提出结构因果模型(SCM)生成带标签的用户会话数据集,包含协同多账号活动、平台反馈和三个层级的标签可观测性。在该数据集上训练的梯度提升检测器对 oracle 标签的二元分类 AUPRC 达 0.993,但面对真实 Trust & Safety 团队持有的运营标签时 AUPRC 仅 0.313,说明检测器比用于评估它的标签更准确。攻击类型归因方面,朴素 argmax 受 98% 良性先验主导,macro-F1 仅 0.295,改用简单阈值决策引擎后提升到 0.489 且不损失准确率。数据集已公开。

  6. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文24

    当智能体信任跨越组织边界:结构外化与信任证据参考模型

    论文提出 Trustworthiness as a Service(TaaS),用于解决智能体跨组织边界调用工具、服务与其他智能体时,依赖方无法仅凭生产域控制与记录评估被委托动作的问题。其分析单元为跨域依赖命题,通过三条件结构外化诊断识别需多域依赖、生产方独立验证且须在撤销、失败、记录冲突或争议后仍可复核的命题,并为此设计不可变工作流清单与仅追加、发行方可归属的信任证据信封。论文还给出拓扑中立的逻辑参考模型,并以三个分析场景和 TaaS-Eval 协议提案定义清单、独立消费者、硬门控、对抗性证据测试与指标。

  7. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    基于区块链的 Agentic AI 框架:面向安全软件供应链的资源优化与能耗感知

    该论文提出一个区块链支撑的 Agentic 安全框架,用于保护完整软件开发生命周期并保障负责监控的 AI 智能体本身。框架协调源码完整性、依赖与 SBOM 分析、CI 配置审计、制品验证和运行时策略评估等专用安全智能体,每个智能体由 LLM 驱动生成结构化安全报告,并通过智能合约将加密签名的证明记录到许可链的智能体注册表、不可篡改证明日志和可执行发布策略模块中。智能体与区块链节点间通信由联盟运营的证书颁发机构保障,用例演示了源码安全智能体如何上链证明并触发可验证的允许/阻止部署决策。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文29

    基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案

    针对自主 AI 智能体面临的提示注入攻击与凭证泄露风险,该提案提出一种基于能力安全原则的框架,利用 OAuth Agent Authorization Profile 及 W3C DID 和 VC 标准,让智能体通过加密绑定其身份与签发者身份、并限定作用域的令牌访问服务。服务方可验证委托链仅涉及权限衰减后再执行令牌操作。该安全层位于语言模型上下文窗口之外的安全模块中,使智能体能在可强制执行的安全边界内行动。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    研究者提出面向结构化 Agent 动作的多源完整性认证方法

    论文提出一种面向 LLM 智能体结构化动作的多源完整性认证器,用于抵御间接提示注入篡改动作关键字段。该方法要求每个字段满足其证据结构支持的规则:在腐败可区分的证据类别上设定有界腐败半径并以最小命中集计数,避免重复发布或洗白副本凑出多数;对互补字段做确定性调和;证据仅剩单一来源时引入可信锚点。作者形式化两种鲁棒性概念,通过消融验证各机制,并在制裁名单(70,966 个实体)与软件供应链溯源(450 个包)上测量多源前提的成立频率,发现真实佐证在上界代理下均为少数现象,朴素证明计数会高估独立性。

  10. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书,阐述其保障 NVIDIA AI Enterprise 软件栈容器安全所采取的措施。白皮书涵盖安全开发生命周期、容器构建生命周期管理、安全设计、安全加固、SBOM、容器签名与模型签名及 NIM 微服务。漏洞响应部分包括漏洞扫描、修补、VEX 与协同漏洞披露,并由 NGC 通知服务做安全事件监控。