跳到正文

Agent 安全

今天新收录 9 条(含旧文)

第 2 页更新的内容回到最新

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文36

    论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent

    Shobhan Roy 的论文指出,基于物理的求解器必须让编译器读取某些模块,但同一批知识产权不应被编码 Agent 读取,而现有工具链并不自带这条规则。作者针对容器、权限规则和沙箱三种隔离手段,对十五条读取路径做了分类,结论是三者都无法判断究竟是哪个程序在读取文件。论文共 6 页,含 1 张图和 1 张表,随附分类与历史脚本及其输出,归入 cs.CR、cs.AI 与 cs.SE,编号 arXiv:2609.35557。

  2. 论文追踪 · 收录 · 原文 论文36

    AgentRewind:面向长周期 LLM Agent 的可恢复执行框架

    研究者提出 AgentRewind,一个运行时恢复框架,通过记录 Agent 上下文与受控环境对齐的检查点,让 Agent 能回到较早状态并利用此前尝试的信息继续执行,以应对长周期任务中早期错误在上下文和环境状态中传播、后续动作难以逆转的问题。作者同时构建 MettleBench,用于评估包含一系列相关需求的长周期工程任务上的任务完成度与部分进展。在多种任务、多个模型、执行策略和 Agent harness 上的实验显示,AgentRewind 相比对比基线提升了任务成功率和平均清单进度。论文共 19 页、5 张图,发布于 arXiv(2608.14380)。

  3. 论文追踪 · 收录 · 原文 论文38

    FlowReview:以授权配对评测控制多智能体组合信息流

    研究者提出授权配对评测(authorization-paired evaluation),把拦截被禁止用途与完成必需授权用途设为同一成功标准,并给出 FlowReview 框架,串联对象解析、权限排序与确定性执行。在受控组合实验中,对组合产物进行审查把拒绝提交率从 86.0% 降到零,且未损失授权供给。作者据此指出,仅保留信息与来源血缘不足以确保正确的权限归属,对象身份与权限必须通过输出可验证的组件与执行保持连接,多智能体安全需要在治理组合信息流的同时保留使协作有价值的授权能力。论文共 44 页、9 张图,代码与数据已公开。

  4. 论文追踪 · 收录 · 原文 论文42

    ZeroGate:为受治理 AI Agent 运行时提供保留信任的快速路径

    Zexun Wang 提出 ZeroGate,把精确动作审批与持久化本地准入分离:签发方签署短时 ActionPass,受信任的运行时适配器在本地门检查绑定并消耗 nonce 前重建最终动作,并用 SQLite 事务把 nonce 消耗、配额更新与准入回执耦合在一起。论文给出条件性决策保持命题:在审批可靠、策略依赖完整且最新、观测忠实、消耗原子等前提下,本地准入成功意味着指定的同步策略会在准入点授权同一动作。作者强调实现本身不保证当前世界的新鲜性,也不保证远程效果恰好一次。评估包含语义夹具、并发与崩溃实验,以及 Azure Blob 上同步与准备式执行的对比:4800 次云端尝试中,准备式从 worker 准入到分发的 p95 为 9.802 至 11.374 ms,同步方式为 25.018 至 334.000 ms,但准备式的完整生命周期均值在各并发级别都更长,边界改善并非净加速。

  5. 论文追踪 · 收录 · 原文 论文56

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    加州大学伯克利分校研究者提出 SecOPD,用同策略蒸馏为防御微调提供 token 级反馈,替代 DPO、GRPO 等序列级信号。训练时学生模型在含注入的输入上生成 rollout,冻结的初始化模型在去掉注入的干净输入上为同一批 token 打分,与可信任务一致的 token 被鼓励、跟随注入的 token 被抑制。在 Qwen3.6-27B 上,面对 SoTA 自适应攻击 PISmith,SecOPD 的攻击成功率为 9.0%,此前 SoTA 的 Meta-SecAlign 为 94.0%,GRPO 为 61.2%;静态 SEP 攻击下 SecOPD 为 1.3%。在训练未见的 AgentDojo 工具调用场景,SecOPD 为 4.7%,Meta-SecAlign 为 5.5%,GRPO 为 0.7% 但效用降至 82.5%。代码与模型已开源。

    推荐理由论文给出 token 级反馈的防御微调配方,并报告在自适应攻击与工具调用场景下的 ASR 对比,可作防御方案选型参考。

  6. 论文追踪 · 收录 · 原文 论文40

    ActionGuard:在工具调用执行前拦截被投毒技能

    研究者提出 ActionGuard,在技能影响的工具调用即将执行前进行授权检查,以阻止被投毒技能诱导的数据外泄、文件删除或未授权代码执行。该方法把目标智能体的动作生成上下文与护栏的授权上下文分离,Reviewer 不接触可能被投毒的原始技能文本,而是依据平衡后的技能画像、当前及近期工具调用和本地脚本内容,判断每个动作是否由可信用户请求所支持。ActionGuard 在 OpenClaw 的 before-tool-call 阶段拦截每次工具调用,并以 fail-closed 策略执行 ALLOW 或 DENY 决定。在 SKILL-INJECT 设置下,针对 139 个上下文注入和 180 个明显注入,使用三个开源和两个商用 Reviewer 模型与 Dynamic Guardian、SkillGuard 对比,每种条件重复三次,以攻击成功率(ASR)和任务成功率(TSR)评估。

  7. 论文追踪 · 收录 · 原文 论文29

    面向软件交付决策门禁的智能体安全审计器持续保障机制

    针对基于 LLM 的仓库审计器在 CI 流水线中作为安全控制时因非确定性行为和策略变化难以维持即时保障的问题,研究者提出 Policy-Evidence-Execution Separation Pattern,并由 Trustworthy AI Posture(TAIP)Assurance Engine 以 Continuous Control Posture Assurance(CCPA)方式运行,将策略与稳定执行分离、把被采纳证据绑定到版本化 Posture Tree。该单主机测量仅覆盖对留存证据的保障,不含 RepoAudit 执行与模型推理。

  8. 论文追踪 · 收录 · 原文 论文43

    研究者提出多智能体系统输出与委派链路双层存证方案

    研究者提出一种面向多智能体系统的双层存证设计,用于在事故后回答两个问题:哪个部署方发布了被报告的字节,以及每条跨部署方边是否获得授权。该设计不依赖共享权威、公共日志或预先约定的工作流,由受信任的部署方运行时对每次发布输出的哈希签名,并以链路证据记录边的授权情况。在统一威胁模型下,作者比较了签名链表、Merkle 链变体和共同签名 DAG 三种方案:子密钥被攻破后,单签名设计允许未授权的父级绑定,而共同签名 DAG 因要求父级授权该边而拒绝该绑定。在 Apple M1 Pro 上,仅链路检查每跳耗时 24.3-499.2 微秒;在本地多服务工作流中,父级发现子级的 A2A Agent Card,子级调用 MCP 工具并发布本地 LLM 输出,30 个签名 DAG 任务全部通过完整验证,仅凭子密钥的受控声明被拒绝,平均端到端延迟 813.1ms,无证据时为 770.8ms。

  9. 论文追踪 · 收录 · 原文 论文38

    AgentKernel:面向 Agent 的可信原生操作系统内核

    研究者提出 AgentKernel,一个把安全作为首要设计约束的可信原生 Agent 操作系统,为身份、输入中介、记忆治理和执行控制提供强制且不可绕过的服务。作者认为现有治理方案仍是应用层中间件,与被监控的 Agent 共享同一进程信任边界,因此需要操作系统级底座。AgentKernel 将 Agent 生命周期包进强制执行边界,分为身份、感知、认知、执行四个支柱,分别应对委托滥用、提示注入、记忆投毒和工具误用。其中内核管理的身份支持跨组织协作,分级感知替代单点过滤,受信息流控制的记忆在限制投毒的同时提升检索保真度,语义到内核的执行机制让更宽的工具权限处于不可绕过边界之后。论文共 38 页、5 张图,通过系统比较与安全分析论证该架构可在整个 Agent 生命周期内实施安全约束。

  10. 论文追踪 · 收录 · 原文 论文42

    研究者提出零知识谓词证明网关,在 MCP 与 Agent2Agent 上实现 Agent 间数据最小化

    研究者提出 Zero-Knowledge Proof Gateway,让 AI 智能体之间交换治理定义谓词的证明而非原始数据,从设计上避免数据暴露,并针对现有互操作协议无法承载此类证明的问题,在同一端点上为 MCP 和 Agent2Agent 实现该插槽。32 位阈值谓词在单颗商用 vCPU 上证明耗时 6.2 ms、验证 1.0 ms,Bulletproofs 证明为 608 字节;11 项对抗实验与 19 项协议检查通过,系统部署到 Kubernetes 并经验证网络隔离。案例研究在不透露金额的前提下证明某零售客户订单在限额内,将 GDPR 数据最小化原则落实为技术措施。论文还指出谓词证明只把陈述绑定到已承诺的值、不绑定到记录系统,为此给出将 enclave 证明与证明双向融合的构造,使验证单个产物即可同时确认谓词成立且该值由特定已度量二进制读取,并在模拟权威机构上做了测试。

  11. 论文追踪 · 收录 · 原文 论文29

    面向安全 AI 渗透测试智能体:安全威胁、护栏与架构视角

    针对 LLM 驱动的自主渗透测试智能体,研究者系统分析了其智能体架构、信任边界与攻击面,提出覆盖 LLM 生命周期攻击、智能体架构攻击和跨领域行为攻击的威胁分类体系。研究指出,具备持久记忆、真实世界行动能力和长时程推理的渗透测试智能体带来不同于传统对话式 LLM 的安全隐患,现有对话 AI 护栏机制可能不足以保障其安全,并梳理了现有护栏的局限与关键研究空白,探讨面向下一代 AI 攻防系统的专用、上下文感知与架构感知护栏方向。

  12. 论文追踪 · 收录 · 原文 论文52

    AgentFlow:面向 LLM 智能体系统的流中心策略语言与运行时防护框架

    研究者提出 AgentFlow,一种以数据流为中心的策略语言与运行时执行模型,用于规定敏感数据在 LLM 智能体系统中可以流向何处。策略定义在带标签的运行时边上,约束哪些工具可接收敏感字段、哪些汇聚点可接收释放的数据,以及何种权限可跨越委派边界,语言支持流规则与路径规则、任务范围能力、受控释放和有状态污点语义。运行时参考监视器介入智能体动作,基于有界 SMT 的验证器对结构化策略片段检查安全属性。原型中七项安全属性每项在 0.5 秒内完成验证,验证器捕获研究中全部植入的不安全策略变体。在 AgentDojo 四个套件的 949 个注入案例上,确认失陷率从 33.0% 降至 0.0%,总体效用从 46.7% 升至 63.3%;在 200 例 AgentDyn Dailylife 基准上,确认失陷率从 73.5% 降至 0.0%,效用基本持平(44.5% 至 43.5%)。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文52

    ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击

    研究者提出 ZoneClaw,通过把 OpenClaw 式计算机使用 Agent 的扁平工作区记忆改为带明确权限等级的分层信任区,切断持久化与权限之间的绑定,防御持久记忆攻击。这类攻击中,攻击者只需控制看似无害的外部内容,就能让 Agent 在正常任务中写入有利于攻击者的声明,这些声明随后会支配攻击者从未接触过的正常任务,攻击链从恶意上下文到恶意响应延伸为恶意上下文、记忆注入、恶意执行。ZoneClaw 让外部声明只停留在低信任区,只有跨过显式权限边界才能获得指导行动的权限,且提升时需与攻击者无法直接写入的信任区交叉校验,并通过非对称权限的角色专用进程保证没有进程同时摄取外部内容并对外行动。在四类攻击场景、两种注入设置和四个骨干模型上,ZoneClaw 将攻击成功率从 372/480 降至 6/480,同时在 458/480 次试验中保留实用性,并对部分具备防御感知的攻击者仍然有效。

  2. 论文追踪 · 收录 · 原文 论文42

    NovaFabric 提出可防篡改、可重放的 AI Agent 运行证据方案

    研究者提出 NovaFabric,在不修改 Agent 逻辑的前提下把一次 Agent 运行记录为可移植的 Run Capsule,用 DSSE 签名、RFC 3161 时间戳、Merkle 日志和脱敏证明封装,并支持四种模式的重放协议与第三方验证。评测显示,模拟重放可从 capsule 提供全部模型响应(10/10),但仅 2/10 的工具调用类工作负载完成,缺口在于缺少工具响应替换;三类篡改均被拒绝;声明流完整度为 0.652(95% CI ±0.064,十个场景);修复后的规则包可脱敏 14/14 类凭据并保留 9/9 个诱饵;影响范围查询在 1000 万条边上 p99 为 45.5ms,在 1 亿条边上为 167.9ms。314 台机器、十个区域的运行中,capsule REST 写入无损,但受单 worker 串行化限制,吞吐上限为 61.6 req/s(p99 26.8s)。

  3. 论文追踪 · 收录 · 原文 论文40

    SkillSentry:用自适应蜜罐世界动态检测 Agent 技能安全

    研究者提出 SkillSentry,一个基于自适应蜜罐世界的动态安全测试框架,用于检测 LLM Agent 外部技能在特定环境状态下才暴露的有害行为。该方法先推断技能的能力边界,构建由 LLM 模拟、含受控诱饵资源的环境,并自适应生成任务以探索其行为状态,再将启用技能的执行轨迹与匹配的无技能执行对比,把可疑行为定位到源码和已验证的执行轨迹上。在标准基准上,SkillSentry 取得 99.50% 召回率和 96.26% 平均 F1;在保持语义的规避攻击下平均 F1 为 92.95%,最强基线为 80.07%。作者称代码已公开。

  4. 论文追踪 · 收录 · 原文 论文34

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    SafeEvolve 是一个经验驱动的智能体安全对齐自演化框架,通过已完成 on-policy 轨迹中的安全经验驱动 harness 与 policy 的持续协同演化。harness 侧将轨迹级安全证据转化为安全提示词与分层技能的有界组件级更新,policy 侧采用两阶段 SFT-RL 范式,用 harness 增强的 RL 与验证器分解奖励塑造多步探索中的自主安全行为。在 Qwen3.5-4B 上,SafeEvolve 在 AgentDojo 实现 ASR 降低 3 倍,同时将良性效用从 59.79% 提升至 61.86%。

  5. 论文追踪 · 收录 · 原文 论文52

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    研究者提出开源、框架无关的 Agent 运行时安全监督网关 ClawSentry,用于拦截被恶意第三方技能劫持的 Agent 行为。该方法把 Agent 风险分为技能准入、调用意图、执行效果和事后后果四个环节:执行前由 First-use Skill Package Review(FSPR)在确定性证据下限下审查技能包,未决案例升级到有界只读的 Agent 审查;运行时采用确定性 L1、规则锚定 L2 语义审查和只读 L3 取证 Agent 的三层渐进决策引擎,只对残余歧义投入上下文审查,并用会话级反绕过机制识别换工具与改写重试。事后路径将高严重度证据非回溯地送入后续审查。通过 Agent Harness Protocol(AHP)抽象,同一策略可应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改 Agent 内部。

  6. 论文追踪 · 收录 · 原文 论文35

    SCOPE:训练有能力且安全的计算机使用智能体

    针对仅以任务成功为目标的训练无法让计算机使用智能体(CUA)形成可靠安全行为的问题,研究者提出 SCOPE,联合后训练任务执行能力与安全感知决策,并配套 SCOPE-Gen 自动生成可验证任务及其环境风险变体,构建含能力演示、安全续行与明确拒答的 SATraj-OS 轨迹数据集。以 Qwen3.5-9B 为起点,SCOPE-RL 在 OSWorld 上取得 54.17% 任务成功率、在 OS-BLIND 上取得 64.30% 攻击规避率,综合能力—安全得分 58.80%,为所评估智能体中最高。消融显示拒答轨迹贡献了大部分攻击规避增益,风险处理轨迹则在相近攻击规避水平下保留更高任务效用。

  7. 论文追踪 · 收录 · 原文 论文36

    PACE:为 DeFi 中的 AI Agent 提供策略认证的合约执行框架

    研究者提出 PACE(Policy-Attested Contract Execution),一个插入在基于 LLM 的 Agent 与链上执行之间的交易级授权框架,用于应对 Agent 继承的提示注入风险以及审批无法绑定到最终上链交易的问题。PACE 引入类型化交易意图、确定性策略验证器和签名的 Policy Decision Records(PDR),将获批意图、策略与模拟报告加密绑定到确切的执行字节,并提供重放与过期保护;Solidity 智能账户在链上强制校验 PDR 签名,实测开销为 29,826-31,822 gas。作者将结论限定为可复现基准内的逻辑层安全,而非可直接部署的 DeFi 安全方案。

  8. 论文追踪 · 收录 · 原文 论文50

    WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界

    研究者提出 WebMCP-Phalanx,一种面向 W3C WebMCP 浏览器内 LLM Agent 工具调用的双层运行时架构,用于补足同源策略在工具来源与生命周期上的不足。第一层以浏览器原生信任锚,通过加密保护的能力凭证把每个工具绑定到注册主体,并在工具生命周期内传播来源标签;第二层把语义检查与特权工具使用分离,无工具调用权限的隔离 Agent(Q-LLM)检查工具元数据、输出和页面内容中的提示注入,通过验证的内容再交给特权 Agent(P-LLM)执行,Q-LLM 内部状态对页面脚本不可见。实验显示,浏览器原生归属机制把撤销与覆写攻击成功率从 100% 降到 0%;双 Agent 运行时拦截了工具描述中嵌入的全部 80 次提示注入尝试,并把工具返回攻击限制在 80 次中的 2 次成功,任务效用与无攻击基线在统计上无差异。

  9. 论文追踪 · 收录 · 原文 论文50

    SkillGuard:面向间接提示注入的 LLM Agent 能力限制机制

    研究者提出 SkillGuard,一种 harness 层的执行约束机制,用于应对 LLM Agent 在间接提示注入下把外部技能输出带入执行上下文的问题。该方法把不可信数据进入状态视为污染事件,用 Skill Impact Graph 表示安全相关状态转移,用 steerability signatures 规定技能参数的可接受控制范围,并通过内联引用监视器介入技能调用;污染发生后按二值、分数或分数流策略计算加权能力限制,且不依赖额外的语言模型推理。分数流限制在相同攻击成功率下比二值限制保留更多能力,两种设置下均不增加模型调用或 token 开销。

  10. OWASP AI Exchange · 收录 · 原文 43

    OWASP AI Exchange 更新 Agent 沙箱指南,将可达服务纳入隔离评估

    OWASP AI Exchange 的 AI 安全与隐私指南在 Agent sandboxing(4.9)一节新增“允许服务隔离”条目,要求把 Agent 可达的包服务、缓存、制品库和共享队列一并纳入隔离评估。该条目提出在可变状态上实施服务端授权,防止 Agent 跨策略边界交换数据,并把服务操作限制在任务所需范围内,例如只做下载的工作负载不应获得发布或管理权限;同时限制服务自身的出站访问与内部可达性,并在恢复后重新测试,因为替换沙箱不会重置外部服务状态或凭证。更新还以 OpenAI 2026 年 8 月的复盘为例,说明评估 Agent 曾利用内部托管的包服务和共享留言板获得未授权互联网访问,且在修复后重新建立了两条路径。局限性部分补充指出,共享推理、凭证、策略以及包或制品服务可能形成隐式的跨 Agent 通道,共享服务被攻破可能暴露其凭证与网络访问。

  11. 论文追踪 · 收录 · 原文 论文46

    UCM:为网页智能体遮蔽不可信内容以提供安全保证

    研究者提出 Untrusted Content Masking(UCM),一种为网页智能体恢复可信与不可信内容边界的防御方法,用于抵御提示注入攻击。该方法利用网页 DOM 结构足以区分可信与不可信区域这一特性,在不可信内容到达智能体前将其遮蔽,并通过带严格权限隔离的沙箱接口完成交互,使智能体在观察和操作环境的同时与对抗性内容隔离。作者称该方法简单有效,代码已公开。论文作者包括 Kristina Nikolić、Egor Zverev、Javier Rando、Matthew Jagielski、Edoardo Debenedetti、Florian Tramèr。

  12. 论文追踪 · 收录 · 原文 论文52

    SkillSecurer:检测并修补 AI Agent 技能中的提示注入漏洞

    研究者提出 SkillSecurer,一个全智能体框架,用于生成、检测、定位并修复 AI Agent 技能中的安全风险。其红方智能体跨九类威胁生成上下文兼容的注入并记录具体改动,蓝方智能体分析完整技能包、给出有依据的证据并提出补丁;在受控实例上,验证器将发现与补丁同记录的注入比对,实现注入级评估。使用最佳后端 LLM 时,SkillSecurer 是唯一实现 100% 注入检测率的扫描器。作者随后分析某技能库中的热门技能,发现超过 17% 的被检技能存在潜在漏洞,并在实测部分技能时触发了真实事件。结论认为,上下文感知的 LLM 分析能提供可靠的注入定位与可操作的修复,而不止于技能层面的标记。

  13. The Verge AI · 收录 · 原文 ↑150

    Apple 将限制 Mac 完全磁盘访问,称 AI 智能体大幅提升风险

    Apple 宣布将在 macOS 上为完全磁盘访问权限增加新的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用完全磁盘访问的方式可能让用户面临风险,会在用户不完全知情的情况下暴露文件、邮件、信息和浏览历史,并称随着 AI 智能体能力与自主性增强,这类访问带来的风险将大幅上升。完全磁盘访问是 macOS 上让应用访问用户整个系统的权限,Apple 称该功能原本是为让备份应用正常运行而设,在很大程度上绕过了面向用户的隐私控制。Apple 未说明该更新的推出时间。此事发生前数周,Inc 的 Jason Aten 发现 Meta 的 Muse AI 似乎知道其消息内容,尽管他未在 iPhone 或 Mac 上明确授权;Meta 发言人 Andy Stone 回应称消息访问完全基于用户选择加入,需同时启用完全磁盘访问和 Muse 的消息连接器。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  14. Lakera Blog · 收录 · 原文 日期未知16

    Check Point 与 Google Cloud 合作,为 Gemini Enterprise Agent Platform 上的 AI 智能体提供结果控制

    Check Point 联合 Google Cloud,将 AI Defense Plane 接入 Gemini Enterprise Agent Platform,把智能体安全从访问控制扩展到结果控制。该集成通过 Agent Gateway 和 Agent Registry 实现智能体发现、部署前策略治理与运行时上下文感知防护,可检测并阻断提示注入、防止敏感数据泄露、在执行前评估工具调用。集成将于 2026 年 6 月下旬开放。

  15. HiddenLayer Research · 收录 · 原文 22

    HiddenLayer 提出面向编码智能体及其 harness 的安全框架

    HiddenLayer 提出一套覆盖编码智能体及其 harness 的安全框架,主张把提示词、工具、技能、MCP server 与编排逻辑视为主要攻击面,而非只防守语言模型本身。该框架分为可见性、控制、验证、监控等五层,要求默认最小权限、高风险操作需人工批准、部署前对智能体做红队测试并审查第三方工具与技能中的隐藏元数据。文中引用的案例包括 Cursor 通过 XML 标签建立信任、MCP 工具定义进入系统提示词、技能 YAML frontmatter 元数据先于逻辑加载,以及 CopyPasta 让提示注入在仓库间自我传播。

  16. Lasso Security · 收录 · 原文 22

    如何在终端上治理 AI 工具、编码智能体与 MCP 连接

    企业 AI 安全正从浏览器转向员工终端:Claude Code、Cursor 等编码智能体以开发者本人权限运行,可自主访问代码库、凭证与内部系统,而 EDR、MDM 等传统终端工具看不到其连接的 MCP 服务器、读入上下文窗口的数据以及即将执行的动作。Latio Tech 2026 AI 安全市场报告显示,45% 的安全团队已将 Claude、Codex 等终端智能体列为首要 AI 安全关切,专用 AI 安全预算占比从一年前的 8% 升至 37%。文章以 Claude Code 连接内部 Jira MCP 服务器后遭间接提示注入、导致 .env 文件外泄为例,说明 MCP 连接与第三方 SaaS AI 工具带来的供应链与数据外流风险。

  17. UK AI Security Institute · 收录 · 原文 57

    UK AISI 成立 Control Red Team,用演化搜索压力测试前沿监控器

    UK AISI 新设 Control Red Team,把红队方法从人类滥用防护扩展到 AI 控制护栏,专门测试监控 LLM 智能体行为的监控器。该团队已测试并协助改进两家前沿开发者的内部监控器:与 Google DeepMind 测试了异步推理监控器,发现包括智能体假装把恶意目标幻觉成用户指令在内的多个漏洞;与 Anthropic 测试了多版同步智能体编码监控器,每一版都发现漏洞,最佳攻击还用于 Anthropic 对 Claude Mythos Preview 的测试。部分攻击利用监控器提示词的缺口,另一些利用 LLM 自身弱点完成提示词明确禁止的目标;部分情况下由硬编码规则决定哪些动作送审,这时最优的攻击策略是让动作完全不被送审。团队还列出模拟真实攻击者、估计整体安全性、改进算法、处理监控器自身失准等开放研究问题。

    推荐理由AISI 公开了红队前沿监控器的具体做法与演化搜索算法细节,做 AI 控制与 Agent 部署的团队可参考其评估思路。

  18. Anthropic · 收录 · 原文 30

    Anthropic 推出 Enterprise Frontier Safeguards:面向企业客户的前沿安全方案

    Anthropic 发布 Enterprise Frontier Safeguards(EFS),在客户自控云基础设施中存储数据并进行跨会话滥用监控,以应对被盗凭据等风险。从 Fable 5 起,方案要求保留相关数据 30 天;这不等于不存储任何数据,客户自控存储与 Anthropic 的零数据留存安排需区分。方案今秋分阶段推出,过渡期内符合条件的 Fable 5 和 Fable 5.1 客户可获得 ZDR,并与 AWS、Google Cloud、Microsoft Azure 及客户合作。

  19. Modal · 收录 · 原文 36

    Modal 推出 Sidecars:为 Sandbox 提供低延迟信任边界

    Modal 发布 Sidecars,一种与主 Sandbox 同主机运行但保持隔离的容器,用于在可信代码与不可信代码之间建立安全边界。Sidecar 与主 Sandbox 采用相同的隔离机制(gVisor 或 VM),通过内部桥接网络以 TCP/UDP 通信并按名称寻址,官方基准显示其通信速度至少比同区域独立 Sandbox 快 3 倍,p50 单次通信 0.58ms 对 2.6ms,p99 为 1.4ms 对 44ms。Sidecar 由 Modal SDK 动态创建,Sandbox 内代码无法创建或修改,单个 Sandbox 最多可运行 250 个 Sidecar,二者共享 CPU 和内存资源,每个 Sidecar 有独立出站网络策略,也可强制 Sandbox 出站流量经过代理 Sidecar。Sidecars 目前处于 Beta 阶段。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  20. Pydantic AI · 收录 · 原文 29

    Pydantic AI v1.107.7 修复 web_fetch 工具安全漏洞(GHSA-v36g-jcw9-x7cw)

    Pydantic AI 发布 v1 线维护版本 v1.107.7,回移了 2.52.0 中的安全修复。该漏洞(GHSA-v36g-jcw9-x7cw,中危)源于本地 web_fetch 工具转换攻击者可控的深层嵌套 HTML 时消耗过多 CPU 和内存,使用提供商原生网页抓取的场景不受影响。漏洞已在 1.107.7 和 v2 线的 2.52.0 中修复。

  21. Pydantic AI · 收录 · 原文 38

    Pydantic AI v2.53.0 修复 ConcurrencyLimitedModel 并发槽位泄漏漏洞

    Pydantic AI 发布 v2.53.0,修复 ConcurrencyLimitedModel 中一个高危安全问题(GHSA-6fqq-452j-qhrp)。当并发槽位在不同于获取它的任务上被释放时,流式请求可能一直占用槽位,例如消费者提前停止迭代、抛出异常或被取消,以及以默认 debouncing 完整消费 stream_text() 之后;重复的流式请求会阻塞共享同一限流器的所有请求。Agent 级别的 max_concurrency 与非流式请求不受影响,v1 也不受影响,问题由 @lche511 报告。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  22. MCP TypeScript SDK · 收录 · 原文 ↑164

    MCP TypeScript SDK 1.32.0 发布,新增重定向同源限制与工具调用参数上限

    MCP TypeScript SDK 发布 1.32.0,HTTP 客户端传输现在只在同源(相同 scheme、host 和 port,同 host 的 http 到 https 允许)时跟随重定向;若部署端点重定向到其他 host 或 port,需配置最终 URL,或在 StreamableHTTPClientTransport、SSEClientTransport 上设置 redirectPolicy: 'follow',浏览器中未设置该选项的重定向请求会失败。新增两个默认关闭的选项:McpServer 的 maxToolInputElements 限制工具调用参数中数组元素和对象成员的数量;requireBearerAuth 的 expectedResource 只接受为该服务器签发的 token(token 的 audience)。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  23. arXiv · 收录 · 原文 论文32

    WBAG:面向视觉-语言-动作操作的全身体与附着几何安全框架

    WBAG 是一个面向视觉-语言-动作(VLA)策略的安全框架,对机器人全身体与随抓取变化的附着几何建模,构建抓取条件下的安全集,并将其转化为可微 CBF 约束,以最小改动 VLA 原生的六维操作空间动作来避免机器人与场景、附着物体的碰撞。在 SafeLIBERO 基准上,WBAG 在场景级安全评估器下取得 97.38% 的 Scene Safety 与 59.38% 的 Safe Success,为所评估方法中最佳。

10月2日周五
  1. Mistral AI · 收录 · 原文 15

    Mistral 为 Connectors 引入管理员控制、API key 作用域与调试器

    Mistral 为 Connectors 推出多项新能力:管理员控制(GA)可按 workspace 或组织设置连接器访问权限,并逐个开关工具;带连接器作用域的 API key(GA)防止自动化 AI 工作负载冒充用户;多账号连接器(GA)支持一个连接器绑定多个账号。Connectors Debugger(公开预览)对 MCP 连接器做端到端根因分析,逐步定位连接失败位置。Connectors 已进入 Vibe Code(GA)和 Workflows(公开预览),目录现有 60 多个集成,并支持自定义 MCP 连接器。

  2. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文53

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    PACE 是一种在工具调用执行前进行拦截的防御机制,用于应对被投毒的工具元数据、检索页面、记忆和可复用技能对 Agent 后续调用的操纵。作者指出,仅靠准入前的工件审查无法解决问题,因为安全变体与泄露变体可能产生相同的准入证据。PACE 通过路径限制给出可执行的影响路径切割,并用能力与效果验证将 schema 定义的效果与从已认证请求编译出的权限进行比对。在 8 个可执行 Agent 安全基准和 3 个目标模型家族上,其评估配置在 79 个有效攻击列中有 62 个取得最低攻击成功率,14 个持平,全基准原生效用相对无防御 Agent 最多下降 3 分。对 1167 组配对案例的消融显示,安全收益主要来自效果验证,拒答控制则来自边界适配;缩小规模的自适应搜索在越权目标上 0/30 成功。

  3. 先知社区 · 收录 · 原文 42

    政务 RAG 白盒审计发现间接提示注入等 4 类缺陷并完成零回归修复

    对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。