全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态promptarmor.com
PromptArmor 解析 WebMCP:采用现状与五类安全风险
PromptArmor 发布 WebMCP 说明,指出截至 2026 年 10 月 6 日,webmcp.com 登记了 2,959 个提供 WebMCP 工具的站点,Chrome、Edge、Brave 已通过 Origin trials 支持,ChatGPT 内置浏览器以 Site tools 形式支持,Cloudflare 的 Browser Run 与 Shopify 也已接入。WebMCP 工具像传统 MCP 工具一样定义名称、描述、输入与读写能力提示,但由网站页面直接提供给正在访问的智能体,智能体调用工具而非模拟点击界面。
- 动态AWS Security
AWS 发布身份感知 AI 数据智能体方案,用 Lake Formation 与可信身份传播实现按用户授权
AWS 安全博客介绍了一种身份感知 AI 数据智能体方案,让数据智能体在查询 Lake Formation 治理的湖仓数据时按真实用户身份授权,无需改写现有治理策略。id_token 不进入工具 schema,基础模型无法接触;TIP 角色本身不带 Lake Formation 数据授权,授权判断只针对传播的用户身份。测试中两名用户提出同一问题,有授权的用户返回五条记录,无授权用户被拒绝,CloudTrail 的 AssumeRole 事件通过 onBehalfOf 记录真实用户。
- 动态OWASP GenAI Security Project
OWASP 发布 LLM 应用十大安全风险 2026 版
OWASP GenAI Security Project 发布《OWASP Top 10 for LLM Applications 2026》,这是面向大语言模型应用最关键安全风险的社区驱动指南。该版本由数百名 AI 安全专家参与编写,更新了风险排名、扩展了威胁覆盖范围,并基于数千起真实 AI 安全事件给出新研究。指南面向开发者、架构师、安全团队和 CISO,提供风险说明、攻击场景与可落地的缓解措施,并将风险映射到 NIST、MITRE ATLAS、CWE 以及 OWASP Top 10 for Agentic Applications 等框架。
- 动态promptfoo
promptfoo 0.124.0 发布:新增 Claude Opus 5.5、Sonnet 5.5、GPT-6 Sol/Luna 与 Grok 4.7 支持
promptfoo 发布 0.124.0,新增 Claude Opus 5.5、Claude Sonnet 5.5、GPT-6 Sol 和 Luna、GPT-6.1 Sol 及 Grok 4.7 等模型支持,并加入 OpenAI 安全标识符。该版本含破坏性变更:移除托管 ChatKit provider,WatsonX、Langfuse、Slack、Codex Security、本地 Transformers 等 SDK 改为按需安装。同时修复断言评分、CLI 退出码与 Cloud 登录等问题,并将 MCP SDK 升级至 1.32.0 以修复重定向安全问题。
- 动态Coalition for Secure AI(CoSAI)
CoSAI 发布 AIMM:AI/ML 供应链信任与溯源的三级成熟度模型
CoSAI Workstream 1 发布 Artifact Integrity Maturity Model(AIMM),一个面向 AI/ML 供应链信任与溯源的风险分级框架,用于回答某个用例需要多少签名、溯源与证明基础设施。AIMM 设三级:Level 1 基本制品完整性,生产方在发布边界对制品做哈希与签名,消费方在进入流水线前重算哈希并验签;Level 2 溯源与谱系,增加签名溯源声明和制品与变换之间的可验证谱系,便于在上游漏洞披露后定位受影响的下游制品;Level 3 面向策略自动化的结构化证明,由策略引擎评估并用于准入决策,适用于受监管行业和高风险场景。AIMM 明确签名与证明只能确立完整性、真实性、溯源和策略证据,不保证制品正确、安全或公平,且完全自动化的策略执行在许多环境中仍属目标,多数组织会先采用机器可评估证据加人工复核的混合方式。
- 论文论文追踪
SideKernel:面向 macOS 上 AI 编码 Agent 的 microVM 沙箱
佐治亚理工的一项硕士安全实践项目提出 SideKernel,一个面向 AI 编码 Agent 的开源本地 microVM macOS 沙箱,目标是提升可用性。作者先做在线用户调研,发现不到 40% 的 AI 编码 Agent 用户会在沙箱中运行 Agent,并归纳出阻碍沙箱采用的主要可用性障碍。随后作者按五项纳入标准筛选市面上的沙箱,围绕调研得出的 23 项能力测试,将 SideKernel 与符合条件的沙箱做对比分析,结果显示只有少数沙箱与 SideKernel 类似,其中 Docker Sandboxes 与 SideKernel 在可用性相关能力上得分最高。论文的另一项贡献是梳理本地、开源、基于 microVM 的 macOS AI 编码 Agent 沙箱现有方案。
- 动态PPC Land
MLCommons 发布 Agent Privacy Risk Taxonomy 初稿,列出 25 项智能体隐私风险
MLCommons 于 10 月 1 日发布 Agent Privacy Risk Taxonomy 的 v0.1 初稿,将自主智能体处理个人信息的方式归为五大领域下的 25 个编号风险向量,并配套一套从触发条件追溯到下游伤害的六阶段评估方法。文档共 15 页,由隐私与保密工作组撰写,列出 19 位作者,封面日期为 2026 年 9 月。五大领域中,数据摄取占 7 个向量,聚合、使用与共享占 9 个,跨智能体实践 3 个,传统同意机制失效 4 个,问责与治理 2 个。文档指出既有隐私框架假设数据流确定、存储集中、边界清晰,而智能体会执行代码、跨会话保留记忆并调用外部工具,因此这些框架需要扩展而非替换。附录按 GDPR、HIPAA、CCPA 和 CPRA 定义了四类敏感数据,并区分可精确匹配的句法型与基于语义的模糊型。
- 动态OWASP AI Exchange
OWASP AI Exchange 为 RAG 检索范围强制加入无模型回归测试
OWASP AI Exchange 在 RAG 安全测试指南中新增了检索范围强制(retrieval-scope enforcement)的无模型回归测试方法,该测试不依赖模型参与,输入与判定都是确定性的。方法要求把身份建模为 subject、tenant 与 roles,并在文档和 chunk 两个粒度上定义授权范围,访问文档中一个 chunk 不代表可访问其余部分;租户隔离需独立于文档标识符校验,避免返回了正确文档却属于错误租户。测试通过薄适配器驱动检索器并断言检索到的 chunk 而非生成答案,从而可复用于任意向量库或搜索索引;测试以多步序列表达,以验证角色降级、ACL 修改、权限撤销等状态变化在检索时生效。指南还建议用故意存在漏洞的 fixture 后端验证测试套件确实能检出所声称的违规,并链接了外部参考实现 retrieval-scope-tester。
- 动态MCP Python SDK
MCP Python SDK v2.3.0 发布:修复为主,新增三项配置选项
MCP Python SDK 发布 v2.3.0,以修复为主并新增三项选项。带无效 x-mcp-header 注解的工具现在会在注册时抛出 InvalidSignature,此前服务器会正常启动但 2026-07-28 客户端会静默丢弃该工具;空 _meta 与 params 不再随请求发送,避免部分服务器拒绝。新增 max_sse_event_size 选项(默认仍为每 SSE 事件 1 MiB),MCPServer(subscriptions=False) 可停止提供 subscriptions/listen,Client.call_tool 在 HeaderMismatch(-32020)后重新列出工具并重试一次。
- 动态Snyk Labs(AI Threat Labs,含原 Invariant Labs)
Snyk Labs 解读 MAESTRO:面向 Agentic AI 生态的分层威胁建模框架
Snyk Labs 介绍了由云安全联盟(Cloud Security Alliance)联合 AI 安全研究者开发的 MAESTRO 框架,用于对多智能体 AI 生态做分层威胁建模。该框架把系统拆成基础模型、数据操作、Agent 框架、部署基础设施、评估与可观测性、安全与合规、Agent 生态共七层,逐层列出关键组件与特有漏洞,例如向量数据库投毒、工作流劫持、容器逃逸、日志注入和 Agent 身份冒充。文章强调跨层依赖会形成纵向传播与横向扩散的攻击路径,并以多 Agent 金融交易系统为例,演示从对抗样本到 Agent 冒充的逐层执行劫持攻击及对应缓解措施。文中还给出与 NIST AI RMF 四个功能、OWASP AIVSS/ASI 威胁分类的对接方式,以及分四阶段、约 12 个月的组织落地路线图。
- 动态Snyk Labs(AI Threat Labs,含原 Invariant Labs)
Snyk 推出 Agent Scan - Skill Inspector,免费扫描 Agent 技能中的恶意行为
Snyk Labs 发布 Agent Scan - Skill Inspector,一个免费的自助网站,可在安装或本地运行前扫描 Agent 技能的风险、暴露面与恶意行为。团队对主流市场的 3,984 个技能做了分析,确认 76 个恶意技能,13.4% 的技能至少含一个严重级别问题,36.8% 至少含一个安全问题,发现的问题包括凭据窃取、后门、可疑下载、远程代码执行模式和基于提示词的数据外泄,部分已确认的恶意技能在发布时仍可公开访问。Agent Scan 将技能视为代码与自然语言指令(如 SKILL.md)的组合,支持粘贴市场 URL、GitHub 仓库或拖入本地技能文件夹,检测提示注入、恶意代码、硬编码密钥、不当凭据处理、第三方内容暴露、不可验证依赖等,结果按 Critical、High、Medium 分级。
- 动态Mindgard Blog
Mindgard 发布 AI Agent 安全指南:五类信任边界、六种攻击与红队加固方法
Mindgard 发布 AI Agent 安全指南,主张 Agent 有目标、工具、记忆、身份、其他 Agent 五个信任边界,无法靠清洗提示词来防护,控制点应放在边界而非模型内部。指南列出当前成功率最高的六类攻击:间接提示注入与目标劫持、MCP 工具投毒与 rug pull、编码 Agent 的信任持久化、记忆与上下文投毒、身份与权限滥用、Agent 间通信不安全。文中引用 NIST CAISI 在 AgentDojo 上的红队结果,未知攻击接管 Agent 的成功率为 81%,已知攻击仅 11%;工具投毒在 45 个以上在线 MCP 服务器上平均成功率超过 60%,最高 72.8%。
- 动态Pillar Security
2026 年企业级 AI 智能体与 GenAI 应用最佳 AI 红队供应商对比
2026 年企业级 AI 红队供应商的评判标准,是测试已部署系统而非仅测试底层模型、每次发布都重跑测试、并给出执行证据而非分数。该指南依据 OWASP 于 2026 年 1 月发布的 AI 红队供应商评估标准,将 13 个评估维度归纳为 7 个问题,对比了 11 家供应商与工具,并把 Pillar 的 Red Graph Suite 纳入同一标准并说明其局限。文中指出,平均一次成功攻击需 5 轮对话,生产环境中 90% 的成功攻击导致数据泄露。
- 动态Pillar Security
企业级 AI 编程智能体安全工具对比:如何防护 Claude Code、Cursor、Codex 与本地 AI 智能体
一份面向企业的 AI 编程智能体安全工具评测,用同一套八个问题对比了十三款工具,并按使用发现、智能体清点、配置态势、行动前控制四个层面归类。文章指出发现智能体不等于保护智能体,配置事实藏在智能体自身设置文件中,EDR 无法建模;控制点已转移到 Claude Code、Codex CLI、Cursor、Gemini CLI 等暴露的 pre-tool hook,2026 年微软、CrowdStrike、Palo Alto Networks 等均已采用。Adversa AI 的 GuardFall 研究(2026 年 6 月)用老旧 shell 技巧绕过了 11 款主流开源编程智能体中 10 款的命令审批护栏,Google 2026 年 4 月的 Gemini CLI 公告(GHSA-wpqr-6v78-jr5g)修复了以 --yolo 模式和自动信任工作区目录为前提的远程代码执行路径。
- 动态腾讯朱雀实验室
腾讯朱雀实验室开源 A.I.G Agent 安全演习 Skill
腾讯朱雀实验室发布 A.I.G Agent 安全演习 Skill,可安装到 Claude Code、Codex、Cursor 等主流 Agent 客户端,用一句话触发对宿主 Agent 的自动化安全演习。该 Skill 会先识别当前 Agent 连接的工具、权限、MCP 连接与 Skill 配置,再针对越狱、间接注入、工具滥用、MCP 风险、Skill 供应链和基础设施漏洞逐项演练,演习过程与报告均在本机完成。它面向个人开发者的 IDE Agent 和业务方生产级 Agent 两类场景,前者侧重 Skill 代码审计、MCP 权限审计与供应链检查,后者覆盖基础设施扫描、代码安全、动态安全测试、大模型越狱和工作流攻击五个维度,其中动态测试含 7 个子项共 37~49 条 payload,并采用 7 层编码递进引擎。
- 动态promptfoo
promptfoo 0.121.18 发布:新增 Claude Sonnet 5、GPT-5.6 预览与 Moonshot(Kimi)支持
promptfoo 发布 0.121.18,新增 Claude Sonnet 5 支持,覆盖 Anthropic、Bedrock、Vertex 和 Azure 四个平台,并加入 GPT-5.6 预览支持与 Moonshot(Kimi)provider。该版本还扩展了 Bedrock 对 Grok 4.3、GLM、MiniMax、Nemotron、Gemma、Palmyra 的支持,并扩充 Google 模型支持(Nano Banana 2 Lite、GA image aliases、gemini-pro-latest)。修复方面涉及 is-refusal、is-sql、is-xml 等断言逻辑,以及 redteam 中已弃用或无效的提示注入 id 展示问题。
- 动态promptfoo
promptfoo 0.122.1 发布:新增 Gemini 3.7 Flash 支持与红队 token 计量
promptfoo 发布 0.122.1,新增 Gemini 3.7 Flash 与 Flash-Lite 两个 provider,并完善红队测试的 token 计量,覆盖多轮攻击者与评分 token、远程策略生成用量及未计量生成请求。该版本还扩展 tracing 能力,支持从 Grafana Tempo、Braintrust、Langfuse 拉取外部 trace,并对齐 OpenTelemetry GenAI 约定,同时接入 OpenAI Agents、Vercel SDK、Claude 与 Codex 子进程遥测。安全修复方面,为所有 callback loader 加上路径穿越防护,并在输出中脱敏 AWS SigV4 凭证。
- 动态MCP Inspector
MCP Inspector 2.3.0 发布:修复容器沙箱端口绑定与 OAuth 授权参数等多项安全问题
MCP Inspector 发布 2.3.0,修复容器场景下按地址绑定 loopback 并固定沙箱端口,同时将 nanoid 升级至 3.3.18 以清除一个高危安全公告。该版本新增按服务器自定义 OAuth 授权请求参数、在 Connection Info 中展示并解码 OAuth id_token,以及 Server Settings 中的 Auth URL 与 Token URL 覆盖。此外还修复了分页模式下列表拉取失败未提示、SSE 帧 CRLF 分隔解析、重复工具名无法单独检查等问题。
- 动态MCP Inspector
MCP Inspector v2.8.0 发布:修复 /api 认证绕过并新增密钥文件配置
MCP Inspector 发布 v2.8.0,修复了此前只要设置 DANGEROUSLY_OMIT_AUTH 为 true/1 之外的取值也可能影响 /api 认证的问题,现在仅 true/1 才会禁用该认证。该版本还新增 MCP_INSPECTOR_SECRET_KEY_FILE 配置项并为各运行时补充密钥存储文档,同时加入安全公告技能、为现代通知 POST 补上 Mcp-Method 标记,并调整 OIDC 兼容路径的请求体释放逻辑。
- 动态Guardrails AI
Guardrails AI v0.10.2 发布
Guardrails AI 发布 v0.10.2,新增 SECURITY_ADVISORY.md 安全公告文件并多次更新,同时修复 GitHub Workflows Action 中的模板注入问题。该版本将 litellm 版本约束放宽至 >=1.83.0,并加入面向可信发布的 release workflow。
- 动态Guardrails AI
Guardrails AI v0.11.0 发布
Guardrails AI 发布 v0.11.0,更新 SECURITY_ADVISORY.md 并修复多项安全问题,包括将 aiohttp 从 3.13.3 升级到 3.13.5、修复 GitHub Workflows Action 的模板注入、将 anyio 升级到 4.14.2。该版本还弃用 hub CLI 与私有 registry,迁移至公共 PyPI,并采用 guardrails-ai-types 0.5.0。
- 动态MCP Python SDK
MCP Python SDK v2.0.0 稳定版发布
MCP Python SDK v2.0.0 稳定版发布,支持 2026-07-28 版 Model Context Protocol 并兼容全部早期版本,pip install mcp 现安装 2.x。v1.x 进入维护模式,仅接收安全修复。新版将 FastMCP 更名为 MCPServer,引入一等公民 Client 对象,默认开启 OpenTelemetry 追踪,强化 stdio 与 OAuth(含 RFC 9207 签发者校验),Streamable HTTP 服务器对超过 4 MiB 的请求体返回 HTTP 413。
- 动态Google ADK
Google ADK v2.8.0 发布:新增 Model Armor 护栏插件并修复 BigQuery 工具 SQL 注入
Google ADK 发布 v2.8.0,新增 Model Armor 护栏插件,并修复 BigQuery 工具中的 SQL 注入漏洞。该版本还加入 ADK_MAX_LLM_CALLS 环境变量以限制 LLM 调用上限,为 RemoteA2aAgent 增加原生任务模式与 auth_scheme、auth_credential 认证支持,并新增对中继智能体输出的围栏处理,防止其被伪装成指令。此外引入按调用与按工作流的 token 消耗等实验性遥测指标,默认关闭,需通过 ADK_EXPERIMENTAL_TELEMETRY=true 或 RunConfig 显式开启。
- 动态Google ADK
Google ADK v2.11.0 发布:新增执行取消、工具确认与 SQLite 记忆服务
Google ADK 发布 v2.11.0,为 Runner、Workflow 和节点新增 abort_signal 以优雅取消执行,客户端断开时 /run_sse 会自动取消运行。工作流中的工具节点现可通过 RequestInput 暂停等待用户批准,并新增 ModelConsultTool,让智能体在任务中途咨询另一模型,受每轮和每会话预算限制。该版本还加入基于 sqlite:// URI 的本地 SQLite 记忆服务,并提供 MCP SDK 2.x 的现代协议连接路径;Dev UI 运行时配置改由服务器按请求提供,不再写入安装包。