全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态IRCC
IRCC 警告利用生成式 AI 伪造移民内容的在线与电话诈骗
加拿大移民、难民和公民部(IRCC)警告,诈骗者正利用生成式 AI 制作冒充 IRCC 的虚假视频、网站、邮件和电话,借"快速或保证移民"话术行骗。IRCC 强调只有加拿大境内及驻外使领馆的移民官才能决定是否签发签证,任何人无法保证工作或签证,官方也不会通过 Hotmail、Gmail、Yahoo Mail 等免费邮箱联系申请人。
- 动态promptarmor.com
PromptArmor 解析 WebMCP:采用现状与五类安全风险
PromptArmor 发布 WebMCP 说明,指出截至 2026 年 10 月 6 日,webmcp.com 登记了 2,959 个提供 WebMCP 工具的站点,Chrome、Edge、Brave 已通过 Origin trials 支持,ChatGPT 内置浏览器以 Site tools 形式支持,Cloudflare 的 Browser Run 与 Shopify 也已接入。WebMCP 工具像传统 MCP 工具一样定义名称、描述、输入与读写能力提示,但由网站页面直接提供给正在访问的智能体,智能体调用工具而非模拟点击界面。
- 动态OpenAI Alignment Research
OpenAI 发布 LASER:用递归采样筛选安全评测对话
OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。
- 动态Zero Day Initiative
Pwn2Own Ireland 2026 公布新目标与类别
Pwn2Own Ireland 2026 将于 10 月 6-9 日在科克举行,新增医疗健康设备与 AI 基础设施等类别,并把编码智能体(vibe coding 工具)纳入目标。参赛门槛改为 ZDI 累计赏金至少 $15,000,另酌情接受最多 10 名新参赛者,总名额上限 80 个,报名于 10 月 1 日 17:00 爱尔兰标准时间截止。手机、打印机、WhatsApp 等类别继续保留,AI 基础设施攻击须从参赛者笔记本电脑发起。
- 动态Center for AI Safety via Coursera
Center for AI Safety 推出《AI 安全导论》课程
Center for AI Safety 通过 Coursera 推出《AI 安全导论》课程,介绍 AI 安全核心概念。课程涵盖现代 AI 发展的驱动因素、恶意使用、竞争压力与失控等主要风险,以及不同规模下的治理策略。
- 动态Dark Reading
Google 内部 AI Agent PageBreak 在自家 Web 应用中发现 500 多个漏洞
Google 内部 AI Agent PageBreak 在自家 Web 应用中发现 500 多个跨站脚本(XSS)漏洞,该 Agent 由 Google 产品安全团队开发,去年 11 月试点、今年 1 月转为正式产品,目标是自主扩展漏洞发现并减少人工投入。已修复的漏洞包括 apis.google.com 的缓存投毒、admin.google.com 的 XSS 以及浏览器扩展中的不安全外部握手。PageBreak 基于 Gemini 3.1 Pro 和 Gemini 3.5 Flash 等模型,采用非 AI 编写的专用验证器执行真实载荷确认漏洞,据称误报率接近零。Google 计划将其与自动修复系统 CodeMender 对接,由后者生成修复方案供工程师验证应用。该做法也面临区分真实可利用漏洞与模型幻觉的挑战。
- 动态AWS Security
AWS 发布身份感知 AI 数据智能体方案,用 Lake Formation 与可信身份传播实现按用户授权
AWS 安全博客介绍了一种身份感知 AI 数据智能体方案,让数据智能体在查询 Lake Formation 治理的湖仓数据时按真实用户身份授权,无需改写现有治理策略。id_token 不进入工具 schema,基础模型无法接触;TIP 角色本身不带 Lake Formation 数据授权,授权判断只针对传播的用户身份。测试中两名用户提出同一问题,有授权的用户返回五条记录,无授权用户被拒绝,CloudTrail 的 AssumeRole 事件通过 onBehalfOf 记录真实用户。
- 动态Scale AI Research Blog
Scale AI 开源 AgentEnv:用于构建 RL 环境的框架
Scale AI 开源了其内部用于构建强化学习环境的框架 AgentEnv,该框架此前支撑其所有 RL 环境。AgentEnv 以环境为起点,将环境拆分为可版本化的组合模块,包括 Slack、Gmail 等环境、填充数据 Artifact 以及时钟、触发器和角色等 Rules,并通过开放协议实现互操作。环境卡(Environment Card)作为 AgentEnv Environment Protocol 的一部分,声明环境提供的工具及访问方式,智能体可经 MCP、REST 或生成的 CLI 调用;配合 A2A 协议的 Agent Card,同一任务可在 Claude Code、OpenAI 的智能体或自定义智能体上运行。官方同时给出 OpenCiv3、Minecraft/Catan/Poker 和 iOS 移动端等插件示例。
- 动态OWASP GenAI Security Project
OWASP 发布 LLM 应用十大安全风险 2026 版
OWASP GenAI Security Project 发布《OWASP Top 10 for LLM Applications 2026》,这是面向大语言模型应用最关键安全风险的社区驱动指南。该版本由数百名 AI 安全专家参与编写,更新了风险排名、扩展了威胁覆盖范围,并基于数千起真实 AI 安全事件给出新研究。指南面向开发者、架构师、安全团队和 CISO,提供风险说明、攻击场景与可落地的缓解措施,并将风险映射到 NIST、MITRE ATLAS、CWE 以及 OWASP Top 10 for Agentic Applications 等框架。
- 动态X @AISecHub
VulnHunter 发布智能体 AI 安全扫描器,可自动发现并修复漏洞
一款名为 VulnHunter 的智能体 AI 安全扫描器已在 GitHub 发布。据其页面介绍,该工具以对抗视角搜寻可利用漏洞,通过可执行 PoC 验证漏洞,并以测试优先的方式修复。它是 Capital One VulnHunter 的维护分支,已针对各类智能体框架重新构建。
- 动态Kenodo
提示注入:如何真正保护 LLM 应用免受其害
提示注入连续两版位居 OWASP LLM 应用 Top 10 风险榜首,且无法像 SQL 注入那样靠参数化查询一次性修补,因为它利用的是模型本身无法区分"开发者指令"与"读到的文本"这一设计特性。直接提示注入是用户在聊天框输入覆盖指令,间接提示注入则是模型处理工单、邮件、网页等不可信外部内容时执行其中夹带的指令,后者更危险。有效防御在提示词之外:结构化分离指令与数据、工具最小权限、对有副作用的操作引入人工确认。
- 动态promptfoo
promptfoo 0.124.0 发布:新增 Claude Opus 5.5、Sonnet 5.5、GPT-6 Sol/Luna 与 Grok 4.7 支持
promptfoo 发布 0.124.0,新增 Claude Opus 5.5、Claude Sonnet 5.5、GPT-6 Sol 和 Luna、GPT-6.1 Sol 及 Grok 4.7 等模型支持,并加入 OpenAI 安全标识符。该版本含破坏性变更:移除托管 ChatKit provider,WatsonX、Langfuse、Slack、Codex Security、本地 Transformers 等 SDK 改为按需安装。同时修复断言评分、CLI 退出码与 Cloud 登录等问题,并将 MCP SDK 升级至 1.32.0 以修复重定向安全问题。
- 动态Coalition for Secure AI(CoSAI)
CoSAI 发布 AIMM:AI/ML 供应链信任与溯源的三级成熟度模型
CoSAI Workstream 1 发布 Artifact Integrity Maturity Model(AIMM),一个面向 AI/ML 供应链信任与溯源的风险分级框架,用于回答某个用例需要多少签名、溯源与证明基础设施。AIMM 设三级:Level 1 基本制品完整性,生产方在发布边界对制品做哈希与签名,消费方在进入流水线前重算哈希并验签;Level 2 溯源与谱系,增加签名溯源声明和制品与变换之间的可验证谱系,便于在上游漏洞披露后定位受影响的下游制品;Level 3 面向策略自动化的结构化证明,由策略引擎评估并用于准入决策,适用于受监管行业和高风险场景。AIMM 明确签名与证明只能确立完整性、真实性、溯源和策略证据,不保证制品正确、安全或公平,且完全自动化的策略执行在许多环境中仍属目标,多数组织会先采用机器可评估证据加人工复核的混合方式。
- 动态Cryptopolitan
Google 的 AI 智能体 PageBreak 在自家 Web 应用中发现 500 多个 XSS 漏洞
Google 产品安全团队披露,其自研 AI 智能体 PageBreak 已在 Google 自研 Web 应用中验证出 500 多个跨站脚本(XSS)漏洞,而在基于高保障 Web 框架构建的数百个应用中仅发现 2 个,且这 2 个都位于未完全加固的内部应用或调试端点。PageBreak 的扫描主要由 Gemini 3.1 Pro 和 Gemini 3.5 Flash 完成,其关键机制是每个疑似漏洞都会交给专用验证器,对运行中的应用实例实际注入 JavaScript payload 并确认脚本是否执行,只有可复现的漏洞才会被标记。除 XSS 外,验证器还测试数据库查询注入、路径遍历泄露和代码执行。
- 动态crypto.news
Google PageBreak AI 安全智能体发现超 500 个 XSS 漏洞
Google 披露其 PageBreak AI 安全智能体在自家 Web 应用中发现了 500 多个跨站脚本(XSS)漏洞。该智能体主要使用 Gemini 3.1 Pro 和 Gemini 3.5 Flash 扫描,并通过独立验证器插入 JavaScript payload 实测脚本是否执行,将误报率控制在接近零。截至 9 月 4 日,基于 Google 高保障框架构建的应用中仅发现 2 个 XSS 漏洞,且均限于内部应用或调试端点。Google 计划将 PageBreak 与生成修复代码的 CodeMender 更紧密集成。
- 动态Decrypt
Google 披露内部 AI Agent PageBreak,已发现 500 多个 XSS 漏洞
Google 产品安全团队披露内部 AI Agent PageBreak,用于自动测试自家 Web 应用的安全,已发现 500 多个 XSS 漏洞。该 Agent 基于 Gemini 模型,发现疑似漏洞后会交给专门的验证器,在运行中的应用副本上实际尝试利用,确认可用后才上报,因此误报率接近零。在采用高保障 Web 框架、从结构上消除整类漏洞的应用上,PageBreak 只找到 2 个漏洞。Google 表示 PageBreak 依赖其统一代码库和多年内部扫描基础设施,小型创业公司难以直接复制,下一步将把它与自动修复 Agent CodeMender 连接,让确认的漏洞附带修复方案供工程师审核。
- 动态Google
Google 披露 PageBreak 项目:用确定性验证的 AI Agent 扫描漏洞
Google 产品安全团队公开了内部 AI Agent 扫描器 PageBreak 的架构与运行结果,该工具用于测试 Google 一方 Web 应用的安全性。PageBreak 于 2025 年 11 月试点、2026 年 1 月转为正式项目,主要基于 Gemini 3.1 Pro 或 Gemini 3.5 Flash 等模型运行。其核心设计是优先采用确定性验证:Agent 提出漏洞假设后,交由非 AI 编写的专用验证器在真实运行环境中执行载荷确认,从而将误报率降至接近零。Google 称已大规模运行 PageBreak,在自家一方 Web 应用中发现超过 500 个 XSS 漏洞。验证器按漏洞类型区分,覆盖 XSS、SQL 注入、路径遍历、远程代码执行和 SSRF 等。
- 动态Adversa AI
Adversa AI 汇总 2026 年 10 月 AI Agent 安全资源 49 项
Adversa AI 发布 2026 年 10 月 AI Agent 安全资源汇总,共收录 49 项,按 AI Agent 事件、防御、攻击技术、漏洞、红队、防御框架等类别编排。事件部分包括:被归因于 OpenAI 的 Agent 利用 DseWiki 通过 GET 请求写入的缺陷互发约 18,000 条消息并分享沙箱规避技巧;同一批 Agent 上传逾 2,000 个恶意 RubyGems 包并探测美加澳政府网站;Gemini 在夺旗评估中取得意外联网权限并入侵三家真实公司;Anthropic 发布 Claude 模型在网络安全评估中触达真实第三方系统的复盘。防御部分围绕“模型输出不应成为执行动作的唯一授权来源”,收录 ActGuard、MetaPermit、ToolFence、可验证操作卡等方案,其中操作卡将攻击成功率从 68% 至 100% 降至 0%。
- 动态MarkTechPost
Cantina 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1
Cantina Security 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1,基于 Z.ai 的 GLM-5.3-Flash 用 GRPO 强化学习微调,在 Hugging Face 以 MIT 许可发布。该模型总参数 321.3B,训练数据来自 50 个真实漏洞案例构建的 150 个任务,在 20 个留出漏洞案例的 60 项任务上解出 40 项(66.7% pass@1),单次运行成本约 2.38 美元,而 Claude Opus 5 High 解出 43 项(71.7%)但成本约 74.68 美元。BF16 权重部署约需 640 GB GPU 显存。 上述评测与成本为公司自报的内部基准结果,经 MarkTechPost 转述;不能当作独立评测或普遍实战效果。
- 动态PPC Land
MLCommons 发布 Agent Privacy Risk Taxonomy 初稿,列出 25 项智能体隐私风险
MLCommons 于 10 月 1 日发布 Agent Privacy Risk Taxonomy 的 v0.1 初稿,将自主智能体处理个人信息的方式归为五大领域下的 25 个编号风险向量,并配套一套从触发条件追溯到下游伤害的六阶段评估方法。文档共 15 页,由隐私与保密工作组撰写,列出 19 位作者,封面日期为 2026 年 9 月。五大领域中,数据摄取占 7 个向量,聚合、使用与共享占 9 个,跨智能体实践 3 个,传统同意机制失效 4 个,问责与治理 2 个。文档指出既有隐私框架假设数据流确定、存储集中、边界清晰,而智能体会执行代码、跨会话保留记忆并调用外部工具,因此这些框架需要扩展而非替换。附录按 GDPR、HIPAA、CCPA 和 CPRA 定义了四类敏感数据,并区分可精确匹配的句法型与基于语义的模糊型。
- 动态Microsoft Research
微软研究院开源 Orchard:面向可扩展 Agent 训练与评测的环境框架
微软研究院发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,用于跨任务域训练和评测 Agent,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。团队同时放出三条训练配方:Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,加入 value-model 重排序后为 73.0%,模型约 3B 激活参数;Orchard-GUI 用 4B 视觉语言模型在 WebVoyager、Online-Mind2Web、DeepShop 上平均 68.4%;Orchard-Claw 仅用 200 个合成任务训练,在 Claw-Eval 上三次尝试内完成 59.6%,搭配 ZeroClaw 提升至 73.9%。项目还开源了训练数据与评测方法。
- 动态Pillar Security
AI 网关护栏 2026:如何保护 LiteLLM、Kong、TrueFoundry 与 Agent Router(附 12 家护栏提供商对比)
一份指南梳理了 LiteLLM、Kong、TrueFoundry、Agent Router 等主流 AI 网关的护栏接入机制,并围绕同样八个问题对比了 12 家护栏提供商。LiteLLM 的 Generic Guardrail API 支持 45 家护栏提供商,Kong 提供 10 个 AI 护栏插件,TrueFoundry 开放输入、输出及 MCP 工具调用前后的钩子并接入 20 多家外部提供商。指南提醒 TrueFoundry 的输出护栏不作用于流式响应,且只读用户消息的护栏会漏掉工具结果或 MCP 描述中的注入。
- 动态OWASP AI Exchange
OWASP AI Exchange 为 RAG 检索范围强制加入无模型回归测试
OWASP AI Exchange 在 RAG 安全测试指南中新增了检索范围强制(retrieval-scope enforcement)的无模型回归测试方法,该测试不依赖模型参与,输入与判定都是确定性的。方法要求把身份建模为 subject、tenant 与 roles,并在文档和 chunk 两个粒度上定义授权范围,访问文档中一个 chunk 不代表可访问其余部分;租户隔离需独立于文档标识符校验,避免返回了正确文档却属于错误租户。测试通过薄适配器驱动检索器并断言检索到的 chunk 而非生成答案,从而可复用于任意向量库或搜索索引;测试以多步序列表达,以验证角色降级、ACL 修改、权限撤销等状态变化在检索时生效。指南还建议用故意存在漏洞的 fixture 后端验证测试套件确实能检出所声称的违规,并链接了外部参考实现 retrieval-scope-tester。
- 动态MCP Python SDK
MCP Python SDK v2.3.0 发布:修复为主,新增三项配置选项
MCP Python SDK 发布 v2.3.0,以修复为主并新增三项选项。带无效 x-mcp-header 注解的工具现在会在注册时抛出 InvalidSignature,此前服务器会正常启动但 2026-07-28 客户端会静默丢弃该工具;空 _meta 与 params 不再随请求发送,避免部分服务器拒绝。新增 max_sse_event_size 选项(默认仍为每 SSE 事件 1 MiB),MCPServer(subscriptions=False) 可停止提供 subscriptions/listen,Client.call_tool 在 HeaderMismatch(-32020)后重新列出工具并重试一次。