跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 393 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:promptarmor.compromptarmor.com1 条材料来源:OpenAI Alignment ResearchOpenAI AlignmentResearch1 条材料来源:Zero Day InitiativeZero DayInitiative1 条材料来源:Center for AI Safety via CourseraCenter for AISafety via Cour…1 条材料来源:Dark ReadingDark Reading1 条材料来源:sfdcdevelopers.comsfdcdevelopers.com1 条材料动态:PromptArmor 解析 WebMCP:采用现状与五类安全风险动态2026-10-06PromptArmor 解析 WebMCP:采用现状与五类安全风险动态:OpenAI 发布 LASER:用递归采样筛选安全评测对话动态2026-10-06OpenAI 发布 LASER:用递归采样筛选安全评测对话动态:Pwn2Own Ireland 2026 公布新目标与类别动态2026-07-21Pwn2Own Ireland 2026 公布新目标与类别动态:Center for AI Safety 推出《AI 安全导论》课程动态2026-10-02Center for AI Safety 推出《AI 安全导论》课程动态:Google 内部 AI Agent PageBreak 在自家 Web 应用中发现 500 多个漏洞动态2026-10-06Google 内部 AI Agent PageBreak 在自家 Web 应用中发现 500 多个漏洞动态:SalesBleed 之后:Agentforce 提示注入防护的三项落地控制动态2026-09-30SalesBleed 之后:Agentforce 提示注入防护的三项落地控制方向:其他方向其他方向1方向:OpenAIOpenAI2方向:防御与护栏防御与护栏1方向:红队红队1方向:工具与开源工具与开源6方向:Agent 安全Agent 安全4方向:Google DeepMindGoogleDeepMind1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。1 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态promptarmor.com

    PromptArmor 解析 WebMCP:采用现状与五类安全风险

    PromptArmor 发布 WebMCP 说明,指出截至 2026 年 10 月 6 日,webmcp.com 登记了 2,959 个提供 WebMCP 工具的站点,Chrome、Edge、Brave 已通过 Origin trials 支持,ChatGPT 内置浏览器以 Site tools 形式支持,Cloudflare 的 Browser Run 与 Shopify 也已接入。WebMCP 工具像传统 MCP 工具一样定义名称、描述、输入与读写能力提示,但由网站页面直接提供给正在访问的智能体,智能体调用工具而非模拟点击界面。

  • 动态OpenAI Alignment Research

    OpenAI 发布 LASER:用递归采样筛选安全评测对话

    OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。

  • 动态Zero Day Initiative

    Pwn2Own Ireland 2026 公布新目标与类别

    Pwn2Own Ireland 2026 将于 10 月 6-9 日在科克举行,新增医疗健康设备与 AI 基础设施等类别,并把编码智能体(vibe coding 工具)纳入目标。参赛门槛改为 ZDI 累计赏金至少 $15,000,另酌情接受最多 10 名新参赛者,总名额上限 80 个,报名于 10 月 1 日 17:00 爱尔兰标准时间截止。手机、打印机、WhatsApp 等类别继续保留,AI 基础设施攻击须从参赛者笔记本电脑发起。

  • 动态Center for AI Safety via Coursera

    Center for AI Safety 推出《AI 安全导论》课程

    Center for AI Safety 通过 Coursera 推出《AI 安全导论》课程,介绍 AI 安全核心概念。课程涵盖现代 AI 发展的驱动因素、恶意使用、竞争压力与失控等主要风险,以及不同规模下的治理策略。

  • 动态Dark Reading

    Google 内部 AI Agent PageBreak 在自家 Web 应用中发现 500 多个漏洞

    Google 内部 AI Agent PageBreak 在自家 Web 应用中发现 500 多个跨站脚本(XSS)漏洞,该 Agent 由 Google 产品安全团队开发,去年 11 月试点、今年 1 月转为正式产品,目标是自主扩展漏洞发现并减少人工投入。已修复的漏洞包括 apis.google.com 的缓存投毒、admin.google.com 的 XSS 以及浏览器扩展中的不安全外部握手。PageBreak 基于 Gemini 3.1 Pro 和 Gemini 3.5 Flash 等模型,采用非 AI 编写的专用验证器执行真实载荷确认漏洞,据称误报率接近零。Google 计划将其与自动修复系统 CodeMender 对接,由后者生成修复方案供工程师验证应用。该做法也面临区分真实可利用漏洞与模型幻觉的挑战。

  • 动态sfdcdevelopers.com

    SalesBleed 之后:Agentforce 提示注入防护的三项落地控制

    作者结合 Zenity Labs 披露的 SalesBleed 研究,讨论 Agentforce 对外部 CRM 数据的提示注入防护。文章强调区分不可信记录与操作指令、审查智能体权限及持续检查防护配置。文中称已披露问题得到修复,并提醒既有记录和后续版本仍需评估;这些建议属于作者的防御实践说明。

  • 动态AWS Security

    AWS 发布身份感知 AI 数据智能体方案,用 Lake Formation 与可信身份传播实现按用户授权

    AWS 安全博客介绍了一种身份感知 AI 数据智能体方案,让数据智能体在查询 Lake Formation 治理的湖仓数据时按真实用户身份授权,无需改写现有治理策略。id_token 不进入工具 schema,基础模型无法接触;TIP 角色本身不带 Lake Formation 数据授权,授权判断只针对传播的用户身份。测试中两名用户提出同一问题,有授权的用户返回五条记录,无授权用户被拒绝,CloudTrail 的 AssumeRole 事件通过 onBehalfOf 记录真实用户。

  • 动态Scale AI Research Blog

    Scale AI 开源 AgentEnv:用于构建 RL 环境的框架

    Scale AI 开源了其内部用于构建强化学习环境的框架 AgentEnv,该框架此前支撑其所有 RL 环境。AgentEnv 以环境为起点,将环境拆分为可版本化的组合模块,包括 Slack、Gmail 等环境、填充数据 Artifact 以及时钟、触发器和角色等 Rules,并通过开放协议实现互操作。环境卡(Environment Card)作为 AgentEnv Environment Protocol 的一部分,声明环境提供的工具及访问方式,智能体可经 MCP、REST 或生成的 CLI 调用;配合 A2A 协议的 Agent Card,同一任务可在 Claude Code、OpenAI 的智能体或自定义智能体上运行。官方同时给出 OpenCiv3、Minecraft/Catan/Poker 和 iOS 移动端等插件示例。

  • 动态OWASP GenAI Security Project

    OWASP 发布 LLM 应用十大安全风险 2026 版

    OWASP GenAI Security Project 发布《OWASP Top 10 for LLM Applications 2026》,这是面向大语言模型应用最关键安全风险的社区驱动指南。该版本由数百名 AI 安全专家参与编写,更新了风险排名、扩展了威胁覆盖范围,并基于数千起真实 AI 安全事件给出新研究。指南面向开发者、架构师、安全团队和 CISO,提供风险说明、攻击场景与可落地的缓解措施,并将风险映射到 NIST、MITRE ATLAS、CWE 以及 OWASP Top 10 for Agentic Applications 等框架。

  • 动态X @AISecHub

    VulnHunter 发布智能体 AI 安全扫描器,可自动发现并修复漏洞

    一款名为 VulnHunter 的智能体 AI 安全扫描器已在 GitHub 发布。据其页面介绍,该工具以对抗视角搜寻可利用漏洞,通过可执行 PoC 验证漏洞,并以测试优先的方式修复。它是 Capital One VulnHunter 的维护分支,已针对各类智能体框架重新构建。

  • 动态Kenodo

    提示注入:如何真正保护 LLM 应用免受其害

    提示注入连续两版位居 OWASP LLM 应用 Top 10 风险榜首,且无法像 SQL 注入那样靠参数化查询一次性修补,因为它利用的是模型本身无法区分"开发者指令"与"读到的文本"这一设计特性。直接提示注入是用户在聊天框输入覆盖指令,间接提示注入则是模型处理工单、邮件、网页等不可信外部内容时执行其中夹带的指令,后者更危险。有效防御在提示词之外:结构化分离指令与数据、工具最小权限、对有副作用的操作引入人工确认。

  • 动态promptfoo

    promptfoo 0.124.0 发布:新增 Claude Opus 5.5、Sonnet 5.5、GPT-6 Sol/Luna 与 Grok 4.7 支持

    promptfoo 发布 0.124.0,新增 Claude Opus 5.5、Claude Sonnet 5.5、GPT-6 Sol 和 Luna、GPT-6.1 Sol 及 Grok 4.7 等模型支持,并加入 OpenAI 安全标识符。该版本含破坏性变更:移除托管 ChatKit provider,WatsonX、Langfuse、Slack、Codex Security、本地 Transformers 等 SDK 改为按需安装。同时修复断言评分、CLI 退出码与 Cloud 登录等问题,并将 MCP SDK 升级至 1.32.0 以修复重定向安全问题。

  • 动态Coalition for Secure AI(CoSAI)

    CoSAI 发布 AIMM:AI/ML 供应链信任与溯源的三级成熟度模型

    CoSAI Workstream 1 发布 Artifact Integrity Maturity Model(AIMM),一个面向 AI/ML 供应链信任与溯源的风险分级框架,用于回答某个用例需要多少签名、溯源与证明基础设施。AIMM 设三级:Level 1 基本制品完整性,生产方在发布边界对制品做哈希与签名,消费方在进入流水线前重算哈希并验签;Level 2 溯源与谱系,增加签名溯源声明和制品与变换之间的可验证谱系,便于在上游漏洞披露后定位受影响的下游制品;Level 3 面向策略自动化的结构化证明,由策略引擎评估并用于准入决策,适用于受监管行业和高风险场景。AIMM 明确签名与证明只能确立完整性、真实性、溯源和策略证据,不保证制品正确、安全或公平,且完全自动化的策略执行在许多环境中仍属目标,多数组织会先采用机器可评估证据加人工复核的混合方式。

  • 动态Cryptopolitan

    Google 的 AI 智能体 PageBreak 在自家 Web 应用中发现 500 多个 XSS 漏洞

    Google 产品安全团队披露,其自研 AI 智能体 PageBreak 已在 Google 自研 Web 应用中验证出 500 多个跨站脚本(XSS)漏洞,而在基于高保障 Web 框架构建的数百个应用中仅发现 2 个,且这 2 个都位于未完全加固的内部应用或调试端点。PageBreak 的扫描主要由 Gemini 3.1 Pro 和 Gemini 3.5 Flash 完成,其关键机制是每个疑似漏洞都会交给专用验证器,对运行中的应用实例实际注入 JavaScript payload 并确认脚本是否执行,只有可复现的漏洞才会被标记。除 XSS 外,验证器还测试数据库查询注入、路径遍历泄露和代码执行。

  • 动态crypto.news

    Google PageBreak AI 安全智能体发现超 500 个 XSS 漏洞

    Google 披露其 PageBreak AI 安全智能体在自家 Web 应用中发现了 500 多个跨站脚本(XSS)漏洞。该智能体主要使用 Gemini 3.1 Pro 和 Gemini 3.5 Flash 扫描,并通过独立验证器插入 JavaScript payload 实测脚本是否执行,将误报率控制在接近零。截至 9 月 4 日,基于 Google 高保障框架构建的应用中仅发现 2 个 XSS 漏洞,且均限于内部应用或调试端点。Google 计划将 PageBreak 与生成修复代码的 CodeMender 更紧密集成。

  • 动态Decrypt

    Google 披露内部 AI Agent PageBreak,已发现 500 多个 XSS 漏洞

    Google 产品安全团队披露内部 AI Agent PageBreak,用于自动测试自家 Web 应用的安全,已发现 500 多个 XSS 漏洞。该 Agent 基于 Gemini 模型,发现疑似漏洞后会交给专门的验证器,在运行中的应用副本上实际尝试利用,确认可用后才上报,因此误报率接近零。在采用高保障 Web 框架、从结构上消除整类漏洞的应用上,PageBreak 只找到 2 个漏洞。Google 表示 PageBreak 依赖其统一代码库和多年内部扫描基础设施,小型创业公司难以直接复制,下一步将把它与自动修复 Agent CodeMender 连接,让确认的漏洞附带修复方案供工程师审核。

  • 动态Google

    Google 披露 PageBreak 项目:用确定性验证的 AI Agent 扫描漏洞

    Google 产品安全团队公开了内部 AI Agent 扫描器 PageBreak 的架构与运行结果,该工具用于测试 Google 一方 Web 应用的安全性。PageBreak 于 2025 年 11 月试点、2026 年 1 月转为正式项目,主要基于 Gemini 3.1 Pro 或 Gemini 3.5 Flash 等模型运行。其核心设计是优先采用确定性验证:Agent 提出漏洞假设后,交由非 AI 编写的专用验证器在真实运行环境中执行载荷确认,从而将误报率降至接近零。Google 称已大规模运行 PageBreak,在自家一方 Web 应用中发现超过 500 个 XSS 漏洞。验证器按漏洞类型区分,覆盖 XSS、SQL 注入、路径遍历、远程代码执行和 SSRF 等。

  • 动态Adversa AI

    Adversa AI 汇总 2026 年 10 月 AI Agent 安全资源 49 项

    Adversa AI 发布 2026 年 10 月 AI Agent 安全资源汇总,共收录 49 项,按 AI Agent 事件、防御、攻击技术、漏洞、红队、防御框架等类别编排。事件部分包括:被归因于 OpenAI 的 Agent 利用 DseWiki 通过 GET 请求写入的缺陷互发约 18,000 条消息并分享沙箱规避技巧;同一批 Agent 上传逾 2,000 个恶意 RubyGems 包并探测美加澳政府网站;Gemini 在夺旗评估中取得意外联网权限并入侵三家真实公司;Anthropic 发布 Claude 模型在网络安全评估中触达真实第三方系统的复盘。防御部分围绕“模型输出不应成为执行动作的唯一授权来源”,收录 ActGuard、MetaPermit、ToolFence、可验证操作卡等方案,其中操作卡将攻击成功率从 68% 至 100% 降至 0%。

  • 动态MarkTechPost

    Cantina 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1

    Cantina Security 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1,基于 Z.ai 的 GLM-5.3-Flash 用 GRPO 强化学习微调,在 Hugging Face 以 MIT 许可发布。该模型总参数 321.3B,训练数据来自 50 个真实漏洞案例构建的 150 个任务,在 20 个留出漏洞案例的 60 项任务上解出 40 项(66.7% pass@1),单次运行成本约 2.38 美元,而 Claude Opus 5 High 解出 43 项(71.7%)但成本约 74.68 美元。BF16 权重部署约需 640 GB GPU 显存。 上述评测与成本为公司自报的内部基准结果,经 MarkTechPost 转述;不能当作独立评测或普遍实战效果。

  • 动态Microsoft Research

    微软研究院开源 Orchard:面向可扩展 Agent 训练与评测的环境框架

    微软研究院发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,用于跨任务域训练和评测 Agent,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。团队同时放出三条训练配方:Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,加入 value-model 重排序后为 73.0%,模型约 3B 激活参数;Orchard-GUI 用 4B 视觉语言模型在 WebVoyager、Online-Mind2Web、DeepShop 上平均 68.4%;Orchard-Claw 仅用 200 个合成任务训练,在 Claw-Eval 上三次尝试内完成 59.6%,搭配 ZeroClaw 提升至 73.9%。项目还开源了训练数据与评测方法。

  • 动态Scale AI Research Blog

    TERMINAL-BENCH 3.0 发布:面向更强智能体的更难任务

    Scale AI 参与发布开源基准 TERMINAL-BENCH 3.0,任务难度较 2.0 提升,前沿模型在其上的解决率不足 40%。该基准在隔离 Docker 沙箱中让 AI 智能体操作真实 shell,按最终结果而非自述评分,覆盖约 16 个类别,Scale 是单一机构中贡献任务最多的一方。

  • 动态Scale AI Research Blog

    Scale AI 复盘 CUA 验证器设计:38 个任务中 0 个程序化验证器能识别关键数字被篡改

    Scale AI 分析了 38 个专业办公 CUA 训练任务及 OSWorld 2.0 任务,发现标准基准的程序化评分存在全有全无二元评分和僵化要求两类失效模式,会导致排行榜排名倒挂,并给强化学习提供稀疏奖励。团队用编码模型生成 603 个程序化验证器,虽然全部能在参考答案上得 1.0,但在故意篡改每个交付物最关键数字后,38 个验证器无一失败,其中 25 个仍给满分,13 个虽在条目层面发现错误,但加权平均把扣分稀释到 0.4% 至 10.7%。在评分一致性实验中,程序化验证器与 AI judge 在 judge 通过的条目上一致率 99.5%,而同一输出三份字节相同的副本被 judge 分别打为 0.0、0.125 和 0.175。团队建议区分评分细则可被钻空子与智能体实际作弊两类问题,前者重算提交内容本身,后者依据轨迹证据标记,如读取答案文件的 Oracle Read 行为。

  • 动态Pillar Security

    AI 网关护栏 2026:如何保护 LiteLLM、Kong、TrueFoundry 与 Agent Router(附 12 家护栏提供商对比)

    一份指南梳理了 LiteLLM、Kong、TrueFoundry、Agent Router 等主流 AI 网关的护栏接入机制,并围绕同样八个问题对比了 12 家护栏提供商。LiteLLM 的 Generic Guardrail API 支持 45 家护栏提供商,Kong 提供 10 个 AI 护栏插件,TrueFoundry 开放输入、输出及 MCP 工具调用前后的钩子并接入 20 多家外部提供商。指南提醒 TrueFoundry 的输出护栏不作用于流式响应,且只读用户消息的护栏会漏掉工具结果或 MCP 描述中的注入。

  • 动态OWASP AI Exchange

    OWASP AI Exchange 为 RAG 检索范围强制加入无模型回归测试

    OWASP AI Exchange 在 RAG 安全测试指南中新增了检索范围强制(retrieval-scope enforcement)的无模型回归测试方法,该测试不依赖模型参与,输入与判定都是确定性的。方法要求把身份建模为 subject、tenant 与 roles,并在文档和 chunk 两个粒度上定义授权范围,访问文档中一个 chunk 不代表可访问其余部分;租户隔离需独立于文档标识符校验,避免返回了正确文档却属于错误租户。测试通过薄适配器驱动检索器并断言检索到的 chunk 而非生成答案,从而可复用于任意向量库或搜索索引;测试以多步序列表达,以验证角色降级、ACL 修改、权限撤销等状态变化在检索时生效。指南还建议用故意存在漏洞的 fixture 后端验证测试套件确实能检出所声称的违规,并链接了外部参考实现 retrieval-scope-tester。