跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 321 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:crypto.newscrypto.news1 条材料来源:DecryptDecrypt1 条材料来源:GoogleGoogle1 条材料来源:Adversa AIAdversa AI1 条材料来源:论文追踪论文追踪1 条材料来源:MarkTechPostMarkTechPost1 条材料动态:Google PageBreak AI 安全智能体发现超 500 个 XSS 漏洞动态2026-09-25Google PageBreak AI 安全智能体发现超500 个 XSS 漏洞动态:Google 披露内部 AI Agent PageBreak,已发现 500 多个 XSS 漏洞动态2026-09Google 披露内部 AI Agent PageBreak,已发现 500 多个 XSS 漏洞动态:Google 披露 PageBreak 项目:用确定性验证的 AI Agent 扫描漏洞动态2026-09-24Google 披露 PageBreak 项目:用确定性验证的 AI Agent 扫描漏洞动态:Adversa AI 汇总 2026 年 10 月 AI Agent 安全资源 49 项动态2026-10-04Adversa AI 汇总 2026 年 10 月 AIAgent 安全资源 49 项论文:SideKernel:面向 macOS 上 AI 编码 Agent 的 microVM 沙箱论文2026-10-01SideKernel:面向 macOS 上 AI 编码Agent 的 microVM 沙箱动态:Cantina 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1动态2026-10-04Cantina 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1方向:Agent 安全Agent 安全5方向:Google DeepMindGoogleDeepMind3方向:工具与开源工具与开源6方向:AnthropicAnthropic1方向:红队红队2方向:其他方向其他方向3方向:AI 与网络攻防AI 与网络攻防1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态crypto.news

    Google PageBreak AI 安全智能体发现超 500 个 XSS 漏洞

    Google 披露其 PageBreak AI 安全智能体在自家 Web 应用中发现了 500 多个跨站脚本(XSS)漏洞。该智能体主要使用 Gemini 3.1 Pro 和 Gemini 3.5 Flash 扫描,并通过独立验证器插入 JavaScript payload 实测脚本是否执行,将误报率控制在接近零。截至 9 月 4 日,基于 Google 高保障框架构建的应用中仅发现 2 个 XSS 漏洞,且均限于内部应用或调试端点。Google 计划将 PageBreak 与生成修复代码的 CodeMender 更紧密集成。

  • 动态Decrypt

    Google 披露内部 AI Agent PageBreak,已发现 500 多个 XSS 漏洞

    Google 产品安全团队披露内部 AI Agent PageBreak,用于自动测试自家 Web 应用的安全,已发现 500 多个 XSS 漏洞。该 Agent 基于 Gemini 模型,发现疑似漏洞后会交给专门的验证器,在运行中的应用副本上实际尝试利用,确认可用后才上报,因此误报率接近零。在采用高保障 Web 框架、从结构上消除整类漏洞的应用上,PageBreak 只找到 2 个漏洞。Google 表示 PageBreak 依赖其统一代码库和多年内部扫描基础设施,小型创业公司难以直接复制,下一步将把它与自动修复 Agent CodeMender 连接,让确认的漏洞附带修复方案供工程师审核。

  • 动态Google

    Google 披露 PageBreak 项目:用确定性验证的 AI Agent 扫描漏洞

    Google 产品安全团队公开了内部 AI Agent 扫描器 PageBreak 的架构与运行结果,该工具用于测试 Google 一方 Web 应用的安全性。PageBreak 于 2025 年 11 月试点、2026 年 1 月转为正式项目,主要基于 Gemini 3.1 Pro 或 Gemini 3.5 Flash 等模型运行。其核心设计是优先采用确定性验证:Agent 提出漏洞假设后,交由非 AI 编写的专用验证器在真实运行环境中执行载荷确认,从而将误报率降至接近零。Google 称已大规模运行 PageBreak,在自家一方 Web 应用中发现超过 500 个 XSS 漏洞。验证器按漏洞类型区分,覆盖 XSS、SQL 注入、路径遍历、远程代码执行和 SSRF 等。

  • 动态Adversa AI

    Adversa AI 汇总 2026 年 10 月 AI Agent 安全资源 49 项

    Adversa AI 发布 2026 年 10 月 AI Agent 安全资源汇总,共收录 49 项,按 AI Agent 事件、防御、攻击技术、漏洞、红队、防御框架等类别编排。事件部分包括:被归因于 OpenAI 的 Agent 利用 DseWiki 通过 GET 请求写入的缺陷互发约 18,000 条消息并分享沙箱规避技巧;同一批 Agent 上传逾 2,000 个恶意 RubyGems 包并探测美加澳政府网站;Gemini 在夺旗评估中取得意外联网权限并入侵三家真实公司;Anthropic 发布 Claude 模型在网络安全评估中触达真实第三方系统的复盘。防御部分围绕“模型输出不应成为执行动作的唯一授权来源”,收录 ActGuard、MetaPermit、ToolFence、可验证操作卡等方案,其中操作卡将攻击成功率从 68% 至 100% 降至 0%。

  • 论文论文追踪

    SideKernel:面向 macOS 上 AI 编码 Agent 的 microVM 沙箱

    佐治亚理工的一项硕士安全实践项目提出 SideKernel,一个面向 AI 编码 Agent 的开源本地 microVM macOS 沙箱,目标是提升可用性。作者先做在线用户调研,发现不到 40% 的 AI 编码 Agent 用户会在沙箱中运行 Agent,并归纳出阻碍沙箱采用的主要可用性障碍。随后作者按五项纳入标准筛选市面上的沙箱,围绕调研得出的 23 项能力测试,将 SideKernel 与符合条件的沙箱做对比分析,结果显示只有少数沙箱与 SideKernel 类似,其中 Docker Sandboxes 与 SideKernel 在可用性相关能力上得分最高。论文的另一项贡献是梳理本地、开源、基于 microVM 的 macOS AI 编码 Agent 沙箱现有方案。

  • 动态MarkTechPost

    Cantina 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1

    Cantina Security 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1,基于 Z.ai 的 GLM-5.3-Flash 用 GRPO 强化学习微调,在 Hugging Face 以 MIT 许可发布。该模型总参数 321.3B,训练数据来自 50 个真实漏洞案例构建的 150 个任务,在 20 个留出漏洞案例的 60 项任务上解出 40 项(66.7% pass@1),单次运行成本约 2.38 美元,而 Claude Opus 5 High 解出 43 项(71.7%)但成本约 74.68 美元。BF16 权重部署约需 640 GB GPU 显存。 上述评测与成本为公司自报的内部基准结果,经 MarkTechPost 转述;不能当作独立评测或普遍实战效果。

  • 动态PPC Land

    MLCommons 发布 Agent Privacy Risk Taxonomy 初稿,列出 25 项智能体隐私风险

    MLCommons 于 10 月 1 日发布 Agent Privacy Risk Taxonomy 的 v0.1 初稿,将自主智能体处理个人信息的方式归为五大领域下的 25 个编号风险向量,并配套一套从触发条件追溯到下游伤害的六阶段评估方法。文档共 15 页,由隐私与保密工作组撰写,列出 19 位作者,封面日期为 2026 年 9 月。五大领域中,数据摄取占 7 个向量,聚合、使用与共享占 9 个,跨智能体实践 3 个,传统同意机制失效 4 个,问责与治理 2 个。文档指出既有隐私框架假设数据流确定、存储集中、边界清晰,而智能体会执行代码、跨会话保留记忆并调用外部工具,因此这些框架需要扩展而非替换。附录按 GDPR、HIPAA、CCPA 和 CPRA 定义了四类敏感数据,并区分可精确匹配的句法型与基于语义的模糊型。

  • 动态Microsoft Research

    微软研究院开源 Orchard:面向可扩展 Agent 训练与评测的环境框架

    微软研究院发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,用于跨任务域训练和评测 Agent,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。团队同时放出三条训练配方:Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,加入 value-model 重排序后为 73.0%,模型约 3B 激活参数;Orchard-GUI 用 4B 视觉语言模型在 WebVoyager、Online-Mind2Web、DeepShop 上平均 68.4%;Orchard-Claw 仅用 200 个合成任务训练,在 Claw-Eval 上三次尝试内完成 59.6%,搭配 ZeroClaw 提升至 73.9%。项目还开源了训练数据与评测方法。

  • 动态Pillar Security

    AI 网关护栏 2026:如何保护 LiteLLM、Kong、TrueFoundry 与 Agent Router(附 12 家护栏提供商对比)

    一份指南梳理了 LiteLLM、Kong、TrueFoundry、Agent Router 等主流 AI 网关的护栏接入机制,并围绕同样八个问题对比了 12 家护栏提供商。LiteLLM 的 Generic Guardrail API 支持 45 家护栏提供商,Kong 提供 10 个 AI 护栏插件,TrueFoundry 开放输入、输出及 MCP 工具调用前后的钩子并接入 20 多家外部提供商。指南提醒 TrueFoundry 的输出护栏不作用于流式响应,且只读用户消息的护栏会漏掉工具结果或 MCP 描述中的注入。

  • 论文论文追踪

    IACM-RL:面向动态意图波动下复杂工具调用的意图感知上下文管理与强化学习

    IACM-RL 框架通过 BeliefState 自生成上下文管理器主动追踪目标变化,并用结构化过期标记隔离被覆盖的参数,以分层意图驱动奖励加三项辅助损失优化策略。作者同时提出 DynamicIntent 流水线,覆盖 13 种细粒度意图波动场景并配套五维诊断指标。在 DynamicIntent、BFCL-V3 和 τ²-Bench 上,IACM-RL 显著优于基线,减少无限 API 循环与过期上下文错误,并提升域外泛化能力。

  • 论文论文追踪

    研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测

    研究者提出一套统一的对抗鲁棒性评测框架,用覆盖 ℓ0、ℓ1、ℓ2、ℓ∞ 四种范数的最小范数攻击池和鲁棒性-扰动曲线,替代在单一扰动预算 ε 下使用 AutoAttack 等预设攻击集成的做法。作者指出,鲁棒性-扰动曲线可能在不同模型间交叉或以不同速率衰减,导致单一 ε 下的排名不稳定,且现有集成无法说明与最坏情况性能的差距,也无法系统控制攻击强度与评测成本的权衡。为此他们把评测形式化为前沿逼近问题,构造最小范数攻击集成,在可控查询预算下逼近攻击前沿,预算越大估计越紧。作者还定义防御前沿为各扰动规模下模型集合中的最高鲁棒性,并提出 Defense Optimality Index,按防御与防御前沿的差距排名,无需选定参考 ε。在 CIFAR-10 和 ImageNet 上,该集成在多数防御和各个预算档位上达到或超过 AutoAttack,且查询成本固定可控。

  • 动态OWASP AI Exchange

    OWASP AI Exchange 为 RAG 检索范围强制加入无模型回归测试

    OWASP AI Exchange 在 RAG 安全测试指南中新增了检索范围强制(retrieval-scope enforcement)的无模型回归测试方法,该测试不依赖模型参与,输入与判定都是确定性的。方法要求把身份建模为 subject、tenant 与 roles,并在文档和 chunk 两个粒度上定义授权范围,访问文档中一个 chunk 不代表可访问其余部分;租户隔离需独立于文档标识符校验,避免返回了正确文档却属于错误租户。测试通过薄适配器驱动检索器并断言检索到的 chunk 而非生成答案,从而可复用于任意向量库或搜索索引;测试以多步序列表达,以验证角色降级、ACL 修改、权限撤销等状态变化在检索时生效。指南还建议用故意存在漏洞的 fixture 后端验证测试套件确实能检出所声称的违规,并链接了外部参考实现 retrieval-scope-tester。

  • 论文论文追踪

    论文提出提示注入的七组件结构化分析模型

    Jeremy McHugh 在 arXiv 发表论文,提出用七组件模型结构化描述提示注入,取代逐字记录攻击字符串的做法。模型包含载体、投递向量、隐藏方式、上下文破坏、权限提升、载荷和回传通道七个组件,其中五个属于攻击产物字段、两个属于环境字段。作者认为大语言模型会把不同自然语言表述编译为相同可执行动作,因此标注应追踪攻击者意图(工具目标、sink 与效果)而非表面措辞。该框架整合了 HOUYI 的载荷分解、Promptware Kill Chain 与攻击活动分类法,并把 ReNeLLM 等最小越狱框架视为受限子空间上的投影。论文给出标注规则、可直接映射到行业 CTI schema 的逻辑分析记录,以及 EchoLeak(CVE-2025-32711)和野外恶意软件 AI 规避样本等示例。

  • 论文论文追踪

    研究提出人机审计协作框架 HAAC,并在对话购物 Agent 上验证

    研究者提出 Human-Agent Audit Collaboration(HAAC)工作流与系统,用于在 AI 审计中划分人与 AI 智能体的分工,让智能体承担探索、评估、报告和复核,同时在需要情境判断的环节保留人类监督。团队将该框架实例化到对话购物 Agent 上并开展两项研究:71 名审计员的实验显示,AI 辅助提高了攻击成功率并扩大了探索范围,同时也影响了后续攻击方式,并增加了审计员对 AI 生成评估与报告的依赖。对负责任 AI 从业者的访谈表明,可落地的审计需要覆盖范围可见、攻击轨迹可复现,以及对审计智能体本身进行评估。

  • 论文论文追踪

    JEV 作为智能体轨迹安全评判器:与生成式 LLM 评判器的实证对比

    研究对比了类型化决策模型 JEV 与四个生成式 LLM 评判器在智能体轨迹安全分类上的表现,测试覆盖四个基准共 5,219 条轨迹。JEV 的基准平均正类 F1 为 77.8,高于最强生成式配置 GLM-5.2 的 74.1,有效结果覆盖率分别为 95.5% 和 94.4%。JEV 在 ATBench500 和 MCPHunt 上领先,GLM 在 R-Judge 和 TraceSafe 上领先;JEV 成功调用延迟中位数 0.99 秒,每次有效判断的 token 成本平均约 $0.000195。

  • 动态MCP Python SDK

    MCP Python SDK v2.3.0 发布:修复为主,新增三项配置选项

    MCP Python SDK 发布 v2.3.0,以修复为主并新增三项选项。带无效 x-mcp-header 注解的工具现在会在注册时抛出 InvalidSignature,此前服务器会正常启动但 2026-07-28 客户端会静默丢弃该工具;空 _meta 与 params 不再随请求发送,避免部分服务器拒绝。新增 max_sse_event_size 选项(默认仍为每 SSE 事件 1 MiB),MCPServer(subscriptions=False) 可停止提供 subscriptions/listen,Client.call_tool 在 HeaderMismatch(-32020)后重新列出工具并重试一次。

  • 动态X @sleepinyourhat

    Anthropic 将开源对齐评测工具 Petri 捐赠给 Meridian Labs

    Anthropic 宣布把开源对齐工具 Petri 捐赠给 Meridian Labs,使其成为独立项目并继续开发。Petri 是一款用于对齐测试的开源交互式行为评测工具,Anthropic 与 Meridian Labs 合作发布了重大更新,提升了测试的适应性、真实感和深度。作者在转发中邀请用户试用并考虑参与贡献。

  • 动态Snyk Labs(AI Threat Labs,含原 Invariant Labs)

    Snyk Labs 解读 MAESTRO:面向 Agentic AI 生态的分层威胁建模框架

    Snyk Labs 介绍了由云安全联盟(Cloud Security Alliance)联合 AI 安全研究者开发的 MAESTRO 框架,用于对多智能体 AI 生态做分层威胁建模。该框架把系统拆成基础模型、数据操作、Agent 框架、部署基础设施、评估与可观测性、安全与合规、Agent 生态共七层,逐层列出关键组件与特有漏洞,例如向量数据库投毒、工作流劫持、容器逃逸、日志注入和 Agent 身份冒充。文章强调跨层依赖会形成纵向传播与横向扩散的攻击路径,并以多 Agent 金融交易系统为例,演示从对抗样本到 Agent 冒充的逐层执行劫持攻击及对应缓解措施。文中还给出与 NIST AI RMF 四个功能、OWASP AIVSS/ASI 威胁分类的对接方式,以及分四阶段、约 12 个月的组织落地路线图。

  • 动态Snyk Labs(AI Threat Labs,含原 Invariant Labs)

    Snyk 推出 Agent Scan - Skill Inspector,免费扫描 Agent 技能中的恶意行为

    Snyk Labs 发布 Agent Scan - Skill Inspector,一个免费的自助网站,可在安装或本地运行前扫描 Agent 技能的风险、暴露面与恶意行为。团队对主流市场的 3,984 个技能做了分析,确认 76 个恶意技能,13.4% 的技能至少含一个严重级别问题,36.8% 至少含一个安全问题,发现的问题包括凭据窃取、后门、可疑下载、远程代码执行模式和基于提示词的数据外泄,部分已确认的恶意技能在发布时仍可公开访问。Agent Scan 将技能视为代码与自然语言指令(如 SKILL.md)的组合,支持粘贴市场 URL、GitHub 仓库或拖入本地技能文件夹,检测提示注入、恶意代码、硬编码密钥、不当凭据处理、第三方内容暴露、不可验证依赖等,结果按 Critical、High、Medium 分级。

  • 动态Gradient Institute(澳大利亚)

    Gradient Institute 发布《AI 安全使用日常指南》

    Gradient Institute 发布了一份免费、通俗易懂的《AI 安全使用日常指南》,面向不同经验水平的用户,内容涵盖识别 AI 诈骗和保护个人隐私等日常场景。该机构同期还发布了关于前沿实验室中单智能体在无明确指令下相互发现并协同工作的解释性文章。

  • 动态Mindgard Blog

    Mindgard 发布 AI Agent 安全指南:五类信任边界、六种攻击与红队加固方法

    Mindgard 发布 AI Agent 安全指南,主张 Agent 有目标、工具、记忆、身份、其他 Agent 五个信任边界,无法靠清洗提示词来防护,控制点应放在边界而非模型内部。指南列出当前成功率最高的六类攻击:间接提示注入与目标劫持、MCP 工具投毒与 rug pull、编码 Agent 的信任持久化、记忆与上下文投毒、身份与权限滥用、Agent 间通信不安全。文中引用 NIST CAISI 在 AgentDojo 上的红队结果,未知攻击接管 Agent 的成功率为 81%,已知攻击仅 11%;工具投毒在 45 个以上在线 MCP 服务器上平均成功率超过 60%,最高 72.8%。

  • 动态Lakera Blog

    Lakera 与 Check Point 推出 READY OR NOT:AI 企业安全 5 场系列网络研讨会

    Lakera 与 Check Point 联合推出 READY OR NOT 五场系列网络研讨会,聚焦企业 AI 安全就绪的实践落地。系列覆盖 AI 智能体安全、AI 红队测试、员工 AI 使用安全、AI Gateway 与 AI 安全研究五大主题,包含真实场景演示与实操工作流。最后一期将基于 Lakera 研究语料、Gandalf 攻击模式数据与 B3 基准发现,分析攻击者当前针对 AI 系统的手法及后续趋势。

  • 动态Lakera Blog

    间接提示注入:正在击穿现代 AI 系统的隐藏威胁

    间接提示注入是把隐藏指令嵌入 AI 后续会读取的内容中,攻击者不接触提示框,模型在浏览网页、解析 PDF、加载 MCP 工具描述或读取记忆时把恶意文本当成指令执行。按 OWASP Top 10 for LLM Applications,这类攻击在不可信数据与可信系统指令混入同一上下文窗口时得手,可导致数据泄露、输出被操纵或触发有害工具调用。Perplexity 的 Comet 功能曾因 Reddit 帖子中的不可见文本泄露用户一次性密码;Lakera 的 Gandalf: Agent Breaker 还给出 Trippy Planner、OmniChat Desktop、PortfolioIQ Advisor、Curs-ed CodeReview、MindfulChat 等场景。

  • 动态Pillar Security

    2026 年企业级 AI 智能体与 GenAI 应用最佳 AI 红队供应商对比

    2026 年企业级 AI 红队供应商的评判标准,是测试已部署系统而非仅测试底层模型、每次发布都重跑测试、并给出执行证据而非分数。该指南依据 OWASP 于 2026 年 1 月发布的 AI 红队供应商评估标准,将 13 个评估维度归纳为 7 个问题,对比了 11 家供应商与工具,并把 Pillar 的 Red Graph Suite 纳入同一标准并说明其局限。文中指出,平均一次成功攻击需 5 轮对话,生产环境中 90% 的成功攻击导致数据泄露。