Agent 安全
今天新收录 2 条Agent 安全
Bitdefender · 收录 · 原文 日期未知 Microsoft Research · 收录 · 原文 精选关注度5353 微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量 Agent RL 框架
微软研究院亚洲团队开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一套 Agent harness 直接参与强化学习,无需在训练框架内重新实现 Agent。框架约 3500 行代码,由 API Gateway、Rollout Controller 和基于 verl 的 Customized Trainer 三部分组成,Agent 通过 OpenAI 兼容的 LLM 代理接入,harness 代码保持不变。Agent 以标准 Kubernetes job 运行,可复用自管集群、云 Kubernetes 或本地基础设施,不依赖付费商业沙箱服务。团队还提出 Collocated Async RL,让 rollout 与模型更新共用同一组 GPU,实验中相比同步 RL 取得约 2 倍端到端加速。
推荐理由微软研究院开源 3500 行代码的 Agent RL 框架,让部署用的 harness 直接参与训练,并给出可复现的编码 Agent 训练流程。
arXiv · 收录 · 原文 论文24 小时新增 1 个来源关注度56↑156 Transect:为长程 LLM Agent 评测保留可观测性的开源工具
研究者发布开源包 Transect,用于在长程 LLM Agent 评测中保留可观测性。该工具基于 Inspect Scout 构建,用户在可复用的评测族配置中指定任务上下文与行为词汇,判分模型与分析设置另行提供。其可导航报告把记录事件、token 用量、子 Agent 活动与模型生成的行为标签对齐到同一按回合的时间线上,评审者可快速把握一次运行的脉络、把任一标签或事件追溯到来源回合,并导出底层数据表做跨运行分析。作者在一项生成近 1300 万 token 的 AI R&D 评测上演示了该流程,将 Agent 工作划分为与研究技能分类对应的行为阶段、子 Agent 委派与交互以及 token 使用;合并视图显示工作集中在操作性任务与稿件产出,几乎没有持续假设生成阶段的证据。
UK AI Security Institute · 收录 · 原文 精选24 小时新增 1 个来源关注度56↑156 UK AISI 开源 Transect,把大规模 Agent 评测记录转成可核查报告
UK AISI 发布开源 Python 包 Transect,基于 Inspect Scout 构建,把 Agent 评测记录中的活动标签、token 用量和记录事件放到同一条以 turn 为索引的时间线上,生成一份交互式报告,供评审者跳转到对应记录片段核对自动分析的依据。用户需提供评测记录、任务上下文和希望区分的活动类别,Transect 用用户选定的 LLM-as-judges 为活动片段打标签,并可依据委派指令对子智能体分类。在一项开放式 AI 研究评测中,AISI 用 Transect 追踪研究计划、基线代码、实验草稿和盲审四份文档在多个智能体间的读写流转,显示子智能体先协作研究计划与代码库,实验开始后集中协作实验设计与数据。Transect 保存活动标签和单次模型判断,可重新打开分析而无需再次调用模型;重复判断或使用多个 judge 模型时,评审者能看到判断分歧之处。
推荐理由AISI 开源了把长 Agent 评测记录转成可核查交互报告的工具,并给出多智能体协作的案例分析。
promptarmor.com · 收录 · 原文 24 小时新增 1 个来源关注度41↑141 PromptArmor 解析 WebMCP:采用现状与五类安全风险
PromptArmor 发布 WebMCP 说明,指出截至 2026 年 10 月 6 日,webmcp.com 登记了 2,959 个提供 WebMCP 工具的站点,Chrome、Edge、Brave 已通过 Origin trials 支持,ChatGPT 内置浏览器以 Site tools 形式支持,Cloudflare 的 Browser Run 与 Shopify 也已接入。WebMCP 工具像传统 MCP 工具一样定义名称、描述、输入与读写能力提示,但由网站页面直接提供给正在访问的智能体,智能体调用工具而非模拟点击界面。
2 条报道 · 1 个来源
- promptarmor.comPromptArmor 解析 WebMCP 的采用现状与安全风险原文
- promptarmor.comPromptArmor 解析 WebMCP:采用现状与五类安全风险原文
The Hacker News · 收录 · 原文 关注度1717 什么是智能体渗透测试?它能证明什么,又在哪里止步
Picus 指出,智能体渗透测试能通过实际执行漏洞利用证明单个暴露点是否可利用,并验证从初始访问到权限提升、横向移动的完整攻击链。但该方法存在速度与覆盖两大局限:25 万端点规模的完整扫描需数周,而 2026 年披露到利用的平均时间已从 2025 年的 21.5 天缩短至 8 小时;受安全与稳定性限制,真实漏洞利用只能覆盖典型企业约 20% 至 30% 的可利用面。
Hugging Face Daily Papers · 收录 · 原文 论文关注度4242 DAEDALUS:用自生成任务自举 Agent 记忆
DAEDALUS 提出一种无需既有任务或 oracle 验证器、从自生成练习中自举可复用 Agent 记忆的方法。它让 explorer 智能体与环境交互生成有难度但可解的任务,solver 智能体尝试求解,每次失败后提炼启发式规则,只有 solver 在上下文中反复成功后才被接受,这些结果同时反馈给 explorer 调整后续任务难度,被接受的启发式规则汇入记忆库供测试时使用。在 AppWorld、τ^2-bench 和 AutomationBench 上,DAEDALUS 相比无记忆基线平均成功率最高提升 15.9 个百分点,pass^5 最高提升 2.2 倍,与使用训练任务的方法相当,推理成本低于多数方法。消融实验显示 solver 轨迹是提炼有效启发式的关键信息,且较小的探索预算即可带来性能提升,其启发式规则也能帮助其他模型族的智能体。
论文追踪 · 收录 · 原文 日期未知论文关注度5050 SBW:面向 LLM 智能体的语义行为水印方法
研究者提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分桶替代公开簇分桶,在随机预言机模型下证明新桶分配不可预测。此前三种智能体水印方案都绑定精确动作符号,仅改写观测即可让 AgentMark 的比特恢复率降至 16.8%。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench(每模型 600 条轨迹)在 1% FPR 下改写检测率为 0.49-0.66,精确符号方案为 0.05-0.17;ALFWorld(每模型 100 个回合)为 0.92-0.97 对 0.00-0.01。带密钥分桶把自适应伪造从 100% 降到假阳性下限。作者指出该保证不覆盖的边界:对抗者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,作为开放问题报告。
arXiv · 收录 · 原文 日期未知论文关注度3232 NetAgent:面向多任务网络流量分析的智能体框架
NetAgent 是首个用于多任务流量分析的智能体框架,无需任务特定训练即可完成复杂任务理解、动态分解编排与长时程分析。它包含知识增强的工作流规划、150+ 工具的动作空间、统一代码执行空间、三层记忆以及沙箱与运行时修复五项设计。在 9 个基准上,NetAgent 在几乎所有任务上超越 23 个单任务和 5 个多任务基线,对未见流量分布的 F1 达 90.04%,而最佳基线仅为 2.74% 和 3.04%。
Zero Day Initiative · 收录 · 原文 关注度2323 Pwn2Own Ireland 2026 公布新目标与类别
Pwn2Own Ireland 2026 将于 10 月 6-9 日在科克举行,新增医疗健康设备与 AI 基础设施等类别,并把编码智能体(vibe coding 工具)纳入目标。参赛门槛改为 ZDI 累计赏金至少 $15,000,另酌情接受最多 10 名新参赛者,总名额上限 80 个,报名于 10 月 1 日 17:00 爱尔兰标准时间截止。手机、打印机、WhatsApp 等类别继续保留,AI 基础设施攻击须从参赛者笔记本电脑发起。
Hugging Face Daily Papers · 收录 · 原文 论文关注度3434 Jev 预注册测试:智能体记忆何时该用选择替代抽取?
一项预注册研究在 LoCoMo 与 LongMemEval 上测试智能体记忆:在 LoCoMo 的紧预算下,由类型化决策模型 Jev 单次调用选出的原始对话轮次,不劣于 LLM 抽取式记忆(单侧 95% 界为 -3.0 分,非劣效界为 -5 分),且写入成本低 3,061 倍。重排序收益随预算增大而缩小:保留 30 个候选中的 3 个时在 LoCoMo 加 17.4 分、LongMemEval 加 9.1 分,预算宽松时仅加 1.5 和 1.1 分,此时抽取式系统更准。相同上下文下 Jev 选择精度与 LLM 重排序器相当(非劣效界 -2.0),延迟仅为其三分之一,且优于多次调用的图遍历;重排序会降低正确弃答率。
Hugging Face Daily Papers · 收录 · 原文 论文关注度2222 从蒸馏私有健康记录中智能体发现血液生物标志物
研究将 Clalit Health Services 逾 540 万患者记录蒸馏为已发布的评分工具:针对 13 种免疫介导疾病,在数据边界内训练图注意力网络预测候选 CBC 表达式的病例对照 AUC,仅发布训练权重。外部验证中,智能体发现的表达式较文献种子起点 AUC 中位数提升 4.18 个百分点,在三个独立队列中对三种前沿研究工具候选重排序多数优于其首选。
论文追踪 · 收录 · 原文 论文精选关注度5757 AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击
圣加仑大学等机构的研究者提出 AgentSpy,在隔离环境(Firecracker microVM)中从操作系统边界记录 Agent 及其所有子进程的系统调用与网络流量,不依赖 Agent 自身的轨迹记录。它提供两类确定性分析:可靠性分析把每次执行汇总为星形图,统计执行的命令、读写的文件和访问的主机,并计算多次运行的相似度与技能覆盖率;安全分析则用规则检查读取私钥、越界修改文件、运行不可信程序、连接不可信域名等禁止行为。在 SkillsBench 的 77 个任务、codex harness 与三个模型上,同一任务的重复运行比混入其他任务的运行更相似的比例为 92.2%;在三次运行均通过测试的任务中,18% 出现与任务无关的活动,7% 读取了评分文件,17% 未使用开发者提供的技能指引。
推荐理由AgentSpy 在系统调用层记录 Agent 及其子进程行为,并给出可靠性分析与安全规则两套确定性分析,可对照其评测结果评估自身 Agent 的可观测性方案。
Cryptopolitan · 收录 · 原文 日期未知关注度3838 Google 的 AI 智能体 PageBreak 在自家 Web 应用中发现 500 多个 XSS 漏洞
Google 产品安全团队披露,其自研 AI 智能体 PageBreak 已在 Google 自研 Web 应用中验证出 500 多个跨站脚本(XSS)漏洞,而在基于高保障 Web 框架构建的数百个应用中仅发现 2 个,且这 2 个都位于未完全加固的内部应用或调试端点。PageBreak 的扫描主要由 Gemini 3.1 Pro 和 Gemini 3.5 Flash 完成,其关键机制是每个疑似漏洞都会交给专用验证器,对运行中的应用实例实际注入 JavaScript payload 并确认脚本是否执行,只有可复现的漏洞才会被标记。除 XSS 外,验证器还测试数据库查询注入、路径遍历泄露和代码执行。
3 条报道 · 3 个来源
- Dark ReadingGoogle 内部 AI Agent PageBreak 在自家 Web 应用中发现 500 多个漏洞原文
- CryptopolitanGoogle 的 AI 智能体 PageBreak 在自家 Web 应用中发现 500 多个 XSS 漏洞原文
- tl;dr secGoogle PageBreak 智能体扫描器、Perplexity 智能体安全工具与智能体化防御原文
AWS Security · 收录 · 原文 精选关注度4747 AWS 发布身份感知 AI 数据智能体方案,用 Lake Formation 与可信身份传播实现按用户授权
AWS 安全博客介绍了一种身份感知 AI 数据智能体方案,让数据智能体在查询 Lake Formation 治理的湖仓数据时按真实用户身份授权,无需改写现有治理策略。id_token 不进入工具 schema,基础模型无法接触;TIP 角色本身不带 Lake Formation 数据授权,授权判断只针对传播的用户身份。测试中两名用户提出同一问题,有授权的用户返回五条记录,无授权用户被拒绝,CloudTrail 的 AssumeRole 事件通过 onBehalfOf 记录真实用户。
推荐理由AWS 给出让 AI 数据智能体按真实用户身份查询湖仓的可部署方案,身份令牌全程绕开基础模型。
Scale AI Research Blog · 收录 · 原文 关注度3737 Scale AI 开源 AgentEnv:用于构建 RL 环境的框架
Scale AI 开源了其内部用于构建强化学习环境的框架 AgentEnv,该框架此前支撑其所有 RL 环境。AgentEnv 以环境为起点,将环境拆分为可版本化的组合模块,包括 Slack、Gmail 等环境、填充数据 Artifact 以及时钟、触发器和角色等 Rules,并通过开放协议实现互操作。环境卡(Environment Card)作为 AgentEnv Environment Protocol 的一部分,声明环境提供的工具及访问方式,智能体可经 MCP、REST 或生成的 CLI 调用;配合 A2A 协议的 Agent Card,同一任务可在 Claude Code、OpenAI 的智能体或自定义智能体上运行。官方同时给出 OpenCiv3、Minecraft/Catan/Poker 和 iOS 移动端等插件示例。
论文追踪 · 收录 · 原文 论文关注度5252 Inspect Robots:面向具身智能体评测的开源模块化框架
研究者发布开源框架 Inspect Robots,用于开发和运行具身智能体的评测。该框架提供可定制、可复用的抽象来定义物理评测并分析结果,同时配套自动化完成评测搭建、执行与终止的基础设施。作者用它评测了六个基于前沿语言模型的策略的能力与安全性。框架发布后三个月内下载量接近 10 万次,论文投稿至 CoRL 2026 的 The Science of Physical AI Safety(SPAIS)Workshop。
OWASP GenAI Security Project · 收录 · 原文 关注度4444 OWASP 发布 LLM 应用十大安全风险 2026 版
OWASP GenAI Security Project 发布《OWASP Top 10 for LLM Applications 2026》,这是面向大语言模型应用最关键安全风险的社区驱动指南。该版本由数百名 AI 安全专家参与编写,更新了风险排名、扩展了威胁覆盖范围,并基于数千起真实 AI 安全事件给出新研究。指南面向开发者、架构师、安全团队和 CISO,提供风险说明、攻击场景与可落地的缓解措施,并将风险映射到 NIST、MITRE ATLAS、CWE 以及 OWASP Top 10 for Agentic Applications 等框架。
AISecHub@AISecHub · 收录 · 原文 关注度3535 VulnHunter 发布智能体 AI 安全扫描器,可自动发现并修复漏洞
一款名为 VulnHunter 的智能体 AI 安全扫描器已在 GitHub 发布。据其页面介绍,该工具以对抗视角搜寻可利用漏洞,通过可执行 PoC 验证漏洞,并以测试优先的方式修复。它是 Capital One VulnHunter 的维护分支,已针对各类智能体框架重新构建。
Kenodo · 收录 · 原文 关注度3434 提示注入:如何真正保护 LLM 应用免受其害
提示注入连续两版位居 OWASP LLM 应用 Top 10 风险榜首,且无法像 SQL 注入那样靠参数化查询一次性修补,因为它利用的是模型本身无法区分"开发者指令"与"读到的文本"这一设计特性。直接提示注入是用户在聊天框输入覆盖指令,间接提示注入则是模型处理工单、邮件、网页等不可信外部内容时执行其中夹带的指令,后者更危险。有效防御在提示词之外:结构化分离指令与数据、工具最小权限、对有副作用的操作引入人工确认。
promptfoo · 收录 · 原文 关注度2121 promptfoo 0.124.0 发布:新增 Claude Opus 5.5、Sonnet 5.5、GPT-6 Sol/Luna 与 Grok 4.7 支持
promptfoo 发布 0.124.0,新增 Claude Opus 5.5、Claude Sonnet 5.5、GPT-6 Sol 和 Luna、GPT-6.1 Sol 及 Grok 4.7 等模型支持,并加入 OpenAI 安全标识符。该版本含破坏性变更:移除托管 ChatKit provider,WatsonX、Langfuse、Slack、Codex Security、本地 Transformers 等 SDK 改为按需安装。同时修复断言评分、CLI 退出码与 Cloud 登录等问题,并将 MCP SDK 升级至 1.32.0 以修复重定向安全问题。
Coalition for Secure AI(CoSAI) · 收录 · 原文 关注度4444 CoSAI 发布 AIMM:AI/ML 供应链信任与溯源的三级成熟度模型
CoSAI Workstream 1 发布 Artifact Integrity Maturity Model(AIMM),一个面向 AI/ML 供应链信任与溯源的风险分级框架,用于回答某个用例需要多少签名、溯源与证明基础设施。AIMM 设三级:Level 1 基本制品完整性,生产方在发布边界对制品做哈希与签名,消费方在进入流水线前重算哈希并验签;Level 2 溯源与谱系,增加签名溯源声明和制品与变换之间的可验证谱系,便于在上游漏洞披露后定位受影响的下游制品;Level 3 面向策略自动化的结构化证明,由策略引擎评估并用于准入决策,适用于受监管行业和高风险场景。AIMM 明确签名与证明只能确立完整性、真实性、溯源和策略证据,不保证制品正确、安全或公平,且完全自动化的策略执行在许多环境中仍属目标,多数组织会先采用机器可评估证据加人工复核的混合方式。
crypto.news · 收录 · 原文 关注度3232 Google PageBreak AI 安全智能体发现超 500 个 XSS 漏洞
Google 披露其 PageBreak AI 安全智能体在自家 Web 应用中发现了 500 多个跨站脚本(XSS)漏洞。该智能体主要使用 Gemini 3.1 Pro 和 Gemini 3.5 Flash 扫描,并通过独立验证器插入 JavaScript payload 实测脚本是否执行,将误报率控制在接近零。截至 9 月 4 日,基于 Google 高保障框架构建的应用中仅发现 2 个 XSS 漏洞,且均限于内部应用或调试端点。Google 计划将 PageBreak 与生成修复代码的 CodeMender 更紧密集成。
Decrypt · 收录 · 原文 关注度4242 Google 披露内部 AI Agent PageBreak,已发现 500 多个 XSS 漏洞
Google 产品安全团队披露内部 AI Agent PageBreak,用于自动测试自家 Web 应用的安全,已发现 500 多个 XSS 漏洞。该 Agent 基于 Gemini 模型,发现疑似漏洞后会交给专门的验证器,在运行中的应用副本上实际尝试利用,确认可用后才上报,因此误报率接近零。在采用高保障 Web 框架、从结构上消除整类漏洞的应用上,PageBreak 只找到 2 个漏洞。Google 表示 PageBreak 依赖其统一代码库和多年内部扫描基础设施,小型创业公司难以直接复制,下一步将把它与自动修复 Agent CodeMender 连接,让确认的漏洞附带修复方案供工程师审核。
Google · 收录 · 原文 关注度4343 Google 披露 PageBreak 项目:用确定性验证的 AI Agent 扫描漏洞
Google 产品安全团队公开了内部 AI Agent 扫描器 PageBreak 的架构与运行结果,该工具用于测试 Google 一方 Web 应用的安全性。PageBreak 于 2025 年 11 月试点、2026 年 1 月转为正式项目,主要基于 Gemini 3.1 Pro 或 Gemini 3.5 Flash 等模型运行。其核心设计是优先采用确定性验证:Agent 提出漏洞假设后,交由非 AI 编写的专用验证器在真实运行环境中执行载荷确认,从而将误报率降至接近零。Google 称已大规模运行 PageBreak,在自家一方 Web 应用中发现超过 500 个 XSS 漏洞。验证器按漏洞类型区分,覆盖 XSS、SQL 注入、路径遍历、远程代码执行和 SSRF 等。
Adversa AI · 收录 · 原文 精选关注度5555 Adversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项
Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码,Claude Code、Codex、GitHub Copilot 和 Gemini CLI 的固定插件提交可在自动更新时被静默替换,仓库子代理配置可让 Claude Code 运行 C2 载荷。沙箱方面,Codex 两次越狱、DeepSeek Harness 可经 loopback 切换到完全访问权限、brig 沙箱存在符号链接穿越。
2 条报道 · 1 个来源
- Adversa AIAdversa AI 汇总 2026 年 10 月 AI Agent 安全资源 49 项原文
- Adversa AIAdversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项原文
推荐理由按月汇总 26 项编码 Agent 安全资源,把攻击、漏洞、事件与防御按主题归类,便于团队对照排查自身 harness 风险。
论文追踪 · 收录 · 原文 论文关注度3737 SideKernel:面向 macOS 上 AI 编码 Agent 的 microVM 沙箱
佐治亚理工的一项硕士安全实践项目提出 SideKernel,一个面向 AI 编码 Agent 的开源本地 microVM macOS 沙箱,目标是提升可用性。作者先做在线用户调研,发现不到 40% 的 AI 编码 Agent 用户会在沙箱中运行 Agent,并归纳出阻碍沙箱采用的主要可用性障碍。随后作者按五项纳入标准筛选市面上的沙箱,围绕调研得出的 23 项能力测试,将 SideKernel 与符合条件的沙箱做对比分析,结果显示只有少数沙箱与 SideKernel 类似,其中 Docker Sandboxes 与 SideKernel 在可用性相关能力上得分最高。论文的另一项贡献是梳理本地、开源、基于 microVM 的 macOS AI 编码 Agent 沙箱现有方案。
PPC Land · 收录 · 原文 关注度4848 MLCommons 发布 Agent Privacy Risk Taxonomy 初稿,列出 25 项智能体隐私风险
MLCommons 于 10 月 1 日发布 Agent Privacy Risk Taxonomy 的 v0.1 初稿,将自主智能体处理个人信息的方式归为五大领域下的 25 个编号风险向量,并配套一套从触发条件追溯到下游伤害的六阶段评估方法。文档共 15 页,由隐私与保密工作组撰写,列出 19 位作者,封面日期为 2026 年 9 月。五大领域中,数据摄取占 7 个向量,聚合、使用与共享占 9 个,跨智能体实践 3 个,传统同意机制失效 4 个,问责与治理 2 个。文档指出既有隐私框架假设数据流确定、存储集中、边界清晰,而智能体会执行代码、跨会话保留记忆并调用外部工具,因此这些框架需要扩展而非替换。附录按 GDPR、HIPAA、CCPA 和 CPRA 定义了四类敏感数据,并区分可精确匹配的句法型与基于语义的模糊型。
Microsoft Research · 收录 · 原文 精选关注度5353 微软研究院开源 Orchard:面向可扩展 Agent 训练与评测的环境框架
微软研究院发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,用于跨任务域训练和评测 Agent,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。团队同时放出三条训练配方:Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,加入 value-model 重排序后为 73.0%,模型约 3B 激活参数;Orchard-GUI 用 4B 视觉语言模型在 WebVoyager、Online-Mind2Web、DeepShop 上平均 68.4%;Orchard-Claw 仅用 200 个合成任务训练,在 Claw-Eval 上三次尝试内完成 59.6%,搭配 ZeroClaw 提升至 73.9%。项目还开源了训练数据与评测方法。
推荐理由微软研究院开源了可复用的 Agent 环境服务与三条训练配方,并给出小模型在 SWE-bench Verified 等基准上的具体成绩,可供做 Agent 训练与评测的团队参考。
Pillar Security · 收录 · 原文 日期未知关注度3131 AI 网关护栏 2026:如何保护 LiteLLM、Kong、TrueFoundry 与 Agent Router(附 12 家护栏提供商对比)
一份指南梳理了 LiteLLM、Kong、TrueFoundry、Agent Router 等主流 AI 网关的护栏接入机制,并围绕同样八个问题对比了 12 家护栏提供商。LiteLLM 的 Generic Guardrail API 支持 45 家护栏提供商,Kong 提供 10 个 AI 护栏插件,TrueFoundry 开放输入、输出及 MCP 工具调用前后的钩子并接入 20 多家外部提供商。指南提醒 TrueFoundry 的输出护栏不作用于流式响应,且只读用户消息的护栏会漏掉工具结果或 MCP 描述中的注入。
1 条报道 · 1 个来源
查看事件时间线与全部报道论文追踪 · 收录 · 原文 论文关注度2828 IACM-RL:面向动态意图波动下复杂工具调用的意图感知上下文管理与强化学习
IACM-RL 框架通过 BeliefState 自生成上下文管理器主动追踪目标变化,并用结构化过期标记隔离被覆盖的参数,以分层意图驱动奖励加三项辅助损失优化策略。作者同时提出 DynamicIntent 流水线,覆盖 13 种细粒度意图波动场景并配套五维诊断指标。在 DynamicIntent、BFCL-V3 和 τ²-Bench 上,IACM-RL 显著优于基线,减少无限 API 循环与过期上下文错误,并提升域外泛化能力。
OWASP AI Exchange · 收录 · 原文 关注度4141 OWASP AI Exchange 为 RAG 检索范围强制加入无模型回归测试
OWASP AI Exchange 在 RAG 安全测试指南中新增了检索范围强制(retrieval-scope enforcement)的无模型回归测试方法,该测试不依赖模型参与,输入与判定都是确定性的。方法要求把身份建模为 subject、tenant 与 roles,并在文档和 chunk 两个粒度上定义授权范围,访问文档中一个 chunk 不代表可访问其余部分;租户隔离需独立于文档标识符校验,避免返回了正确文档却属于错误租户。测试通过薄适配器驱动检索器并断言检索到的 chunk 而非生成答案,从而可复用于任意向量库或搜索索引;测试以多步序列表达,以验证角色降级、ACL 修改、权限撤销等状态变化在检索时生效。指南还建议用故意存在漏洞的 fixture 后端验证测试套件确实能检出所声称的违规,并链接了外部参考实现 retrieval-scope-tester。
论文追踪 · 收录 · 原文 论文关注度4343 论文提出提示注入的七组件结构化分析模型
Jeremy McHugh 在 arXiv 发表论文,提出用七组件模型结构化描述提示注入,取代逐字记录攻击字符串的做法。模型包含载体、投递向量、隐藏方式、上下文破坏、权限提升、载荷和回传通道七个组件,其中五个属于攻击产物字段、两个属于环境字段。作者认为大语言模型会把不同自然语言表述编译为相同可执行动作,因此标注应追踪攻击者意图(工具目标、sink 与效果)而非表面措辞。该框架整合了 HOUYI 的载荷分解、Promptware Kill Chain 与攻击活动分类法,并把 ReNeLLM 等最小越狱框架视为受限子空间上的投影。论文给出标注规则、可直接映射到行业 CTI schema 的逻辑分析记录,以及 EchoLeak(CVE-2025-32711)和野外恶意软件 AI 规避样本等示例。
论文追踪 · 收录 · 原文 论文关注度4141 研究提出人机审计协作框架 HAAC,并在对话购物 Agent 上验证
研究者提出 Human-Agent Audit Collaboration(HAAC)工作流与系统,用于在 AI 审计中划分人与 AI 智能体的分工,让智能体承担探索、评估、报告和复核,同时在需要情境判断的环节保留人类监督。团队将该框架实例化到对话购物 Agent 上并开展两项研究:71 名审计员的实验显示,AI 辅助提高了攻击成功率并扩大了探索范围,同时也影响了后续攻击方式,并增加了审计员对 AI 生成评估与报告的依赖。对负责任 AI 从业者的访谈表明,可落地的审计需要覆盖范围可见、攻击轨迹可复现,以及对审计智能体本身进行评估。
论文追踪 · 收录 · 原文 论文关注度3535 JEV 作为智能体轨迹安全评判器:与生成式 LLM 评判器的实证对比
研究对比了类型化决策模型 JEV 与四个生成式 LLM 评判器在智能体轨迹安全分类上的表现,测试覆盖四个基准共 5,219 条轨迹。JEV 的基准平均正类 F1 为 77.8,高于最强生成式配置 GLM-5.2 的 74.1,有效结果覆盖率分别为 95.5% 和 94.4%。JEV 在 ATBench500 和 MCPHunt 上领先,GLM 在 R-Judge 和 TraceSafe 上领先;JEV 成功调用延迟中位数 0.99 秒,每次有效判断的 token 成本平均约 $0.000195。
MCP Python SDK · 收录 · 原文 关注度6060 MCP Python SDK v2.3.0 发布:修复为主,新增三项配置选项
MCP Python SDK 发布 v2.3.0,以修复为主并新增三项选项。带无效 x-mcp-header 注解的工具现在会在注册时抛出 InvalidSignature,此前服务器会正常启动但 2026-07-28 客户端会静默丢弃该工具;空 _meta 与 params 不再随请求发送,避免部分服务器拒绝。新增 max_sse_event_size 选项(默认仍为每 SSE 事件 1 MiB),MCPServer(subscriptions=False) 可停止提供 subscriptions/listen,Client.call_tool 在 HeaderMismatch(-32020)后重新列出工具并重试一次。
Snyk Labs(AI Threat Labs,含原 Invariant Labs) · 收录 · 原文 日期未知关注度3636 Snyk Labs 解读 MAESTRO:面向 Agentic AI 生态的分层威胁建模框架
Snyk Labs 介绍了由云安全联盟(Cloud Security Alliance)联合 AI 安全研究者开发的 MAESTRO 框架,用于对多智能体 AI 生态做分层威胁建模。该框架把系统拆成基础模型、数据操作、Agent 框架、部署基础设施、评估与可观测性、安全与合规、Agent 生态共七层,逐层列出关键组件与特有漏洞,例如向量数据库投毒、工作流劫持、容器逃逸、日志注入和 Agent 身份冒充。文章强调跨层依赖会形成纵向传播与横向扩散的攻击路径,并以多 Agent 金融交易系统为例,演示从对抗样本到 Agent 冒充的逐层执行劫持攻击及对应缓解措施。文中还给出与 NIST AI RMF 四个功能、OWASP AIVSS/ASI 威胁分类的对接方式,以及分四阶段、约 12 个月的组织落地路线图。
Snyk Labs(AI Threat Labs,含原 Invariant Labs) · 收录 · 原文 日期未知精选关注度5151 Snyk 推出 Agent Scan - Skill Inspector,免费扫描 Agent 技能中的恶意行为
Snyk Labs 发布 Agent Scan - Skill Inspector,一个免费的自助网站,可在安装或本地运行前扫描 Agent 技能的风险、暴露面与恶意行为。团队对主流市场的 3,984 个技能做了分析,确认 76 个恶意技能,13.4% 的技能至少含一个严重级别问题,36.8% 至少含一个安全问题,发现的问题包括凭据窃取、后门、可疑下载、远程代码执行模式和基于提示词的数据外泄,部分已确认的恶意技能在发布时仍可公开访问。Agent Scan 将技能视为代码与自然语言指令(如 SKILL.md)的组合,支持粘贴市场 URL、GitHub 仓库或拖入本地技能文件夹,检测提示注入、恶意代码、硬编码密钥、不当凭据处理、第三方内容暴露、不可验证依赖等,结果按 Critical、High、Medium 分级。
推荐理由Snyk 对 3,984 个 Agent 技能的大规模扫描数据,为评估技能市场供应链风险提供了可参照的基线。
Mindgard Blog · 收录 · 原文 关注度3838 Mindgard 发布 AI Agent 安全指南:五类信任边界、六种攻击与红队加固方法
Mindgard 发布 AI Agent 安全指南,主张 Agent 有目标、工具、记忆、身份、其他 Agent 五个信任边界,无法靠清洗提示词来防护,控制点应放在边界而非模型内部。指南列出当前成功率最高的六类攻击:间接提示注入与目标劫持、MCP 工具投毒与 rug pull、编码 Agent 的信任持久化、记忆与上下文投毒、身份与权限滥用、Agent 间通信不安全。文中引用 NIST CAISI 在 AgentDojo 上的红队结果,未知攻击接管 Agent 的成功率为 81%,已知攻击仅 11%;工具投毒在 45 个以上在线 MCP 服务器上平均成功率超过 60%,最高 72.8%。
Lakera Blog · 收录 · 原文 日期未知关注度44 Lakera 与 Check Point 推出 READY OR NOT:AI 企业安全 5 场系列网络研讨会
Lakera 与 Check Point 联合推出 READY OR NOT 五场系列网络研讨会,聚焦企业 AI 安全就绪的实践落地。系列覆盖 AI 智能体安全、AI 红队测试、员工 AI 使用安全、AI Gateway 与 AI 安全研究五大主题,包含真实场景演示与实操工作流。最后一期将基于 Lakera 研究语料、Gandalf 攻击模式数据与 B3 基准发现,分析攻击者当前针对 AI 系统的手法及后续趋势。