Pwn2Own Ireland 2026 公布新目标与类别
Pwn2Own Ireland 2026 将于 10 月 6-9 日在科克举行,新增医疗健康设备与 AI 基础设施等类别,并把编码智能体(vibe coding 工具)纳入目标。参赛门槛改为 ZDI 累计赏金至少 $15,000,另酌情接受最多 10 名新参赛者,总名额上限 80 个,报名于 10 月 1 日 17:00 爱尔兰标准时间截止。手机、打印机、WhatsApp 等类别继续保留,AI 基础设施攻击须从参赛者笔记本电脑发起。
Pwn2Own Ireland 2026 将于 10 月 6-9 日在科克举行,新增医疗健康设备与 AI 基础设施等类别,并把编码智能体(vibe coding 工具)纳入目标。参赛门槛改为 ZDI 累计赏金至少 $15,000,另酌情接受最多 10 名新参赛者,总名额上限 80 个,报名于 10 月 1 日 17:00 爱尔兰标准时间截止。手机、打印机、WhatsApp 等类别继续保留,AI 基础设施攻击须从参赛者笔记本电脑发起。
一项预注册研究在 LoCoMo 与 LongMemEval 上测试智能体记忆:在 LoCoMo 的紧预算下,由类型化决策模型 Jev 单次调用选出的原始对话轮次,不劣于 LLM 抽取式记忆(单侧 95% 界为 -3.0 分,非劣效界为 -5 分),且写入成本低 3,061 倍。重排序收益随预算增大而缩小:保留 30 个候选中的 3 个时在 LoCoMo 加 17.4 分、LongMemEval 加 9.1 分,预算宽松时仅加 1.5 和 1.1 分,此时抽取式系统更准。相同上下文下 Jev 选择精度与 LLM 重排序器相当(非劣效界 -2.0),延迟仅为其三分之一,且优于多次调用的图遍历;重排序会降低正确弃答率。
研究将 Clalit Health Services 逾 540 万患者记录蒸馏为已发布的评分工具:针对 13 种免疫介导疾病,在数据边界内训练图注意力网络预测候选 CBC 表达式的病例对照 AUC,仅发布训练权重。外部验证中,智能体发现的表达式较文献种子起点 AUC 中位数提升 4.18 个百分点,在三个独立队列中对三种前沿研究工具候选重排序多数优于其首选。
圣加仑大学等机构的研究者提出 AgentSpy,在隔离环境(Firecracker microVM)中从操作系统边界记录 Agent 及其所有子进程的系统调用与网络流量,不依赖 Agent 自身的轨迹记录。它提供两类确定性分析:可靠性分析把每次执行汇总为星形图,统计执行的命令、读写的文件和访问的主机,并计算多次运行的相似度与技能覆盖率;安全分析则用规则检查读取私钥、越界修改文件、运行不可信程序、连接不可信域名等禁止行为。在 SkillsBench 的 77 个任务、codex harness 与三个模型上,同一任务的重复运行比混入其他任务的运行更相似的比例为 92.2%;在三次运行均通过测试的任务中,18% 出现与任务无关的活动,7% 读取了评分文件,17% 未使用开发者提供的技能指引。
推荐理由AgentSpy 在系统调用层记录 Agent 及其子进程行为,并给出可靠性分析与安全规则两套确定性分析,可对照其评测结果评估自身 Agent 的可观测性方案。
Google 产品安全团队披露,其自研 AI 智能体 PageBreak 已在 Google 自研 Web 应用中验证出 500 多个跨站脚本(XSS)漏洞,而在基于高保障 Web 框架构建的数百个应用中仅发现 2 个,且这 2 个都位于未完全加固的内部应用或调试端点。PageBreak 的扫描主要由 Gemini 3.1 Pro 和 Gemini 3.5 Flash 完成,其关键机制是每个疑似漏洞都会交给专用验证器,对运行中的应用实例实际注入 JavaScript payload 并确认脚本是否执行,只有可复现的漏洞才会被标记。除 XSS 外,验证器还测试数据库查询注入、路径遍历泄露和代码执行。
AWS 安全博客介绍了一种身份感知 AI 数据智能体方案,让数据智能体在查询 Lake Formation 治理的湖仓数据时按真实用户身份授权,无需改写现有治理策略。id_token 不进入工具 schema,基础模型无法接触;TIP 角色本身不带 Lake Formation 数据授权,授权判断只针对传播的用户身份。测试中两名用户提出同一问题,有授权的用户返回五条记录,无授权用户被拒绝,CloudTrail 的 AssumeRole 事件通过 onBehalfOf 记录真实用户。
推荐理由AWS 给出让 AI 数据智能体按真实用户身份查询湖仓的可部署方案,身份令牌全程绕开基础模型。
Scale AI 开源了其内部用于构建强化学习环境的框架 AgentEnv,该框架此前支撑其所有 RL 环境。AgentEnv 以环境为起点,将环境拆分为可版本化的组合模块,包括 Slack、Gmail 等环境、填充数据 Artifact 以及时钟、触发器和角色等 Rules,并通过开放协议实现互操作。环境卡(Environment Card)作为 AgentEnv Environment Protocol 的一部分,声明环境提供的工具及访问方式,智能体可经 MCP、REST 或生成的 CLI 调用;配合 A2A 协议的 Agent Card,同一任务可在 Claude Code、OpenAI 的智能体或自定义智能体上运行。官方同时给出 OpenCiv3、Minecraft/Catan/Poker 和 iOS 移动端等插件示例。
研究者发布开源框架 Inspect Robots,用于开发和运行具身智能体的评测。该框架提供可定制、可复用的抽象来定义物理评测并分析结果,同时配套自动化完成评测搭建、执行与终止的基础设施。作者用它评测了六个基于前沿语言模型的策略的能力与安全性。框架发布后三个月内下载量接近 10 万次,论文投稿至 CoRL 2026 的 The Science of Physical AI Safety(SPAIS)Workshop。
OWASP GenAI Security Project 发布《OWASP Top 10 for LLM Applications 2026》,这是面向大语言模型应用最关键安全风险的社区驱动指南。该版本由数百名 AI 安全专家参与编写,更新了风险排名、扩展了威胁覆盖范围,并基于数千起真实 AI 安全事件给出新研究。指南面向开发者、架构师、安全团队和 CISO,提供风险说明、攻击场景与可落地的缓解措施,并将风险映射到 NIST、MITRE ATLAS、CWE 以及 OWASP Top 10 for Agentic Applications 等框架。
一款名为 VulnHunter 的智能体 AI 安全扫描器已在 GitHub 发布。据其页面介绍,该工具以对抗视角搜寻可利用漏洞,通过可执行 PoC 验证漏洞,并以测试优先的方式修复。它是 Capital One VulnHunter 的维护分支,已针对各类智能体框架重新构建。
提示注入连续两版位居 OWASP LLM 应用 Top 10 风险榜首,且无法像 SQL 注入那样靠参数化查询一次性修补,因为它利用的是模型本身无法区分"开发者指令"与"读到的文本"这一设计特性。直接提示注入是用户在聊天框输入覆盖指令,间接提示注入则是模型处理工单、邮件、网页等不可信外部内容时执行其中夹带的指令,后者更危险。有效防御在提示词之外:结构化分离指令与数据、工具最小权限、对有副作用的操作引入人工确认。
promptfoo 发布 0.124.0,新增 Claude Opus 5.5、Claude Sonnet 5.5、GPT-6 Sol 和 Luna、GPT-6.1 Sol 及 Grok 4.7 等模型支持,并加入 OpenAI 安全标识符。该版本含破坏性变更:移除托管 ChatKit provider,WatsonX、Langfuse、Slack、Codex Security、本地 Transformers 等 SDK 改为按需安装。同时修复断言评分、CLI 退出码与 Cloud 登录等问题,并将 MCP SDK 升级至 1.32.0 以修复重定向安全问题。
CoSAI Workstream 1 发布 Artifact Integrity Maturity Model(AIMM),一个面向 AI/ML 供应链信任与溯源的风险分级框架,用于回答某个用例需要多少签名、溯源与证明基础设施。AIMM 设三级:Level 1 基本制品完整性,生产方在发布边界对制品做哈希与签名,消费方在进入流水线前重算哈希并验签;Level 2 溯源与谱系,增加签名溯源声明和制品与变换之间的可验证谱系,便于在上游漏洞披露后定位受影响的下游制品;Level 3 面向策略自动化的结构化证明,由策略引擎评估并用于准入决策,适用于受监管行业和高风险场景。AIMM 明确签名与证明只能确立完整性、真实性、溯源和策略证据,不保证制品正确、安全或公平,且完全自动化的策略执行在许多环境中仍属目标,多数组织会先采用机器可评估证据加人工复核的混合方式。
Google 披露其 PageBreak AI 安全智能体在自家 Web 应用中发现了 500 多个跨站脚本(XSS)漏洞。该智能体主要使用 Gemini 3.1 Pro 和 Gemini 3.5 Flash 扫描,并通过独立验证器插入 JavaScript payload 实测脚本是否执行,将误报率控制在接近零。截至 9 月 4 日,基于 Google 高保障框架构建的应用中仅发现 2 个 XSS 漏洞,且均限于内部应用或调试端点。Google 计划将 PageBreak 与生成修复代码的 CodeMender 更紧密集成。
Google 产品安全团队披露内部 AI Agent PageBreak,用于自动测试自家 Web 应用的安全,已发现 500 多个 XSS 漏洞。该 Agent 基于 Gemini 模型,发现疑似漏洞后会交给专门的验证器,在运行中的应用副本上实际尝试利用,确认可用后才上报,因此误报率接近零。在采用高保障 Web 框架、从结构上消除整类漏洞的应用上,PageBreak 只找到 2 个漏洞。Google 表示 PageBreak 依赖其统一代码库和多年内部扫描基础设施,小型创业公司难以直接复制,下一步将把它与自动修复 Agent CodeMender 连接,让确认的漏洞附带修复方案供工程师审核。
Google 产品安全团队公开了内部 AI Agent 扫描器 PageBreak 的架构与运行结果,该工具用于测试 Google 一方 Web 应用的安全性。PageBreak 于 2025 年 11 月试点、2026 年 1 月转为正式项目,主要基于 Gemini 3.1 Pro 或 Gemini 3.5 Flash 等模型运行。其核心设计是优先采用确定性验证:Agent 提出漏洞假设后,交由非 AI 编写的专用验证器在真实运行环境中执行载荷确认,从而将误报率降至接近零。Google 称已大规模运行 PageBreak,在自家一方 Web 应用中发现超过 500 个 XSS 漏洞。验证器按漏洞类型区分,覆盖 XSS、SQL 注入、路径遍历、远程代码执行和 SSRF 等。
Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码,Claude Code、Codex、GitHub Copilot 和 Gemini CLI 的固定插件提交可在自动更新时被静默替换,仓库子代理配置可让 Claude Code 运行 C2 载荷。沙箱方面,Codex 两次越狱、DeepSeek Harness 可经 loopback 切换到完全访问权限、brig 沙箱存在符号链接穿越。
推荐理由按月汇总 26 项编码 Agent 安全资源,把攻击、漏洞、事件与防御按主题归类,便于团队对照排查自身 harness 风险。
佐治亚理工的一项硕士安全实践项目提出 SideKernel,一个面向 AI 编码 Agent 的开源本地 microVM macOS 沙箱,目标是提升可用性。作者先做在线用户调研,发现不到 40% 的 AI 编码 Agent 用户会在沙箱中运行 Agent,并归纳出阻碍沙箱采用的主要可用性障碍。随后作者按五项纳入标准筛选市面上的沙箱,围绕调研得出的 23 项能力测试,将 SideKernel 与符合条件的沙箱做对比分析,结果显示只有少数沙箱与 SideKernel 类似,其中 Docker Sandboxes 与 SideKernel 在可用性相关能力上得分最高。论文的另一项贡献是梳理本地、开源、基于 microVM 的 macOS AI 编码 Agent 沙箱现有方案。
MLCommons 于 10 月 1 日发布 Agent Privacy Risk Taxonomy 的 v0.1 初稿,将自主智能体处理个人信息的方式归为五大领域下的 25 个编号风险向量,并配套一套从触发条件追溯到下游伤害的六阶段评估方法。文档共 15 页,由隐私与保密工作组撰写,列出 19 位作者,封面日期为 2026 年 9 月。五大领域中,数据摄取占 7 个向量,聚合、使用与共享占 9 个,跨智能体实践 3 个,传统同意机制失效 4 个,问责与治理 2 个。文档指出既有隐私框架假设数据流确定、存储集中、边界清晰,而智能体会执行代码、跨会话保留记忆并调用外部工具,因此这些框架需要扩展而非替换。附录按 GDPR、HIPAA、CCPA 和 CPRA 定义了四类敏感数据,并区分可精确匹配的句法型与基于语义的模糊型。
微软研究院发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,用于跨任务域训练和评测 Agent,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。团队同时放出三条训练配方:Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,加入 value-model 重排序后为 73.0%,模型约 3B 激活参数;Orchard-GUI 用 4B 视觉语言模型在 WebVoyager、Online-Mind2Web、DeepShop 上平均 68.4%;Orchard-Claw 仅用 200 个合成任务训练,在 Claw-Eval 上三次尝试内完成 59.6%,搭配 ZeroClaw 提升至 73.9%。项目还开源了训练数据与评测方法。
推荐理由微软研究院开源了可复用的 Agent 环境服务与三条训练配方,并给出小模型在 SWE-bench Verified 等基准上的具体成绩,可供做 Agent 训练与评测的团队参考。
一份指南梳理了 LiteLLM、Kong、TrueFoundry、Agent Router 等主流 AI 网关的护栏接入机制,并围绕同样八个问题对比了 12 家护栏提供商。LiteLLM 的 Generic Guardrail API 支持 45 家护栏提供商,Kong 提供 10 个 AI 护栏插件,TrueFoundry 开放输入、输出及 MCP 工具调用前后的钩子并接入 20 多家外部提供商。指南提醒 TrueFoundry 的输出护栏不作用于流式响应,且只读用户消息的护栏会漏掉工具结果或 MCP 描述中的注入。
IACM-RL 框架通过 BeliefState 自生成上下文管理器主动追踪目标变化,并用结构化过期标记隔离被覆盖的参数,以分层意图驱动奖励加三项辅助损失优化策略。作者同时提出 DynamicIntent 流水线,覆盖 13 种细粒度意图波动场景并配套五维诊断指标。在 DynamicIntent、BFCL-V3 和 τ²-Bench 上,IACM-RL 显著优于基线,减少无限 API 循环与过期上下文错误,并提升域外泛化能力。
OWASP AI Exchange 在 RAG 安全测试指南中新增了检索范围强制(retrieval-scope enforcement)的无模型回归测试方法,该测试不依赖模型参与,输入与判定都是确定性的。方法要求把身份建模为 subject、tenant 与 roles,并在文档和 chunk 两个粒度上定义授权范围,访问文档中一个 chunk 不代表可访问其余部分;租户隔离需独立于文档标识符校验,避免返回了正确文档却属于错误租户。测试通过薄适配器驱动检索器并断言检索到的 chunk 而非生成答案,从而可复用于任意向量库或搜索索引;测试以多步序列表达,以验证角色降级、ACL 修改、权限撤销等状态变化在检索时生效。指南还建议用故意存在漏洞的 fixture 后端验证测试套件确实能检出所声称的违规,并链接了外部参考实现 retrieval-scope-tester。
Jeremy McHugh 在 arXiv 发表论文,提出用七组件模型结构化描述提示注入,取代逐字记录攻击字符串的做法。模型包含载体、投递向量、隐藏方式、上下文破坏、权限提升、载荷和回传通道七个组件,其中五个属于攻击产物字段、两个属于环境字段。作者认为大语言模型会把不同自然语言表述编译为相同可执行动作,因此标注应追踪攻击者意图(工具目标、sink 与效果)而非表面措辞。该框架整合了 HOUYI 的载荷分解、Promptware Kill Chain 与攻击活动分类法,并把 ReNeLLM 等最小越狱框架视为受限子空间上的投影。论文给出标注规则、可直接映射到行业 CTI schema 的逻辑分析记录,以及 EchoLeak(CVE-2025-32711)和野外恶意软件 AI 规避样本等示例。
研究者提出 Human-Agent Audit Collaboration(HAAC)工作流与系统,用于在 AI 审计中划分人与 AI 智能体的分工,让智能体承担探索、评估、报告和复核,同时在需要情境判断的环节保留人类监督。团队将该框架实例化到对话购物 Agent 上并开展两项研究:71 名审计员的实验显示,AI 辅助提高了攻击成功率并扩大了探索范围,同时也影响了后续攻击方式,并增加了审计员对 AI 生成评估与报告的依赖。对负责任 AI 从业者的访谈表明,可落地的审计需要覆盖范围可见、攻击轨迹可复现,以及对审计智能体本身进行评估。
研究对比了类型化决策模型 JEV 与四个生成式 LLM 评判器在智能体轨迹安全分类上的表现,测试覆盖四个基准共 5,219 条轨迹。JEV 的基准平均正类 F1 为 77.8,高于最强生成式配置 GLM-5.2 的 74.1,有效结果覆盖率分别为 95.5% 和 94.4%。JEV 在 ATBench500 和 MCPHunt 上领先,GLM 在 R-Judge 和 TraceSafe 上领先;JEV 成功调用延迟中位数 0.99 秒,每次有效判断的 token 成本平均约 $0.000195。
MCP Python SDK 发布 v2.3.0,以修复为主并新增三项选项。带无效 x-mcp-header 注解的工具现在会在注册时抛出 InvalidSignature,此前服务器会正常启动但 2026-07-28 客户端会静默丢弃该工具;空 _meta 与 params 不再随请求发送,避免部分服务器拒绝。新增 max_sse_event_size 选项(默认仍为每 SSE 事件 1 MiB),MCPServer(subscriptions=False) 可停止提供 subscriptions/listen,Client.call_tool 在 HeaderMismatch(-32020)后重新列出工具并重试一次。
Snyk Labs 介绍了由云安全联盟(Cloud Security Alliance)联合 AI 安全研究者开发的 MAESTRO 框架,用于对多智能体 AI 生态做分层威胁建模。该框架把系统拆成基础模型、数据操作、Agent 框架、部署基础设施、评估与可观测性、安全与合规、Agent 生态共七层,逐层列出关键组件与特有漏洞,例如向量数据库投毒、工作流劫持、容器逃逸、日志注入和 Agent 身份冒充。文章强调跨层依赖会形成纵向传播与横向扩散的攻击路径,并以多 Agent 金融交易系统为例,演示从对抗样本到 Agent 冒充的逐层执行劫持攻击及对应缓解措施。文中还给出与 NIST AI RMF 四个功能、OWASP AIVSS/ASI 威胁分类的对接方式,以及分四阶段、约 12 个月的组织落地路线图。
Snyk Labs 发布 Agent Scan - Skill Inspector,一个免费的自助网站,可在安装或本地运行前扫描 Agent 技能的风险、暴露面与恶意行为。团队对主流市场的 3,984 个技能做了分析,确认 76 个恶意技能,13.4% 的技能至少含一个严重级别问题,36.8% 至少含一个安全问题,发现的问题包括凭据窃取、后门、可疑下载、远程代码执行模式和基于提示词的数据外泄,部分已确认的恶意技能在发布时仍可公开访问。Agent Scan 将技能视为代码与自然语言指令(如 SKILL.md)的组合,支持粘贴市场 URL、GitHub 仓库或拖入本地技能文件夹,检测提示注入、恶意代码、硬编码密钥、不当凭据处理、第三方内容暴露、不可验证依赖等,结果按 Critical、High、Medium 分级。
推荐理由Snyk 对 3,984 个 Agent 技能的大规模扫描数据,为评估技能市场供应链风险提供了可参照的基线。
Mindgard 发布 AI Agent 安全指南,主张 Agent 有目标、工具、记忆、身份、其他 Agent 五个信任边界,无法靠清洗提示词来防护,控制点应放在边界而非模型内部。指南列出当前成功率最高的六类攻击:间接提示注入与目标劫持、MCP 工具投毒与 rug pull、编码 Agent 的信任持久化、记忆与上下文投毒、身份与权限滥用、Agent 间通信不安全。文中引用 NIST CAISI 在 AgentDojo 上的红队结果,未知攻击接管 Agent 的成功率为 81%,已知攻击仅 11%;工具投毒在 45 个以上在线 MCP 服务器上平均成功率超过 60%,最高 72.8%。
Lakera 与 Check Point 联合推出 READY OR NOT 五场系列网络研讨会,聚焦企业 AI 安全就绪的实践落地。系列覆盖 AI 智能体安全、AI 红队测试、员工 AI 使用安全、AI Gateway 与 AI 安全研究五大主题,包含真实场景演示与实操工作流。最后一期将基于 Lakera 研究语料、Gandalf 攻击模式数据与 B3 基准发现,分析攻击者当前针对 AI 系统的手法及后续趋势。
间接提示注入是把隐藏指令嵌入 AI 后续会读取的内容中,攻击者不接触提示框,模型在浏览网页、解析 PDF、加载 MCP 工具描述或读取记忆时把恶意文本当成指令执行。按 OWASP Top 10 for LLM Applications,这类攻击在不可信数据与可信系统指令混入同一上下文窗口时得手,可导致数据泄露、输出被操纵或触发有害工具调用。Perplexity 的 Comet 功能曾因 Reddit 帖子中的不可见文本泄露用户一次性密码;Lakera 的 Gandalf: Agent Breaker 还给出 Trippy Planner、OmniChat Desktop、PortfolioIQ Advisor、Curs-ed CodeReview、MindfulChat 等场景。
2026 年企业级 AI 红队供应商的评判标准,是测试已部署系统而非仅测试底层模型、每次发布都重跑测试、并给出执行证据而非分数。该指南依据 OWASP 于 2026 年 1 月发布的 AI 红队供应商评估标准,将 13 个评估维度归纳为 7 个问题,对比了 11 家供应商与工具,并把 Pillar 的 Red Graph Suite 纳入同一标准并说明其局限。文中指出,平均一次成功攻击需 5 轮对话,生产环境中 90% 的成功攻击导致数据泄露。
一份面向企业的 AI 编程智能体安全工具评测,用同一套八个问题对比了十三款工具,并按使用发现、智能体清点、配置态势、行动前控制四个层面归类。文章指出发现智能体不等于保护智能体,配置事实藏在智能体自身设置文件中,EDR 无法建模;控制点已转移到 Claude Code、Codex CLI、Cursor、Gemini CLI 等暴露的 pre-tool hook,2026 年微软、CrowdStrike、Palo Alto Networks 等均已采用。Adversa AI 的 GuardFall 研究(2026 年 6 月)用老旧 shell 技巧绕过了 11 款主流开源编程智能体中 10 款的命令审批护栏,Google 2026 年 4 月的 Gemini CLI 公告(GHSA-wpqr-6v78-jr5g)修复了以 --yolo 模式和自动信任工作区目录为前提的远程代码执行路径。
Gray Swan AI 于 5 月 10 日启动 Dangerous Reasoning Arena 竞赛,将红队测试从输出操纵推进到模型内部推理层面,重点考察思维链越狱。参赛者需诱导模型产生生物攻击规划、战略性欺骗、隐蔽后门植入、基础设施破坏等危险推理,即使最终回复看似无害,只要内部逻辑体现有害意图即算成功。热身周 5 月 10 日开启(不计奖),正式评奖轮次为 5 月 17 日和 5 月 24 日,总奖池 20,000 美元。
0DIN 面向正在交付 AI 系统的团队开放限时免费安全评估,用其研究员来源的红队武器库攻击用户自有或获授权测试的模型,并给出按优先级排序的报告。评估通过 0DIN Scanner 执行,覆盖直接与间接提示注入、越狱、编码隐藏载荷、多轮攻击以及带工具智能体的数据泄露与错误调用等失效方式,云端模型走 API、自托管模型用容器化 Scanner 在本地网络内运行,报告通常一两天内交付。报告包含安全评级与风险等级、可长期跟踪的攻击成功率(ASR)、分类发现、与前沿模型的对比及修复建议,并映射到 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、ISO/IEC 42001 和 EU AI Act 等框架;该评估基于 NVIDIA 开源 garak 引擎并叠加 0DIN 的赏金探针库,每次评估均经人工把关。
0DIN 发布 litellm-shield 插件,可将护栏分类器 SusFactor 作为 LiteLLM 代理的自定义护栏运行,安装一条 pip 命令即可在 flag 模式下启用。SusFactor 对每个提示词打分以拦截提示注入和越狱,支持 block、flag(默认)、shadow 三种模式,并接入 Langfuse、Datadog、OTel 等可观测性栈。它挂载在 during_call 阶段与模型调用并行执行,分类器中位延迟约 15.6ms、P95 23.9ms、P99 26.5ms,全部在 CPU 上运行,默认失败开放。
腾讯朱雀实验室发布 A.I.G Agent 安全演习 Skill,可安装到 Claude Code、Codex、Cursor 等主流 Agent 客户端,用一句话触发对宿主 Agent 的自动化安全演习。该 Skill 会先识别当前 Agent 连接的工具、权限、MCP 连接与 Skill 配置,再针对越狱、间接注入、工具滥用、MCP 风险、Skill 供应链和基础设施漏洞逐项演练,演习过程与报告均在本机完成。它面向个人开发者的 IDE Agent 和业务方生产级 Agent 两类场景,前者侧重 Skill 代码审计、MCP 权限审计与供应链检查,后者覆盖基础设施扫描、代码安全、动态安全测试、大模型越狱和工作流攻击五个维度,其中动态测试含 7 个子项共 37~49 条 payload,并采用 7 层编码递进引擎。
HiddenLayer 梳理了指令微调 LLM 如何通过控制 token、角色划分和指令层级区分 system、user、assistant 三类角色,并说明开发者如何用 system prompt 和 XML 风格模板约束模型行为。文章随后指出这些机制本身构成攻击面,包括控制 token 注入、伪造上下文重置、推理 token 滥用和 XML 提示词伪造,攻击者可借此抬高输入在指令层级中的优先级或覆盖开发者意图。文中以 GPT-4o 的 tokenization 为例说明特殊 token 与普通词表 token 共享 ID 的现象,并引用对 Gemini for Workspace、DeepSeek-R1 和 Cursor 的评估案例,展示用 <eos><bos> 重置上下文、用 <user_info> 标签注入仓库内容等手法。
HiddenLayer 发布 APE(Adversarial Prompt Engineering)对抗提示词分类法的更新版本,将原本扁平的目标列表重建为基于 AI 安全影响的三层结构,顶层沿用传统网络安全的机密性、完整性、可用性(CIA)三元组。机密性目标细分为系统提示词泄露、内部策略/工具规范泄露、用户数据外泄、跨用户或跨租户泄露、RAG 泄露、密钥泄露、训练数据提取、模型提取等;完整性目标细分为任务重定向、工作流操纵、幻觉或错误信息、推荐操纵、未授权工具使用、未授权状态变更、下游漏洞投递、偏见诱导和内容政策违规;可用性拆分为拒绝服务、延迟膨胀、拒绝钱包(denial of wallet)和上下文窗口/token/Agent 循环耗尽。新网站 ape.hiddenlayer.com 提供图视图、矩阵视图、目标页面和提示词高亮,并新增投稿表单供研究者提交技术、示例和修正。