Microsoft PyRIT v0.10.0 发布:重构攻击接口并推出 pyrit_scan 与 pyrit_shell
Microsoft 开源红队工具 PyRIT 发布 v0.10.0,对包内大部分代码做了重写,把 Orchestrator 统一改名为 Attack,并新增 pyrit_scan 命令行与 pyrit_shell 交互式 shell,为自动化红队提供基础。
开源红队、评测与防护工具。
在这个话题内搜索或按分类筛选Microsoft 开源红队工具 PyRIT 发布 v0.10.0,对包内大部分代码做了重写,把 Orchestrator 统一改名为 Attack,并新增 pyrit_scan 命令行与 pyrit_shell 交互式 shell,为自动化红队提供基础。
Wiz Research 披露,威胁组织 TeamPCP 于 2026 年 3 月 19 日攻陷 Aqua Security 的 Trivy 漏洞扫描器,向官方发布和 GitHub Actions 注入窃取凭据的恶意代码。攻击者伪造提交推送至 actions/checkout 与 aquasecurity/trivy,触发 v0.69.4 标签发布,从仿冒域名 scan.aquasecurtiy[.]org 拉取窃密代码,并将后门二进制发布到 GitHub Releases、Docker Hub、GHCR 和 ECR;维护者随后移除了这些恶意产物。
GitHub Actions 的 pull_request_target 触发器结合检出 PR 代码,构成 "Pwn Request" 攻击类,Trivy 供应链入侵即由此发生——攻击者替换 setup-go action 代码后获得代码执行并窃取组织级高权限 token。该触发器运行 base 分支工作流、可访问仓库密钥且默认拥有 Write 权限,且不受组织级 fork PR 审批门控。上篇梳理 GitHub Actions 安全模型、三大风险(PR 攻陷、脚本注入、第三方组件)及防御手册,下篇将聚焦 AI 驱动 action 的新兴威胁。
Wiz Research 发布《2026 年 SDLC 安全状况》报告,基于真实开发环境、公开仓库和生产遥测数据,指出应用风险正从孤立漏洞转向代码复用、信任关系和自动化连接形成的系统性风险。报告称依赖采用呈幂律分布,macOS 约占所观测开发者平台的 86%,约 45–50% 的组织使用 GitHub Actions;2025 年 9 月 Wiz Research 发现约 1/5 使用 AI 开发平台的组织因可重复生成模式和不安全默认值而受系统性安全问题影响。
Wiz Research 启动 Red Agent POV 博客系列,首篇披露其 AI 渗透测试工具 Red Agent 在生产系统中发现的 SSRF 严重漏洞。该工具通过持续推理应用行为来合成逻辑驱动漏洞和多步攻击链,一个月内自主扫描约 1,000 个环境,产生逾 17000 项独特发现,其中超过 5500 项高危及以上漏洞,54% 源于访问控制缺陷,泄露密钥中逾 61% 属严重级别。
Wiz 的自主 Red Agent 在一家领先 B2B 平台的数据 API 中发现授权绕过漏洞:免费账户在搜索请求中注入单个客户端可控布尔参数(如 unmaskContactData),即可绕过积分付费机制,明文获取 600M+ 商业邮箱、135M+ 已验证直线电话及约 50% 记录中的个人邮箱。该漏洞源于后端信任客户端传入的 flag 而未校验用户权限,属于典型业务逻辑缺陷,传统 SAST/DAST 工具难以检出。平台安全团队在收到报告后 2 小时内完成修复。
Metabase 平台一个零日 SQL 注入漏洞(CVE-2026-72898,GHSA-vwf4-m7j8-wcjf)已被用于攻击 Metabase Cloud,自托管实例需尽快打补丁。Wiz 观测到约 13% 的云环境部署了自托管 Metabase,其中约 25% 可完全从互联网访问,Shodan 收录约 2,500 个实例。漏洞源于 /api/session/reset_password 接口未剥离额外 user-id 参数,经 Clojure merge 与 HoneySQL :raw 特性组合形成盲注,影响 1.58 及以上版本。
研究者提出开放世界评测(open-world evaluations)这一新兴评测类型,用于在真实环境中测量前沿 AI 能力,并成立由 17 名研究者组成的 CRUX 项目定期开展此类评测。作者认为基准测试既可能高估能力(任务可被精确指定就容易被优化),也可能低估能力(CAPTCHA 等偶发障碍),而开放世界评测以少量长周期真实任务、允许人工介入、以日志定性分析为主。
Goodfire 在 GPT-2 Small 上训练跨层转码器(CLT),复现并验证其半自动发现模型内部计算结构的能力。CLT 用 FineWeb 的 100M token 训练,扩展因子 64,每层 49,152 个特征、12 层共 589,824 个特征,激活函数用 ReLU。在 greater-than 任务上,CLT 成功识别出可解释特征(包括抽象的奇偶特征),但发现的机制与 Hanna 等人此前的结果存在差异,提示稀疏解释器模型对计算机制的表示与分解可能有所不同。
Goodfire Research 发布 Paint With Ember,用画布取代提示词框,直接操控图像模型内部激活来编辑和生成图像。该工具基于 3.5B 参数的 Stable Diffusion XL-Turbo,针对其 UNet 的 block down.2.1 层训练 BatchTopK SAE 分解 16x16 patch 的潜向量,再用非负矩阵分解(NMF)把细粒度特征聚合成可操作的高层概念单元。用户可绘画添加物体、拖动概念、调整语义权重或修改主体动作,公开版应用与开源 SAE 解释器模型均已开放。
Goodfire 发布 preview.goodfire.ai,一个用于理解和操控 Llama 3 行为的桌面界面,后端在 Llama-3-8B-Instruct 第 19 层残差流上训练稀疏自编码器(SAE),提取可修改的特征。训练数据选用 LMSYS-Chat-1M,作者称其在聊天场景下产生的特征最有效,而 FineWeb 等非聊天数据训练出的特征迁移效果较差。团队用自动化可解释性流程借助 Claude 为特征生成人类可读标签,并通过基于梯度的归因方法筛选干预候选,再以特征干预改变模型输出。作者观察到正向干预通常单个特征即可生效,负向干预常需多个特征,可能与自我修复有关;同时指出跨层叠加会让部分特征难以被干预。
Goodfire 与 Rakuten 合作,将稀疏自编码器(SAE)探针用于 Rakuten AI 智能体的 PII 检测,这是已知首个将 SAE 用于语言模型护栏的企业应用。方法是在 Llama 3.1 8B 侧模型上训练 SAE,再用其特征激活训练分类器,逐 token 判断姓名、地址、电话、邮箱等 PII 类别。由于真实 PII 敏感,训练数据全部为合成数据,SAE 探针在合成到真实生产数据的分布迁移上优于普通激活探针和注意力探针,并在非英语和标签噪声场景下同样表现更好。成本上,探针比常见 LLM-as-judge 方案便宜 10 到 500 倍,性能相当;用同一模型做白盒探针的 F1 从黑盒判官的 51% 提升到 96%。
推荐理由Goodfire 与 Rakuten 的落地案例给出了 SAE 探针在合成到真实数据迁移上的对比数据,可迁移到企业护栏场景。
Goodfire 与 Radical AI 合作,通过给扩散模型加入基于其内部表征的反馈回路实现自校正搜索,使目标范围内可用候选材料的生成量提高约 30%。该方法针对 MatterGen 的条件生成流程改进逆设计环节,衡量指标为同时满足稳定、独特和新颖三个约束的 SUN 标准。现有基线中仅 15% 的 MatterGen 采样落在 4–6 eV 带隙目标区间内,若再叠加 SUN 过滤则降至 6.5%,且仅有约 10% 的微调候选能通过全部筛选阶段。该技术原则上适用于任意扩散模型,有望推广到蛋白质设计与药物发现等领域。
Goodfire Research 发布预测式数据调试研究,主张在训练前用可解释性方法预测偏好数据会让 DPO 放大或抑制哪些行为,预测结果与实际学习效果的 R² 达 0.9,并能追溯到具体数据点。方法把数据集输入已解释的模型,按模型实际计算的概念而非嵌入向量聚类来观察数据,从而区分模型真正学到的行为与评分者眼中的行为表象。
推荐理由Goodfire 把可解释性读出的概念用于预测 DPO 会放大哪些行为,并给出四个真实数据集的意外案例,可迁移到后训练数据审查。
Goodfire 发文提出"神经几何"研究方向,主张神经网络激活中蕴含丰富几何结构——星期呈圆形排列、颜色构成 HSL 流形、生命树出现在基因组表征中,可作为理解、改进和控制模型的抓手。该系列收录多项工作:沿弯曲流形的引导比传统线性引导向量产生更精准的行为改变;Llama 3.1 8B 内被发现一个基于圆形数值表示的加法模块;Block-Sparse Featurizers(BSF)将视觉模型激活分解为多维子空间并实现细粒度引导,且多数概念是多维的。
Google Threat Intelligence 首次公开内部智能体漏洞发现框架 AVDH,用 Google ADK 将专用智能体串联成顺序流水线,先做威胁建模再逐阶段分析代码,输出带风险评级的结果供人工复核。使用 10 个月内,AVDH 在分析数千万行代码、执行数千条流水线后,于一次企业仓库被盗事件响应中两天内发现超 100 个真实高危漏洞,并在广泛使用的 Web 扩展和开源项目中促成 12 个 CVE 分配,包括 CVE-2026-13242 和 CVE-2026-55803,另有十余个正在披露中。该框架可与 CodeMender 的持续扫描配合形成两层防御。
Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。
Microsoft PyRIT 发布 v0.11.0,破坏性变更将攻击与执行器从 SeedPromptGroup 改为基于 Message 运行,并重命名场景配置 API。该版本新增 WebSocketCopilotTarget,可通过 WebSocket 向 Microsoft Copilot 发送提示词执行,同时加入图像下载支持的 ImageTarget 重构及 OpenAIImageTarget 的图像编辑/混合功能。
Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。
微软 PyRIT 发布 v0.12.1 安全补丁,修复 Jinja2 模板注入(SSTI)漏洞,建议 0.12.0 及更早版本用户升级。漏洞源于模板渲染使用未沙箱化的 Jinja2 Environment,远程数据集加载器把抓取的数据直接传入 SeedPrompt(value=...) 并在 __post_init__ 中按模板渲染,被投毒的数据集可借此实现 Python 对象遍历。