全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Trail of Bits
Trail of Bits 推出 Patch the Planet,首周向 19 个开源项目提交 64 个 PR
Trail of Bits 与 OpenAI 的 Daybreak 计划合作推出 Patch the Planet,让工程师借助 GPT-5.5-Cyber 等前沿模型为关键开源项目找漏洞并直接提交补丁。首周覆盖 19 个项目,包括 cURL、NATS、pyca、Sigstore、aiohttp、Go、Python 与 python.org、urllib3、PyPI、SimpleX、Valkey 和 RustCrypto,共提交 64 个 pull request 和 51 个 issue,其中 37 个 PR 已合并、19 个 issue 已修复关闭,目前已有 30 多个项目加入。
- 动态Trail of Bits
GPT-5.5-Cyber 一天内为 zlib 搭建模糊测试实验室
Trail of Bits 在 Patch the Planet 项目中让 GPT-5.5-Cyber 通过 Codex 的 /goal 命令为 zlib 构建模糊测试活动,一天内完成了以往需数周的工作。模型自行判断静态审查价值有限,转而搭建动态测试工具,使用 ASan 和 UBSan 构建、复用边界测试作为种子语料,并针对 inflate、inflateBack、uncompress2、gzFile、MiniZip 等十余个入口编写 C/C++ harness,还利用 INFLATE_STRICT 等编译期变体触及默认构建隐藏的代码。其最成功的 harness 在操作系统背压构造的有效 gz* 状态下发现了漏洞。
- 动态Trail of Bits
Trail of Bits 如何使用 Codex 的 /goal 在 Patch the Planet 中挖漏洞
Trail of Bits 在与 OpenAI 合作的 Patch the Planet 项目中,借助 Codex 的 /goal 目标式提示功能审计 Rust、curl、zlib 等广泛使用的开源代码库。/goal 从单一变体分析流水线找出其提交的全部 Rust 漏洞,包括已在 Rust 1.98 修补的一个健全性缺陷和一个错误编译问题,并将各项目历史 CVE 转为需在易受影响版本触发、在修补版本静默的 Semgrep 规则,命中 11 处跨项目变体告警,还在一次探测中发现 Keycloak SAML 组件两个潜在高危权限提升漏洞。
- 动态Trail of Bits
AWS Nitro Enclaves 与 KMS 集成中的攻击面分析
Trail of Bits 梳理了 Nitro Enclaves 与 AWS KMS 通信信道的被动与主动攻击类别,并指出即使密码学实现正确,运营风险依然存在。KMS 通过基于 PCR 值的密钥策略和用 enclave 公钥加密响应两种机制限制访问,仅 GenerateDataKey、GenerateDataKeyPair、Decrypt、DeriveSharedSecret、GenerateRandom 支持这些机制,Encrypt 不在其列。文章给出避免被动攻击的检查清单,要求请求始终包含 Recipient 参数、使用加密上下文并正确授权 Encrypt 与 GenDataKey 操作。
- 动态Simon Willison
Claude Cowork 初体验:Anthropic 的通用智能体
Anthropic 推出研究预览版 Claude Cowork,被描述为“面向其余工作的 Claude Code”,仅向 Max 订阅用户开放,随后也向 $20/月的 Claude Pro 用户开放。它本质上是套上更友好界面的 Claude Code,并将文件挂载进容器化沙箱,Claude Code 逆向发现其使用 Apple VZVirtualMachine 下载并启动定制 Linux 根文件系统。作者用它筛选三个月内 46 个草稿文件并执行 44 次站内搜索,同时指出此类功能始终面临提示注入威胁。
- 动态Simon Willison
Cline 因 issue 标题提示注入被投毒,NPM 发布包遭污染
Adnan Khan 披露了一条针对 Cline GitHub 仓库的攻击链:Cline 用 anthropics/claude-code-action@v1 做 AI issue 自动分诊,配置了 Bash、Read、Write 等工具权限,且提示词包含 issue 标题,攻击者可在标题中诱导 Claude 执行任意命令,例如通过 npm install 安装指定 GitHub 包,再由其 package.json 的 preinstall 脚本运行代码。
- 动态Simon Willison
Simon Willison 谈智能体工程:从信任 Opus 4.5 到红绿 TDD
Simon Willison 在旧金山 Pragmatic Summit 的火边对话中分享了对智能体工程的看法,称 Opus 4.5 是他第一个真正建立信任的模型——对于见过它处理过的类问题,他有信心不会出错。他强调每次编码会话都用一句“use red-green TDD”(约五个 token)启动,所有好的编程智能体都能理解并因此提高产出可用代码的概率,而不写测试的做法非常糟糕。他还批评 StrongDM“没人写代码也没人读代码”的原则极不负责任,尤其是作为一家做安全软件的安全公司。
- 动态Microsoft PyRIT 版本发布
Microsoft PyRIT v0.10.0 发布:重构攻击接口并推出 pyrit_scan 与 pyrit_shell
Microsoft 开源红队工具 PyRIT 发布 v0.10.0,对包内大部分代码做了重写,把 Orchestrator 统一改名为 Attack,并新增 pyrit_scan 命令行与 pyrit_shell 交互式 shell,为自动化红队提供基础。
- 动态Wiz Research
Aqua Security 的 Trivy 遭供应链攻击,恶意版本与 GitHub Actions 被植入窃密代码
Wiz Research 披露,威胁组织 TeamPCP 于 2026 年 3 月 19 日攻陷 Aqua Security 的 Trivy 漏洞扫描器,向官方发布和 GitHub Actions 注入窃取凭据的恶意代码。攻击者伪造提交推送至 actions/checkout 与 aquasecurity/trivy,触发 v0.69.4 标签发布,从仿冒域名 scan.aquasecurtiy[.]org 拉取窃密代码,并将后门二进制发布到 GitHub Releases、Docker Hub、GHCR 和 ECR;维护者随后移除了这些恶意产物。
- 动态Wiz Research
GitHub Actions 安全入门:威胁模型、攻击与防御(上篇)
GitHub Actions 的 pull_request_target 触发器结合检出 PR 代码,构成 "Pwn Request" 攻击类,Trivy 供应链入侵即由此发生——攻击者替换 setup-go action 代码后获得代码执行并窃取组织级高权限 token。该触发器运行 base 分支工作流、可访问仓库密钥且默认拥有 Write 权限,且不受组织级 fork PR 审批门控。上篇梳理 GitHub Actions 安全模型、三大风险(PR 攻陷、脚本注入、第三方组件)及防御手册,下篇将聚焦 AI 驱动 action 的新兴威胁。
- 动态Wiz Research
Wiz Research《2026 年 SDLC 安全状况》报告:现代开发中风险如何规模化
Wiz Research 发布《2026 年 SDLC 安全状况》报告,基于真实开发环境、公开仓库和生产遥测数据,指出应用风险正从孤立漏洞转向代码复用、信任关系和自动化连接形成的系统性风险。报告称依赖采用呈幂律分布,macOS 约占所观测开发者平台的 86%,约 45–50% 的组织使用 GitHub Actions;2025 年 9 月 Wiz Research 发现约 1/5 使用 AI 开发平台的组织因可重复生成模式和不安全默认值而受系统性安全问题影响。
- 动态Wiz Research
Wiz Research 推出 Red Agent POV 系列博客
Wiz Research 启动 Red Agent POV 博客系列,首篇披露其 AI 渗透测试工具 Red Agent 在生产系统中发现的 SSRF 严重漏洞。该工具通过持续推理应用行为来合成逻辑驱动漏洞和多步攻击链,一个月内自主扫描约 1,000 个环境,产生逾 17000 项独特发现,其中超过 5500 项高危及以上漏洞,54% 源于访问控制缺陷,泄露密钥中逾 61% 属严重级别。
- 动态Wiz Research
Wiz Red Agent 发现 B2B 平台数据 API 付费墙绕过漏洞,600M+ 联系人信息可免费获取
Wiz 的自主 Red Agent 在一家领先 B2B 平台的数据 API 中发现授权绕过漏洞:免费账户在搜索请求中注入单个客户端可控布尔参数(如 unmaskContactData),即可绕过积分付费机制,明文获取 600M+ 商业邮箱、135M+ 已验证直线电话及约 50% 记录中的个人邮箱。该漏洞源于后端信任客户端传入的 flag 而未校验用户权限,属于典型业务逻辑缺陷,传统 SAST/DAST 工具难以检出。平台安全团队在收到报告后 2 小时内完成修复。
- 动态Wiz Research
Metabase 零日 SQL 注入漏洞(CVE-2026-72898)遭在野利用
Metabase 平台一个零日 SQL 注入漏洞(CVE-2026-72898,GHSA-vwf4-m7j8-wcjf)已被用于攻击 Metabase Cloud,自托管实例需尽快打补丁。Wiz 观测到约 13% 的云环境部署了自托管 Metabase,其中约 25% 可完全从互联网访问,Shodan 收录约 2,500 个实例。漏洞源于 /api/session/reset_password 接口未剥离额外 user-id 参数,经 Clojure merge 与 HoneySQL :raw 特性组合形成盲注,影响 1.58 及以上版本。
- 动态AI as Normal Technology
CRUX 提出开放世界评测:AI 智能体自主开发并上架 iOS 应用
研究者提出开放世界评测(open-world evaluations)这一新兴评测类型,用于在真实环境中测量前沿 AI 能力,并成立由 17 名研究者组成的 CRUX 项目定期开展此类评测。作者认为基准测试既可能高估能力(任务可被精确指定就容易被优化),也可能低估能力(CAPTCHA 等偶发障碍),而开放世界评测以少量长周期真实任务、允许人工介入、以日志定性分析为主。
- 动态Goodfire Research
Goodfire 复现 GPT-2 Small 的跨层转码器电路追踪
Goodfire 在 GPT-2 Small 上训练跨层转码器(CLT),复现并验证其半自动发现模型内部计算结构的能力。CLT 用 FineWeb 的 100M token 训练,扩展因子 64,每层 49,152 个特征、12 层共 589,824 个特征,激活函数用 ReLU。在 greater-than 任务上,CLT 成功识别出可解释特征(包括抽象的奇偶特征),但发现的机制与 Hanna 等人此前的结果存在差异,提示稀疏解释器模型对计算机制的表示与分解可能有所不同。
- 动态Goodfire Research
Goodfire 推出 Paint With Ember:用扩散模型潜空间概念作画
Goodfire Research 发布 Paint With Ember,用画布取代提示词框,直接操控图像模型内部激活来编辑和生成图像。该工具基于 3.5B 参数的 Stable Diffusion XL-Turbo,针对其 UNet 的 block down.2.1 层训练 BatchTopK SAE 分解 16x16 patch 的潜向量,再用非负矩阵分解(NMF)把细粒度特征聚合成可操作的高层概念单元。用户可绘画添加物体、拖动概念、调整语义权重或修改主体动作,公开版应用与开源 SAE 解释器模型均已开放。
- 动态Goodfire Research
Goodfire 用稀疏自编码器理解与操控 Llama 3
Goodfire 发布 preview.goodfire.ai,一个用于理解和操控 Llama 3 行为的桌面界面,后端在 Llama-3-8B-Instruct 第 19 层残差流上训练稀疏自编码器(SAE),提取可修改的特征。训练数据选用 LMSYS-Chat-1M,作者称其在聊天场景下产生的特征最有效,而 FineWeb 等非聊天数据训练出的特征迁移效果较差。团队用自动化可解释性流程借助 Claude 为特征生成人类可读标签,并通过基于梯度的归因方法筛选干预候选,再以特征干预改变模型输出。作者观察到正向干预通常单个特征即可生效,负向干预常需多个特征,可能与自我修复有关;同时指出跨层叠加会让部分特征难以被干预。
- 动态Goodfire Research
Goodfire 与 Rakuten 用 SAE 探针在生产环境检测 PII
Goodfire 与 Rakuten 合作,将稀疏自编码器(SAE)探针用于 Rakuten AI 智能体的 PII 检测,这是已知首个将 SAE 用于语言模型护栏的企业应用。方法是在 Llama 3.1 8B 侧模型上训练 SAE,再用其特征激活训练分类器,逐 token 判断姓名、地址、电话、邮箱等 PII 类别。由于真实 PII 敏感,训练数据全部为合成数据,SAE 探针在合成到真实生产数据的分布迁移上优于普通激活探针和注意力探针,并在非英语和标签噪声场景下同样表现更好。成本上,探针比常见 LLM-as-judge 方案便宜 10 到 500 倍,性能相当;用同一模型做白盒探针的 F1 从黑盒判官的 51% 提升到 96%。
- 动态Goodfire Research
Goodfire 用自校正搜索加速材料发现,将扩散模型的候选材料产出提升约 30%
Goodfire 与 Radical AI 合作,通过给扩散模型加入基于其内部表征的反馈回路实现自校正搜索,使目标范围内可用候选材料的生成量提高约 30%。该方法针对 MatterGen 的条件生成流程改进逆设计环节,衡量指标为同时满足稳定、独特和新颖三个约束的 SUN 标准。现有基线中仅 15% 的 MatterGen 采样落在 4–6 eV 带隙目标区间内,若再叠加 SUN 过滤则降至 6.5%,且仅有约 10% 的微调候选能通过全部筛选阶段。该技术原则上适用于任意扩散模型,有望推广到蛋白质设计与药物发现等领域。
- 动态Goodfire Research
Goodfire 发布预测式数据调试方法,可在训练前预测 DPO 会学到什么
Goodfire Research 发布预测式数据调试研究,主张在训练前用可解释性方法预测偏好数据会让 DPO 放大或抑制哪些行为,预测结果与实际学习效果的 R² 达 0.9,并能追溯到具体数据点。方法把数据集输入已解释的模型,按模型实际计算的概念而非嵌入向量聚类来观察数据,从而区分模型真正学到的行为与评分者眼中的行为表象。
- 动态Goodfire Research
Goodfire《神经几何》系列:从激活空间结构理解与控制神经网络
Goodfire 发文提出"神经几何"研究方向,主张神经网络激活中蕴含丰富几何结构——星期呈圆形排列、颜色构成 HSL 流形、生命树出现在基因组表征中,可作为理解、改进和控制模型的抓手。该系列收录多项工作:沿弯曲流形的引导比传统线性引导向量产生更精准的行为改变;Llama 3.1 8B 内被发现一个基于圆形数值表示的加法模块;Block-Sparse Featurizers(BSF)将视觉模型激活分解为多维子空间并实现细粒度引导,且多数概念是多维的。
- 动态Google Threat Intelligence
Google 用智能体源码审查框架 AVDH 对抗 AI 攻击,10 个月发现 12 个 CVE
Google Threat Intelligence 首次公开内部智能体漏洞发现框架 AVDH,用 Google ADK 将专用智能体串联成顺序流水线,先做威胁建模再逐阶段分析代码,输出带风险评级的结果供人工复核。使用 10 个月内,AVDH 在分析数千万行代码、执行数千条流水线后,于一次企业仓库被盗事件响应中两天内发现超 100 个真实高危漏洞,并在广泛使用的 Web 扩展和开源项目中促成 12 个 CVE 分配,包括 CVE-2026-13242 和 CVE-2026-55803,另有十余个正在披露中。该框架可与 CodeMender 的持续扫描配合形成两层防御。
- 动态Google Threat Intelligence
Google GTIG 发布 CI/CD 与代码流水线主动防御蓝图
Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。