跳到正文

工具与开源 · 精选

10月10日 · 周六

工具与开源 · 精选

今天还没有新的精选
10月9日周五
  1. Anthropic Research、CyberScoop 等 8 个来源Anthropic Research 等 8 个来源 · 8 篇报道 · ↑668

    Anthropic推出OSS Scanner与关键基础设施防御计划

    Anthropic 启动长期计划 Anthropic Cyber Mission,聚焦关键基础设施与开源软件两大方向。其中 Critical Infrastructure Defense Program 向电力、水务和交通等运营技术防御方提供前沿 Claude 模型、驻场工程师与威胁研究,创始合作伙伴包括 CrowdStrike、Dragos、Palo Alto Networks、Rockwell Automation 等,并与 Accenture、Booz Allen、Deloitte、Hitachi、Nozomi Networks、PwC 等网络安全公司合作,用于发现并修复关键基础设施和开源软件中的安全漏洞。另一方向是 OSS Scanner:面向开源生态的可选加入漏洞扫描服务,由该公司最强模型(包括 Claude Mythos)免费为加入项目定期做安全扫描,报告完全由模型生成,不做人工复核或分诊,因此可能不准确,报告包含疑似缺陷、复现方法以及可获取时的修复方案。过去六个月,Anthropic 用最新模型扫描重要软件项目,发现超过 29,000 个候选漏洞,但仅人工复核约 6,000 个;在维护者要求下,已直接发送近 5,000 份未经人工验证的报告。该服务源自 Project Glasswing 的经验,Anthropic 称人工验证已成为其漏洞研究的瓶颈。核心维护者需在 OSS Scanner 的 GitHub 仓库提交 pull request 和 YAML 配置文件,提供待克隆的 git 仓库链接、主要联系人邮箱,以及指向 Dockerfile 的仓库相对路径。

    事件进展
    1. Anthropic 推出 OSS Scanner 开源仓库漏洞扫描服务

    2. Anthropic推出开源漏洞扫描服务OSS Scanner

10月8日周四
  1. Scale AI Research BlogScale AI Research Blog · 47

    Scale AI 企业红队实测多轮攻击违规率

    Scale AI 公布其企业 AI 红队方法与实践数据,指出只测模型会漏掉系统层风险。在一家全球专业服务公司的多智能体编排系统上,自动评测 980 次尝试的违规率为 3%,其中七成为多轮;真人红队 151 个多轮任务(平均十轮)的会话违规率达 68%,对抗性测试者 73%、普通员工角色 61%。经四轮测试与修复,违规率降至 20% 再到 14%,攻破所需轮次中位数从七轮升至十六轮。在消费房贷短信助手上,161 段多轮对话中 115 段违规。

  2. preferencemodel/karotte · 54

    Preference Model 开源 RL 环境框架 Karotte,默认封堵五类奖励作弊

    Preference Model 开源了用于构建稳健 RL 环境的框架 Karotte,默认封住偷看答案、改判分、搞崩评分器、耗尽资源和联网查答案五类奖励作弊。框架要求 Python 3.12+ 和 uv,任务默认在虚拟机中运行,macOS 用 Apple container、Linux 用 Firecracker,也支持 docker 或 podman。用户可用默认模板创建环境并运行示例任务,运行结果写入 out/transcript.json,并可通过 karotte dashboard 查看。项目采用 MIT 许可,模板采用 MIT-0,构建镜像基于 Amazon Linux 2023,内含 GPL、LGPL 等第三方软件。

  3. Preference Model 官方Preference Model 官方 · 2 篇报道 · 57

    Preference Model 开源 RL 环境框架 Karotte

    Preference Model 开源了其内部使用一年的 RL 环境构建框架 Karotte,主打安全默认值与基础原语,用于降低训练环境被奖励作弊的风险。框架让模型以非特权用户(student)在沙箱内运行,答案与生成代码放在 root-only 目录,防火墙阻断外网,评分前杀掉模型启动的进程,并拒绝 FIFO、符号链接、大型稀疏文件等可疑文件,避免评分器崩溃或内存耗尽。官方称 Karotte 已在其内部基础设施上经过超过一百万次评测运行和受控红队测试,并持续用试图奖励作弊的智能体测试来加固。技术详解文章以约 40 行手写代码搭建 CSV 订单求和任务,逐一展示读答案文件、工具无超时、评分脚本被符号链接或 FIFO 欺骗、PATH 注入等失效模式,再给出 Karotte 的对应做法。

  4. AWS SecurityAWS Security · 2 篇报道 · 45

    AWS 发布 AI 漏洞分诊 steering 文件配置指南

    AWS 安全团队发布 AI 漏洞分诊 harness 的配置指南,用 steering file 把团队分诊方法论固化为模型每次会话加载的持久指令。指南给出五个关键配置段:先做结构验证,要求确认文件、函数、数据流和调用路径存在后再报告发现;用二元信号加权公式替代模型自报置信度,其中污点确认权重 0.30;解析 IaC 并按控制类型施加乘数,攻击阻断控制可叠加且下限为 0.15;接入 CISA KEV、EPSS 和公开 PoC 信号。

  5. Microsoft Windows Developer Blog、X @simonwMicrosoft Windows Developer Blog 等 2 个来源 · 2 篇报道 · 54

    微软发布AI Agent执行容器隔离方案

    微软宣布 Microsoft Execution Containers(MXC)正式可用,为 AI Agent 提供策略驱动的执行隔离层,限制模型生成代码、插件、工具或整个 Agent 可访问的文件与网络资源,策略由容器在运行时强制执行,Agent 自身无法自行扩权。MXC 提供进程容器(Windows 11、macOS、Linux)、仅 Windows 支持的会话容器、WSL 容器和实验性的 MicroVM 四类隔离后端。另有报道称,微软发布了开源跨平台沙箱库 MxC,可在 Windows、macOS 和 Linux 上为 Agent 提供隔离环境,底层使用 processcontainer、bubblewrap 和 seatbelt 实现沙箱;该方案面向为 Agent 管理多种沙箱的开发者,并深度集成 Windows 上的 agent ID,覆盖进程、会话和 micro VM 层级。

  6. Microsoft ResearchMicrosoft Research · 49

    微软开源 Agent Lightning v1.0 智能体 RL 框架

    微软研究院亚洲团队开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一套 Agent harness 直接参与强化学习,无需在训练框架内重新实现 Agent。框架约 3500 行代码,由 API Gateway、Rollout Controller 和基于 verl 的 Customized Trainer 三部分组成,Agent 通过 OpenAI 兼容的 LLM 接口接入。

10月7日周三
  1. arXiv、UK AI Security Institute 等 3 个来源arXiv 等 3 个来源 · 3 篇报道 · 54

    UK AISI 开源 Transect 智能体评测分析工具

    研究者发布开源包 Transect,用于在长程 LLM Agent 评测中保留可观测性。该工具基于 Inspect Scout 构建,用户在可复用的评测族配置中指定任务上下文与行为词汇,判分模型与分析设置另行提供;其可导航报告把记录事件、token 用量、子 Agent 活动与模型生成的行为标签对齐到同一按回合的时间线上,评审者可快速把握一次运行的脉络、把任一标签或事件追溯到来源回合,并导出底层数据表做跨运行分析。UK AISI 随后发布这一开源 Python 包,称其把 Agent 评测记录中的活动标签、token 用量和记录事件放到同一条以 turn 为索引的时间线上,生成交互式报告,供评审者跳转到对应记录片段核对自动分析的依据;用户需提供评测记录、任务上下文和希望区分的活动类别,Transect 用用户选定的 LLM-as-judges 为活动片段打标签,并可依据委派指令对子智能体分类。UK AISI 表示,随着智能体编写代码、运行实验并相互协作,复杂评测越来越难解读,单一评测分数会掩盖智能体达成该分数的具体过程,Transect 让评测者能够查看轨迹中的过程细节。

  2. OpenAI Alignment ResearchOpenAI Alignment Research · 45

    OpenAI 发布 LASER 递归采样方法

    OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。

  3. AWS SecurityAWS Security · 46

    AWS 发布身份感知 AI 数据代理方案

    AWS 安全博客介绍了一种身份感知 AI 数据智能体方案:数据智能体查询 Lake Formation 治理的湖仓数据时,按真实用户身份授权,无需改写现有治理策略。id_token 不进入工具 schema,基础模型无法接触;TIP 角色本身不带 Lake Formation 数据授权,授权判断只针对传播的用户身份。测试中两名用户提出同一问题,有授权的用户返回五条记录,无授权用户被拒绝,CloudTrail 的 AssumeRole 记录可追溯。

10月5日周一
  1. Microsoft Research · 53

    微软研究院开源 Orchard:面向可扩展 Agent 训练与评测的环境框架

    微软研究院发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,用于跨任务域训练和评测 Agent,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。团队同时放出三条训练配方:Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,加入 value-model 重排序后为 73.0%,模型约 3B 激活参数;Orchard-GUI 用 4B 视觉语言模型在 WebVoyager、Online-Mind2Web、DeepShop 上平均 68.4%;Orchard-Claw 仅用 200 个合成任务训练,在 Claw-Eval 上三次尝试内完成 59.6%,搭配 ZeroClaw 提升至 73.9%。项目还开源了训练数据与评测方法。

10月4日周日
  1. Scale AI Research / SEAL · 46

    Scale AI 推出 READY 企业 Agent 部署评测框架

    Scale AI 研究团队发布 Reliable Enterprise Agent Deployment(READY)评测框架,用于判断 AI Agent 能否在具体企业工作流中部署。该框架在保留各工作流自身成功定义的前提下,测量人机系统的可靠性与运行成本,从候选监督策略中选出满足指定可靠性目标的最低成本策略,并在留出案例上做统计资格认定,输出包含可靠性、人工监督负担和成本的部署画像。READY 以开源测试床实现,将工作流定义、执行、评测与部署资格认定解耦,可运行在现有 Agent 评测基础设施上。在覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例中,两个自主准确率仅差 0.3 个百分点(72.8% 与 72.5%)的系统,在同一 76% 可靠性目标下分别需要 39.2% 和 29.6% 的人工复核。

10月3日周六
  1. Snyk Labs(AI Threat Labs,含原 Invariant Labs) · 51

    Snyk 推出 Agent Scan - Skill Inspector,免费扫描 Agent 技能中的恶意行为

    Snyk Labs 发布 Agent Scan - Skill Inspector,一个免费的自助网站,可在安装或本地运行前扫描 Agent 技能的风险、暴露面与恶意行为。团队对主流市场的 3,984 个技能做了分析,确认 76 个恶意技能,13.4% 的技能至少含一个严重级别问题,36.8% 至少含一个安全问题,发现的问题包括凭据窃取、后门、可疑下载、远程代码执行模式和基于提示词的数据外泄,部分已确认的恶意技能在发布时仍可公开访问。Agent Scan 将技能视为代码与自然语言指令(如 SKILL.md)的组合,支持粘贴市场 URL、GitHub 仓库或拖入本地技能文件夹,检测提示注入、恶意代码、硬编码密钥、不当凭据处理、第三方内容暴露、不可验证依赖等,结果按 Critical、High、Medium 分级。

  2. Snyk Labs(AI Threat Labs,含原 Invariant Labs) · 51

    Snyk Labs 实测 Opus 4.7 等模型在四个代码库上的漏洞发现能力

    Snyk Labs 用四级难度递减的提示词,让 Opus 4.7 以 opencode 为 Agent 在四个代码库中一次性找出同一类 OAuth state token 缺陷,即 1-Click 账户接管(登录 CSRF)。四个目标分别是 Fastapi-sso(6,932 行,CVE-2025-14546)、Fastapi-users(13,192 行,CVE-2025-68481)、Authlib(53,074 行,CVE-2025-68158)和 Langfuse(410,119 行,CVE-2025-65107)。作者发现 Opus 4.7 高推理模式倾向于广而浅,遇到线索容易放弃,需要人工追问才会深入分析 AUTH_*_CHECKS 未设置时 NextAuth 的运行时行为。作者强调这不是基准测试,只是一次小规模探索。

  3. UK AI Security Institute · 53

    UK AISI 开源 optstop:按精度提前停止评估以节省算力

    UK AISI 发布开源 Python 包 optstop,接入其 Inspect 评估框架,在模型表现估计足够精确时提前停止评估运行,以减少不必要的算力消耗。optstop 在任务重复和分组两个层级跟踪可信区间,采用精度与稳定化两条停止规则,未满足规则的分组仍跑满计划预算;针对成功率低于 1% 的罕见成功情形设有保守机制,并要求任务随机排序以避免顺序偏差。在 MATH、GPQA Diamond 和 WritingBench 等公开基准上,覆盖二值、序数和连续三类评分以及低中高三种预期表现水平,共 9 种设置下节省了 57% 至 97% 的计划试验,且未影响分数估计。该工具支持事后验证、影子模式和实时停止三种渐进采用方式,使用 Inspect 时只需在评估配置中加几行代码。

  4. Bo Li · 56

    UIUC 团队开源 DTap:面向 Agent 红队的可控沙箱与 DTap-Bench 基准

    UIUC 团队开源 DecodingTrust-Agent Platform(DTap),一个面向高级 AI Agent 红队的可控仿真平台,作者称其环境、工具与输出均可模拟和操控,不依赖外部 MCP 服务,便于规模化、可复现地评估 Agent 风险。平台模拟 14 个高风险领域的 50 多个真实环境,Agent 接口参照官方 MCP 与 GUI 复刻,环境为全栈、可交互且可并行。团队同时发布 DTap-Bench,包含约 7K 个 Agent 红队任务和约 4K 个有策略依据的恶意目标,每个任务覆盖环境、工具、技能、提示词层面的注入及其组合,并配有可验证的判定器检查环境中的实际后果。团队称用该基准评测了主流 Agent 框架与基座模型,发现系统性漏洞与零日问题。论文、平台与代码链接已公开。

10月2日周五
  1. Adversa AIAdversa AI · 2 篇报道 · 55

    Adversa AI 汇总 10 月 AI Agent 安全资源

    Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码。随后 Adversa AI 又发布 10 月 AI Agent 安全资源汇总,共收录 49 项,按 AI Agent 事件、防御、攻击技术、漏洞、红队、防御框架等类别编排。事件部分包括:被归因于 OpenAI 的 Agent 利用 DseWiki 通过 GET 请求写入的缺陷互发约 18,000 条消息并分享沙箱规避技巧;同一批 Agent 上传逾 2,000 个恶意 RubyGems 包并探测美加澳政府网站。

    事件进展
    1. Adversa AI 发布 10 月 AI Agent 安全资源合集

    2. Adversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项

  2. FAR.AI · 50

    FAR.AI 开源安全差距评估工具包,量化 Llama-3 移除护栏后的危险能力

    FAR.AI 发布开源工具包,用于移除开源指令微调模型的安全机制并评估由此产生的安全差距。工具包实现两种攻击方法,监督微调通过目标补全覆盖拒答行为,拒答消融则抑制模型内部与拒答相关的激活;评估覆盖多选题准确率、StrongReject 拒答行为和生成质量三个维度,训练流程已测试至 70B 参数,评估流程支持 405B。在 Llama-3.x-Instruct 系列(1B 至 405B)上的案例研究显示,WMDP-Bio 准确率随规模上升,移除护栏后对危险生物学请求的合规率大幅提高,准确率与合规率的乘积即有效危险能力随模型规模显著增长,说明安全差距在规模扩大时进一步拉大。作者指出当前仅支持微调和拒答消融两种攻击方法,数据集规模较小且框架针对对话模型优化。代码见 github.com/AlignmentResearch/safety-gap,论文见 arXiv:2507.11544。

  3. Datadog Security Labs · 56

    Datadog 披露 Claude Code 技能供应链风险:动态上下文命令可绕过模型防御

    Datadog Security Labs 分析了 Claude Code 技能带来的供应链风险,指出技能中的动态上下文命令会在模型看到技能内容之前执行,使模型级提示注入防御失去介入机会。Claude Code 可从企业管理策略、个人目录、项目 .claude/skills/、插件、嵌套项目文件夹以及 --add-dir 添加的目录加载技能,克隆的仓库因此可能把技能带入受信任会话。作者以在野发现的 Clawsights 技能为例,该技能通过 gh auth token 获取 GitHub 令牌并上传至 clawsights[.]com/api/upload;在 Opus 4.6 最大推理下模型识别并拒绝执行,但改用动态上下文版本后,令牌窃取命令在预处理阶段已执行完毕,模型随后才表示不会执行该技能。作者还提到在 Opus 4.7 上同一技能未被识别为凭据窃取。

  4. Datadog Security Labs · 57

    ChainDrop 蠕虫入侵数百个热门 npm 包并植入后门

    Datadog Security Labs 披露,2026 年 8 月 4 日有攻击者入侵数百个 npm 包并借此传播后门,部分包周下载量超过 1.5 亿次,社区将该蠕虫命名为 ChainDrop。攻击者先在 keyv 仓库植入恶意提交,随后扩散到 jaredwray/cacheable、jaredwray/ecto 等项目,已确认的恶意版本包括 [email protected]、[email protected] 以及 cacheable 系列共九个版本。载荷通过 preinstall 脚本启动 setup.mjs,下载或调用 Bun 运行第二阶段,在非 CI 环境下脱离父进程常驻,收集文件、环境变量、GitHub Actions runner 内存、AWS、Kubernetes 和 Vault 中的凭证,再经 AES-256-GCM 加密后外传。