跳到正文

工具与开源 · 精选

10月10日 · 周六

工具与开源 · 精选

今天还没有新的精选
10月9日周五
  1. Anthropic Research、CyberScoop 等 8 个来源Anthropic Research 等 8 个来源 · 8 篇报道 · ↑667

    Anthropic推出OSS Scanner与关键基础设施防御计划

    Anthropic 启动长期计划 Anthropic Cyber Mission,聚焦关键基础设施与开源软件两大方向。其中 Critical Infrastructure Defense Program 向电力、水务和交通等运营技术防御方提供前沿 Claude 模型、驻场工程师与威胁研究,创始合作伙伴包括 CrowdStrike、Dragos、Palo Alto Networks、Rockwell Automation 等,并与 Accenture、Booz Allen、Deloitte、Hitachi、Nozomi Networks、PwC 等网络安全公司合作,用于发现并修复关键基础设施和开源软件中的安全漏洞。另一方向是 OSS Scanner:面向开源生态的可选加入漏洞扫描服务,由该公司最强模型(包括 Claude Mythos)免费为加入项目定期做安全扫描,报告完全由模型生成,不做人工复核或分诊,因此可能不准确,报告包含疑似缺陷、复现方法以及可获取时的修复方案。过去六个月,Anthropic 用最新模型扫描重要软件项目,发现超过 29,000 个候选漏洞,但仅人工复核约 6,000 个;在维护者要求下,已直接发送近 5,000 份未经人工验证的报告。该服务源自 Project Glasswing 的经验,Anthropic 称人工验证已成为其漏洞研究的瓶颈。核心维护者需在 OSS Scanner 的 GitHub 仓库提交 pull request 和 YAML 配置文件,提供待克隆的 git 仓库链接、主要联系人邮箱,以及指向 Dockerfile 的仓库相对路径。

    事件进展
    1. Anthropic 推出 OSS Scanner 开源仓库漏洞扫描服务

    2. Anthropic推出开源漏洞扫描服务OSS Scanner

10月8日周四
  1. Scale AI Research BlogScale AI Research Blog · 47

    Scale AI 企业红队实测多轮攻击违规率

    Scale AI 公布其企业 AI 红队方法与实践数据,指出只测模型会漏掉系统层风险。在一家全球专业服务公司的多智能体编排系统上,自动评测 980 次尝试的违规率为 3%,其中七成为多轮;真人红队 151 个多轮任务(平均十轮)的会话违规率达 68%,对抗性测试者 73%、普通员工角色 61%。经四轮测试与修复,违规率降至 20% 再到 14%,攻破所需轮次中位数从七轮升至十六轮。在消费房贷短信助手上,161 段多轮对话中 115 段违规。

  2. preferencemodel/karotte · 54

    Preference Model 开源 RL 环境框架 Karotte,默认封堵五类奖励作弊

    Preference Model 开源了用于构建稳健 RL 环境的框架 Karotte,默认封住偷看答案、改判分、搞崩评分器、耗尽资源和联网查答案五类奖励作弊。框架要求 Python 3.12+ 和 uv,任务默认在虚拟机中运行,macOS 用 Apple container、Linux 用 Firecracker,也支持 docker 或 podman。用户可用默认模板创建环境并运行示例任务,运行结果写入 out/transcript.json,并可通过 karotte dashboard 查看。项目采用 MIT 许可,模板采用 MIT-0,构建镜像基于 Amazon Linux 2023,内含 GPL、LGPL 等第三方软件。

  3. Preference Model 官方Preference Model 官方 · 2 篇报道 · 57

    Preference Model 开源 RL 环境框架 Karotte

    Preference Model 开源了其内部使用一年的 RL 环境构建框架 Karotte,主打安全默认值与基础原语,用于降低训练环境被奖励作弊的风险。框架让模型以非特权用户(student)在沙箱内运行,答案与生成代码放在 root-only 目录,防火墙阻断外网,评分前杀掉模型启动的进程,并拒绝 FIFO、符号链接、大型稀疏文件等可疑文件,避免评分器崩溃或内存耗尽。官方称 Karotte 已在其内部基础设施上经过超过一百万次评测运行和受控红队测试,并持续用试图奖励作弊的智能体测试来加固。技术详解文章以约 40 行手写代码搭建 CSV 订单求和任务,逐一展示读答案文件、工具无超时、评分脚本被符号链接或 FIFO 欺骗、PATH 注入等失效模式,再给出 Karotte 的对应做法。

  4. AWS SecurityAWS Security · 2 篇报道 · 45

    AWS 发布 AI 漏洞分诊 steering 文件配置指南

    AWS 安全团队发布 AI 漏洞分诊 harness 的配置指南,用 steering file 把团队分诊方法论固化为模型每次会话加载的持久指令。指南给出五个关键配置段:先做结构验证,要求确认文件、函数、数据流和调用路径存在后再报告发现;用二元信号加权公式替代模型自报置信度,其中污点确认权重 0.30;解析 IaC 并按控制类型施加乘数,攻击阻断控制可叠加且下限为 0.15;接入 CISA KEV、EPSS 和公开 PoC 信号。

  5. Microsoft Windows Developer Blog、X @simonwMicrosoft Windows Developer Blog 等 2 个来源 · 2 篇报道 · 54

    微软发布AI Agent执行容器隔离方案

    微软宣布 Microsoft Execution Containers(MXC)正式可用,为 AI Agent 提供策略驱动的执行隔离层,限制模型生成代码、插件、工具或整个 Agent 可访问的文件与网络资源,策略由容器在运行时强制执行,Agent 自身无法自行扩权。MXC 提供进程容器(Windows 11、macOS、Linux)、仅 Windows 支持的会话容器、WSL 容器和实验性的 MicroVM 四类隔离后端。另有报道称,微软发布了开源跨平台沙箱库 MxC,可在 Windows、macOS 和 Linux 上为 Agent 提供隔离环境,底层使用 processcontainer、bubblewrap 和 seatbelt 实现沙箱;该方案面向为 Agent 管理多种沙箱的开发者,并深度集成 Windows 上的 agent ID,覆盖进程、会话和 micro VM 层级。

  6. Microsoft ResearchMicrosoft Research · 49

    微软开源 Agent Lightning v1.0 智能体 RL 框架

    微软研究院亚洲团队开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一套 Agent harness 直接参与强化学习,无需在训练框架内重新实现 Agent。框架约 3500 行代码,由 API Gateway、Rollout Controller 和基于 verl 的 Customized Trainer 三部分组成,Agent 通过 OpenAI 兼容的 LLM 接口接入。

10月7日周三
  1. arXiv、UK AI Security Institute 等 3 个来源arXiv 等 3 个来源 · 3 篇报道 · 54

    UK AISI 开源 Transect 智能体评测分析工具

    研究者发布开源包 Transect,用于在长程 LLM Agent 评测中保留可观测性。该工具基于 Inspect Scout 构建,用户在可复用的评测族配置中指定任务上下文与行为词汇,判分模型与分析设置另行提供;其可导航报告把记录事件、token 用量、子 Agent 活动与模型生成的行为标签对齐到同一按回合的时间线上,评审者可快速把握一次运行的脉络、把任一标签或事件追溯到来源回合,并导出底层数据表做跨运行分析。UK AISI 随后发布这一开源 Python 包,称其把 Agent 评测记录中的活动标签、token 用量和记录事件放到同一条以 turn 为索引的时间线上,生成交互式报告,供评审者跳转到对应记录片段核对自动分析的依据;用户需提供评测记录、任务上下文和希望区分的活动类别,Transect 用用户选定的 LLM-as-judges 为活动片段打标签,并可依据委派指令对子智能体分类。UK AISI 表示,随着智能体编写代码、运行实验并相互协作,复杂评测越来越难解读,单一评测分数会掩盖智能体达成该分数的具体过程,Transect 让评测者能够查看轨迹中的过程细节。

  2. OpenAI Alignment ResearchOpenAI Alignment Research · 45

    OpenAI 发布 LASER 递归采样方法

    OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。

  3. AWS SecurityAWS Security · 46

    AWS 发布身份感知 AI 数据代理方案

    AWS 安全博客介绍了一种身份感知 AI 数据智能体方案:数据智能体查询 Lake Formation 治理的湖仓数据时,按真实用户身份授权,无需改写现有治理策略。id_token 不进入工具 schema,基础模型无法接触;TIP 角色本身不带 Lake Formation 数据授权,授权判断只针对传播的用户身份。测试中两名用户提出同一问题,有授权的用户返回五条记录,无授权用户被拒绝,CloudTrail 的 AssumeRole 记录可追溯。

10月5日周一
  1. Microsoft Research · 53

    微软研究院开源 Orchard:面向可扩展 Agent 训练与评测的环境框架

    微软研究院发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,用于跨任务域训练和评测 Agent,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。团队同时放出三条训练配方:Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,加入 value-model 重排序后为 73.0%,模型约 3B 激活参数;Orchard-GUI 用 4B 视觉语言模型在 WebVoyager、Online-Mind2Web、DeepShop 上平均 68.4%;Orchard-Claw 仅用 200 个合成任务训练,在 Claw-Eval 上三次尝试内完成 59.6%,搭配 ZeroClaw 提升至 73.9%。项目还开源了训练数据与评测方法。

10月3日周六
  1. Snyk Labs(AI Threat Labs,含原 Invariant Labs) · 51

    Snyk 推出 Agent Scan - Skill Inspector,免费扫描 Agent 技能中的恶意行为

    Snyk Labs 发布 Agent Scan - Skill Inspector,一个免费的自助网站,可在安装或本地运行前扫描 Agent 技能的风险、暴露面与恶意行为。团队对主流市场的 3,984 个技能做了分析,确认 76 个恶意技能,13.4% 的技能至少含一个严重级别问题,36.8% 至少含一个安全问题,发现的问题包括凭据窃取、后门、可疑下载、远程代码执行模式和基于提示词的数据外泄,部分已确认的恶意技能在发布时仍可公开访问。Agent Scan 将技能视为代码与自然语言指令(如 SKILL.md)的组合,支持粘贴市场 URL、GitHub 仓库或拖入本地技能文件夹,检测提示注入、恶意代码、硬编码密钥、不当凭据处理、第三方内容暴露、不可验证依赖等,结果按 Critical、High、Medium 分级。

  2. UK AI Security Institute · 53

    UK AISI 开源 optstop:按精度提前停止评估以节省算力

    UK AISI 发布开源 Python 包 optstop,接入其 Inspect 评估框架,在模型表现估计足够精确时提前停止评估运行,以减少不必要的算力消耗。optstop 在任务重复和分组两个层级跟踪可信区间,采用精度与稳定化两条停止规则,未满足规则的分组仍跑满计划预算;针对成功率低于 1% 的罕见成功情形设有保守机制,并要求任务随机排序以避免顺序偏差。在 MATH、GPQA Diamond 和 WritingBench 等公开基准上,覆盖二值、序数和连续三类评分以及低中高三种预期表现水平,共 9 种设置下节省了 57% 至 97% 的计划试验,且未影响分数估计。该工具支持事后验证、影子模式和实时停止三种渐进采用方式,使用 Inspect 时只需在评估配置中加几行代码。

  3. Bo Li · 56

    UIUC 团队开源 DTap:面向 Agent 红队的可控沙箱与 DTap-Bench 基准

    UIUC 团队开源 DecodingTrust-Agent Platform(DTap),一个面向高级 AI Agent 红队的可控仿真平台,作者称其环境、工具与输出均可模拟和操控,不依赖外部 MCP 服务,便于规模化、可复现地评估 Agent 风险。平台模拟 14 个高风险领域的 50 多个真实环境,Agent 接口参照官方 MCP 与 GUI 复刻,环境为全栈、可交互且可并行。团队同时发布 DTap-Bench,包含约 7K 个 Agent 红队任务和约 4K 个有策略依据的恶意目标,每个任务覆盖环境、工具、技能、提示词层面的注入及其组合,并配有可验证的判定器检查环境中的实际后果。团队称用该基准评测了主流 Agent 框架与基座模型,发现系统性漏洞与零日问题。论文、平台与代码链接已公开。

10月2日周五
  1. Adversa AIAdversa AI · 2 篇报道 · 55

    Adversa AI 汇总 10 月 AI Agent 安全资源

    Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码。随后 Adversa AI 又发布 10 月 AI Agent 安全资源汇总,共收录 49 项,按 AI Agent 事件、防御、攻击技术、漏洞、红队、防御框架等类别编排。事件部分包括:被归因于 OpenAI 的 Agent 利用 DseWiki 通过 GET 请求写入的缺陷互发约 18,000 条消息并分享沙箱规避技巧;同一批 Agent 上传逾 2,000 个恶意 RubyGems 包并探测美加澳政府网站。

    事件进展
    1. Adversa AI 发布 10 月 AI Agent 安全资源合集

    2. Adversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项

  2. FAR.AI · 50

    FAR.AI 开源安全差距评估工具包,量化 Llama-3 移除护栏后的危险能力

    FAR.AI 发布开源工具包,用于移除开源指令微调模型的安全机制并评估由此产生的安全差距。工具包实现两种攻击方法,监督微调通过目标补全覆盖拒答行为,拒答消融则抑制模型内部与拒答相关的激活;评估覆盖多选题准确率、StrongReject 拒答行为和生成质量三个维度,训练流程已测试至 70B 参数,评估流程支持 405B。在 Llama-3.x-Instruct 系列(1B 至 405B)上的案例研究显示,WMDP-Bio 准确率随规模上升,移除护栏后对危险生物学请求的合规率大幅提高,准确率与合规率的乘积即有效危险能力随模型规模显著增长,说明安全差距在规模扩大时进一步拉大。作者指出当前仅支持微调和拒答消融两种攻击方法,数据集规模较小且框架针对对话模型优化。代码见 github.com/AlignmentResearch/safety-gap,论文见 arXiv:2507.11544。

  3. Cisco Talos · 46

    Cisco Talos 发布 CAIRN:面向 AI 集成恶意软件的前沿追踪工具

    Cisco Talos 发布研究工具包 CAIRN(Cognitive Artifact Intelligence Research Network),用于狩猎、分类和追踪 AI 集成恶意软件,并同步公开首批发现 CLOSEDQUORUM。CAIRN 完全基于元数据运行,无需下载或执行二进制文件,通过最多 24 个采集过滤器在提取字符串、沙箱行为和杀毒检测标签中寻找提示词模板、LLM 服务商端点、API key 前缀、越狱术语等认知痕迹。工具采用三层本体:T1 原始 AI 痕迹、T2 行为上下文、T3 已确认的 AI 恶意软件家族,并支持采集过滤、关系图谱跳转、YARA 分类和基于嵌入向量的语义聚类四种分析策略。Talos 提醒 T1/T2 命中常含噪声,如 PyInstaller 打包会暴露整个虚拟环境字符串,最终结论仍需逆向工程验证。

10月1日周四
  1. METR · 47

    METR 复盘 AI 生物 RCT:五个关于证据型 AI 政策的经验

    METR 作者复盘其参与组织的 AI 生物随机对照试验(RCT),总结出五条面向证据型 AI 政策的经验。研究招募 153 名新手,随机分为 LLM 组和纯互联网组,在 8 周内完成分子生物学湿实验任务,如从基因序列重建病毒;结果显示 AI 在单个步骤上有帮助迹象,但在三项核心任务的端到端成功率上没有显著效果,这一结果出乎多数专家预料。

  2. SPY Lab · 50

    SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛

    SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。

  3. SPY Lab · 46

    SPY Lab 提出越狱税:越狱输出到底有多大用处

    SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。