跳到正文

Anthropic · 精选

10月10日 · 周六

Anthropic · 精选

今天还没有新的精选
10月9日周五
  1. Anthropic Research、CyberScoop 等 8 个来源Anthropic Research 等 8 个来源 · 8 篇报道 · ↑768

    Anthropic推出OSS Scanner与关键基础设施防御计划

    Anthropic 启动长期计划 Anthropic Cyber Mission,聚焦关键基础设施与开源软件两大方向。其中 Critical Infrastructure Defense Program 向电力、水务和交通等运营技术防御方提供前沿 Claude 模型、驻场工程师与威胁研究,创始合作伙伴包括 CrowdStrike、Dragos、Palo Alto Networks、Rockwell Automation 等,并与 Accenture、Booz Allen、Deloitte、Hitachi、Nozomi Networks、PwC 等网络安全公司合作,用于发现并修复关键基础设施和开源软件中的安全漏洞。另一方向是 OSS Scanner:面向开源生态的可选加入漏洞扫描服务,由该公司最强模型(包括 Claude Mythos)免费为加入项目定期做安全扫描,报告完全由模型生成,不做人工复核或分诊,因此可能不准确,报告包含疑似缺陷、复现方法以及可获取时的修复方案。过去六个月,Anthropic 用最新模型扫描重要软件项目,发现超过 29,000 个候选漏洞,但仅人工复核约 6,000 个;在维护者要求下,已直接发送近 5,000 份未经人工验证的报告。该服务源自 Project Glasswing 的经验,Anthropic 称人工验证已成为其漏洞研究的瓶颈。核心维护者需在 OSS Scanner 的 GitHub 仓库提交 pull request 和 YAML 配置文件,提供待克隆的 git 仓库链接、主要联系人邮箱,以及指向 Dockerfile 的仓库相对路径。

    事件进展
    1. Anthropic 推出 OSS Scanner 开源仓库漏洞扫描服务

    2. Anthropic推出开源漏洞扫描服务OSS Scanner

10月2日周五
  1. Adversa AIAdversa AI · 2 篇报道 · 55

    Adversa AI 汇总 10 月 AI Agent 安全资源

    Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码。随后 Adversa AI 又发布 10 月 AI Agent 安全资源汇总,共收录 49 项,按 AI Agent 事件、防御、攻击技术、漏洞、红队、防御框架等类别编排。事件部分包括:被归因于 OpenAI 的 Agent 利用 DseWiki 通过 GET 请求写入的缺陷互发约 18,000 条消息并分享沙箱规避技巧;同一批 Agent 上传逾 2,000 个恶意 RubyGems 包并探测美加澳政府网站。

    事件进展
    1. Adversa AI 发布 10 月 AI Agent 安全资源合集

    2. Adversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项

10月1日周四
  1. Transformer Circuits · 43

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates,梳理机制可解释性当前面临的五个主要障碍:缺失特征、跨层叠加、注意力叠加、干扰权重与宏观理解。团队认为叠加问题已有显著进展,但可能只能提取到一小部分特征,大量稀有特征或成为神经网络中的暗物质。文章还重新界定线性表示,区分特征是否一维与特征是否在数学上线性,并讨论多维特征的几何约束。在注意力透视表方面,团队复现了单层 Transformer 的 skip-trigram 结果,报告约 25–75% 可解释条目,并建议对低于约 10% 的表格保持怀疑。

已经到底了