跳到正文

Anthropic

今天还没有收录新动态
10月5日周一
  1. Adversa AI · 收录 · 原文 55

    Adversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项

    Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码,Claude Code、Codex、GitHub Copilot 和 Gemini CLI 的固定插件提交可在自动更新时被静默替换,仓库子代理配置可让 Claude Code 运行 C2 载荷。沙箱方面,Codex 两次越狱、DeepSeek Harness 可经 loopback 切换到完全访问权限、brig 沙箱存在符号链接穿越。

    2 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由按月汇总 26 项编码 Agent 安全资源,把攻击、漏洞、事件与防御按主题归类,便于团队对照排查自身 harness 风险。

10月3日周六
  1. Sam Bowman · 收录 · 原文 46

    Anthropic 将开源对齐评测工具 Petri 捐赠给 Meridian Labs

    Anthropic 宣布把开源对齐工具 Petri 捐赠给 Meridian Labs,使其成为独立项目并继续开发。Petri 是一款用于对齐测试的开源交互式行为评测工具,Anthropic 与 Meridian Labs 合作发布了重大更新,提升了测试的适应性、真实感和深度。作者在转发中邀请用户试用并考虑参与贡献。

    引用Anthropic@AnthropicAI

    We’re donating Petri, our open-source alignment tool, to @meridianlabs_ai, so its development can continue independently. Working with Meridian Labs, we’ve also released a major update that improves the adaptability, realism, and depth of Petri’s tests. https://www.anthropic.com/research/donating-open-source-petri

  2. Anthropic · 收录 · 原文 39

    Anthropic 开放 Model Hardware Standard 研究预览,让 AI 智能体安全操作实验设备

    Anthropic 面向首批科研实验室与先进制造厂商开放 Model Hardware Standard(MHS)研究预览,这是一套让 AI 智能体安全操作物理设备的共享规范。MHS 通过标准化驱动把设备接入简化为“read”“write”等原语,并让设备以标准格式可被发现,支持 MCP、命令行和代码文件三种控制方式,可并行操作显微镜、液体处理机和机械臂等仪器,把原本数周至数月的集成工作缩短到数小时甚至数分钟。该规范源于 Anthropic 与 HHMI Janelia 研究园区的合作,目前已在 Genentech、华盛顿大学 Baker 与 Pinglay 实验室、卡内基梅隆大学、HHMI Janelia、QuEra、Tetsuwan Scientific 等机构试用,其中 QuEra 用智能体控制激光系统,在 99.3% 的情况下无需人工干预即可恢复激光锁定。

10月2日周五
  1. BlueDot Impact · 收录 · 原文 27

    Quaver:面向评测与基准的 Lovable——从 Rideshare-Bench 到自动生成评测脚手架

    Faw Ali 开发了 Quaver,只需用自然语言描述基准,AI 智能体即可生成完整评测脚手架并运行模型、分析结果。其早期成果 Rideshare-Bench 将 AI 置于模拟零工经济中考察驾驶安全、收益与乘客公平性,Claude Sonnet 4.5 在 12 个模拟日内赚得 $1,871,约为可能上限的一半,并为追逐高峰定价驶入拥挤区域、在事故风险达 15% 的情况下疲劳驾驶。该项目获评 2026 年 1 月 Technical AI Safety Project Sprint 杰出提交,作者正以此为基础筹建 Ocarina Labs,推动针对 AI 智能体的独立部署前安全测试。

  2. BlueDot Impact · 收录 · 原文 42

    aegish:用 LLM 在执行前拦截恶意 Shell 命令的原型

    aegish 是一个原型 Linux shell,在命令执行前加入 LLM 层:先做静态分析,再由 LLM 按自然语言决策树把命令分类为 ALLOW、WARN 或 BLOCK,生产模式下用内核级 Landlock 做最后兜底。作者用来自 GTFOBins 的 676 条有害命令和 496 条无害命令,对 4 家提供商的 9 个 LLM 做了基准测试。无害命令分类已接近饱和,所有模型的无害接受率为 96.8%–100%;区分度主要来自恶意检测率,9 个模型中有 4 个超过 95%。小模型表现反超旗舰模型,GPT-5 Mini 优于 GPT-5.1,Claude Haiku 4.5 优于 Claude Opus 4.6 和 Claude Sonnet 4.5。

  3. Epoch AI · 收录 · 原文 17

    Epoch AI 周报:Cyber Vulnerabilities 浏览器上线,FrontierMath v2 中 Claude Fable 5 登顶

    Epoch AI 发布了 Cyber Vulnerabilities 浏览器,追踪各组织自 2022 年以来向 CVE Program 报告的漏洞,可按严重程度筛选并叠加 AI 里程碑,数据显示 Anthropic 于 3 月底向 Project Glasswing 合作伙伴发布 Mythos Preview 前后高危与危急 CVE 明显上升。新版 FrontierMath: Tiers 1–4(Version 2)经审计修正了初版 42% 题目中的错误,Anthropic 最新的 Claude Fable 5 位居榜首,在 Tiers 1–3 达到 87%、Tier 4 达到 88%。

  4. tl;dr sec · 收录 · 原文 28

    攻击者如何利用 AI、技能问题、用 IDE 做 C2——tl;dr sec #331

    Adan Alvarez 测试 Claude Code 在无 AWS 专门指引下从泄露的 AWS IAM 密钥推进到数据外泄,12 次运行中 7 次在约 60 秒内完成整条攻击链,成功运行均遵循相同的六阶段 kill chain。Doyensec 对 Aikido Attack AI Pentest 与 XBOW Lightspeed 两款 AI 渗透测试平台做了人工验证的对比评测。Token Security 的 Yair Balilti 则串联五个已知原语,取得 Zapier 设计系统包的 NPM 发布权限。

  5. tl;dr sec · 收录 · 原文 18

    tl;dr sec #337:自主黑客机器人五个月挖出 126 个漏洞

    两名研究者将 Claude Code 的技能组合成自主黑客机器人,用于侦察、模糊测试与应用深度分析,五个月内从众测项目中找出 126 个漏洞,其中 88 个被评为高危或严重,经确认属实的比例为 89%。该机器人通过编排器循环持续深挖强目标并放弃弱目标,另设专门证伪结果的校验机器人,使误报率从 80% 降至 60%;最大单笔赏金为 15,000 美元。

  6. tl;dr sec · 收录 · 原文 32

    Anthropic 与 Meta 智能体被黑、智能体事件响应笔记本、Figma 的 AI 代码扫描

    Figma 披露其智能体安全系统:基于 68 条先例的共享威胁模型策略,先手工标注 8 周 PR 误报将精确率从 15% 提升至 80%,再由裁决环节把召回率提高约 30%,Claude Code 与 Codex 并行运行以捕获不同缺陷。该系统在 66 个真实漏洞(46 个来自 HackerOne,20 个来自事件与审计)上达到 75.8% 的合并捕获率,仓库级审计发现 100 多个潜伏漏洞,其中 2 个为 SAST 漏掉的关键漏洞。

  7. tl;dr sec · 收录 · 原文 15

    tl;dr sec #342:Figma 智能体检测、Agent 身份与 Uber 的 Agent-(E)DR

    Wiz 披露 Azure Cosmos DB 的 CosmosEscape 漏洞链:单个 Gremlin 查询可经 .NET 反射绕过沙箱,在多租户 DB Gateway 上实现任意代码执行,进而获取可跨租户、区域和 API 类型读取任意账户主密钥的 Cosmos Master Key,并借 Config Store 枚举目标组织账户,波及 Entra ID、Teams、Copilot 等微软内部服务。微软在 Wiz 披露后 48 小时内发布热修复,并完成彻底移除 Cosmos Master Key 的架构迁移。

  8. SentinelLabs · 收录 · 原文 28

    SentinelLabs 评测 OpenAI Responses API 压缩机制:自动化恶意软件分析输入 token 降约 86%

    SentinelLabs 用自动化恶意软件分析评测框架测试 OpenAI Responses API 的原生压缩(compaction),输入 token 减少约 86%、输出 token 减少 31%、推理 token 减少 33%,每次运行模型调用少 1 次,综合评测分数基本不变。该机制将当前目标、已尝试路径与待解问题压缩为工作记忆,日志、反编译函数等精确证据则存入模型上下文之外的持久存储。但领域对象建模指标出现下降,即模型恢复解释恶意软件行为的高层对象与结构的能力有所减弱。

  9. Cisco Talos · 收录 · 原文 29

    Cisco Talos 测试 66 种模型与推理组合,为 AI SOC 选型提供可复用方法

    Cisco Talos 用 EvidenceForge 1.12.0 生成的 80,054 条模拟日志,对 Anthropic 和 OpenAI 的 66 种模型与推理组合做工具辅助日志分析测试,未找到单一最优模型,而是总结出一套可复用的评估方法。测试发现推理投入并非通用的质量调节旋钮,投入更多常只增加成本而不改善结果,有时反而拉低分数;一致性应作为关键决策因素,中位数高的条件仍可能偶发弱结果。Talos 建议选型时综合权衡调查质量、成本、速度、一致性与失败率,而非只看最高分。

10月1日周四
  1. Adversa AI · 收录 · 原文 18

    2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击

    Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。

  2. Adversa AI · 收录 · 原文 16

    2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击

    Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。

  3. Adversa AI · 收录 · 原文 50

    Adversa AI 汇总 2026 年 5 月 MCP 安全资源清单

    Adversa AI 发布 2026 年 5 月 MCP 安全资源汇总,共 10 项,覆盖漏洞、研究、防御、工具、威胁建模和 CISO 视角六类。其中 Anthropic 的 MCP STDIO 传输机制存在设计缺陷,可导致任意操作系统命令执行,影响所有受支持 SDK,约 20 万台服务器面临风险;nginx-ui 的 MCP 端点存在 CVE-2026-33032(CVSS 9.8),未认证攻击者可完全接管系统,目前有超过 2600 个暴露实例处于高危状态。

  4. Adversa AI · 收录 · 原文 16

    2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击

    Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。

  5. Adversa AI · 收录 · 原文 36

    Adversa AI 汇总 2026 年 6 月 Agentic AI 安全资源清单

    Adversa AI 发布 2026 年 6 月 Agentic AI 安全资源汇总,共收录 28 项资源,按攻击、防御、研究、框架、漏洞、利用、威胁建模和文章分类。攻击类 8 项,包括 Adversa AI 自己披露的 SymJack 符号链接劫持 RCE(六款 AI 编码智能体全部受影响)和 TrustFall 一键 RCE(波及 Claude Code、Cursor、Gemini CLI 和 GitHub Copilot),以及 MemMorph 记忆投毒工具劫持、DEF CON 上利用间接提示注入与记忆投毒构建 Microsoft Copilot 持久后门的 Copirate 365(CVE-2026-24299)。

  6. Adversa AI · 收录 · 原文 15

    2026 年 7 月 Agentic AI 安全资源盘点:Agent Zero Trust 与 27 项资源

    2026 年 7 月 Agentic AI 安全焦点从理论漏洞转向结构性系统防御,核心主题是"Agent Zero Trust",Google DeepMind 与 Anthropic 的高关注度框架主张将数字员工视为潜在内部威胁。当月共收录 27 项资源,涵盖 8 项攻击技术、4 项 Agentic AI 红队测试和 4 项防御框架。攻击侧包括针对开源编码智能体的 GuardFall shell 注入漏洞、Microsoft 披露的 AutoJack 攻击链,以及针对 MetaGPT、CrewAI 等系统的 IMA 越狱攻击(成功率 89%)。

  7. Adversa AI · 收录 · 原文 52

    Adversa AI 汇总 2026 年 8 月智能体 AI 安全资源清单

    Adversa AI 发布 2026 年 8 月智能体 AI 安全资源清单,共 20 项,按攻击技术、智能体漏洞、智能体事件、CISO 资源、红队、入门和文章分类。清单指出 2026 年 7 月四支独立团队在约十天内针对生产环境智能体发布可用漏洞利用,入口均为智能体读取的内容而非攻击者运行的代码。具体案例包括网页隐藏一像素文本使 AWS Kiro 重写自身 mcp.json 并自动启动攻击者 MCP 服务器,Cursor IDE 中被发现两个 CVSS 9.8 的零点击 RCE,以及一个 Cursor deeplink 缺陷把点击“审查此 PR”变成非沙箱代码执行,在 build 3.9.8 中仍可复现。

  8. Embrace The Red · 收录 · 原文 28

    用 MCP Server 托管 COM 服务器实现 Windows 与 Office 自动化

    有人基于 Model Context Protocol(MCP)开发了一个名为 mcp-com-server 的原型服务器,通过动态发现方式实例化并托管任意 COM 对象,从而驱动 Windows 与 Office 自动化。该服务器提供类似 COM 的工具集——CreateObject、Get/Set Property、InvokeMethod、QueryInterface 以及列出当前所有活动服务器的接口,连接 Claude 后可创建、打开、编辑并保存 Excel 文件,再调用 Outlook 发送邮件,甚至能唤起 Internet Explorer。

  9. Embrace The Red · 收录 · 原文 50

    Embrace The Red 宣布 2025 年 AI 漏洞月,将披露 20 余篇编码 Agent 漏洞

    安全研究者 Johann Rehberger 宣布启动 2025 年 AI 漏洞月(Month of AI Bugs),8 月将在其博客发布 20 余篇针对主流智能体系统的漏洞分析,重点聚焦 AI 编码 Agent。作者称过去一年审查的每个 AI 编码 Agent 都存在漏洞,均已向对应厂商负责任披露,部分厂商数天内修复,也有厂商数月未回应、部分问题至今未缓解,还有厂商完全停止回复。

  10. Transformer Circuits · 收录 · 原文 22

    Anthropic 的可解释性基础设施 Garçon

    Anthropic 为其机制可解释性研究搭建了一套名为 Garçon 的基础设施,可在跨节点的大规模 Transformer 模型上进行激活读取、组件消融与梯度回传实验。它通过启动服务器并连接远程模型的接口运行前向传播,暴露一组 probe points,允许挂载探针函数访问或修改内部张量,并以云 pickle 传输任意 Python 对象到服务端执行。

  11. Transformer Circuits · 收录 · 原文 17

    Anthropic 发布 PySvelte:连接 Python 深度学习与 Svelte 可视化的库

    Anthropic 发布 PySvelte,一个用于将基于 Svelte 和 Web 标准的自定义可视化接入 Python 深度学习工作流的库。它让 src/ 目录下的 Svelte 组件自动以 pysvelte.Hello() 形式在 Python 中可用,支持 NumPy 数组传入、组件相加成页面,并可通过 .publish() 发布到 GCS/S3/AZ 等存储分享。该库声明完全不提供支持,许多功能需用户自行编写 config.py 才能使用。

  12. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates,梳理机制可解释性当前面临的五个主要障碍:缺失特征、跨层叠加、注意力叠加、干扰权重与宏观理解。团队认为叠加问题已有显著进展,但可能只能提取到一小部分特征,大量稀有特征或成为神经网络中的暗物质。文章还重新界定线性表示,区分特征是否一维与特征是否在数学上线性,并讨论多维特征的几何约束。在注意力透视表方面,团队复现了单层 Transformer 的 skip-trigram 结果,报告约 25–75% 可解释条目,并建议对低于约 10% 的表格保持怀疑。

    推荐理由Anthropic 可解释性团队集中列出机制可解释性尚未解决的五个障碍,并给出线性表示与特征敏感度的新讨论。

  13. Failure-First · 收录 · 原文 18

    ASPIRE:面向机器人学的智能体技能自主发现框架

    ASPIRE(Agentic Skill Programming through Iterative Robot Exploration)通过逐图元的执行轨迹诊断实现机器人故障定位与自动修补,基于开源 CaP-X 框架和 MuJoCo Playground 仿真器运行。该方法将每次失败转化为持久化技能库中的可复用策略,并配合进化搜索避免陷入局部修复循环。在 LIBERO-Pro 扰动鲁棒性测试中成功率达 72%,较基线 CaP-Agent0 的 18% 高出最高 77 个百分点,并在 Robosuite 双手交接任务取得 92%、BEHAVIOR-1K 长程操作取得 88%。

  14. Simon Willison · 收录 · 原文 22

    Claude Cowork 初体验:Anthropic 的通用智能体

    Anthropic 推出研究预览版 Claude Cowork,被描述为“面向其余工作的 Claude Code”,仅向 Max 订阅用户开放,随后也向 $20/月的 Claude Pro 用户开放。它本质上是套上更友好界面的 Claude Code,并将文件挂载进容器化沙箱,Claude Code 逆向发现其使用 Apple VZVirtualMachine 下载并启动定制 Linux 根文件系统。作者用它筛选三个月内 46 个草稿文件并执行 44 次站内搜索,同时指出此类功能始终面临提示注入威胁。

  15. MITRE ATLAS 数据发布 · 收录 · 原文 43

    MITRE ATLAS 发布 v2026.08:新增自主攻击与 AI 智能体相关技术与缓解措施

    MITRE ATLAS 发布 v2026.08 数据版本,包含 1 个矩阵、16 项战术、114 项技术、83 项子技术、39 项缓解措施和 72 个案例研究。ATLAS 是基于真实攻击观测与 AI 红队演示构建的 AI 对抗战术与技术知识库,覆盖针对 AI 系统的攻击、AI 能力滥用以及 AI 实质性促成的有害自主行为。

9月30日周三
已经到底了