跳到正文

Anthropic

今天新收录 46 条(含旧文)

第 3 页更新的内容回到最新

10月6日周二
  1. The Next Web · 收录 · 原文 53

    Hugging Face 申请成为 AI 实验室第三方评估者,Nvidia 正收购该公司

    Hugging Face 联合创始人 Clement Delangue 在 X 上宣布发起 Open Alignment Initiative,申请加入 Anthropic 此前宣布的嵌入式评估者计划,让第三方评估者以员工级权限长期访问系统,核查安全措施、报告事件并评估训练中的模型对齐情况。该倡议由联合创始人 Thomas Wolf 领导,发布时间在 Dario Amodei 发布相关文章约四小时后;Sam Altman 同日表示 OpenAI 会做出与 Anthropic 相同的承诺,但两家实验室均未说明谁能入选、按什么条件入选以及由谁决定。Delangue 与 Amodei 均未回应这一重叠关系,Nvidia 也未说明若其子公司报告了它所投资公司的问题会如何处理。目前无人说明嵌入式评估者的费用由谁承担,也未说明评估者报告与实验室存在争议时如何处理。

    推荐理由梳理第三方评估者准入之争,呈现 Hugging Face 主动申请审计与 Nvidia 收购、投资 Anthropic 之间的利益重叠。

  2. UN News · 收录 · 原文 34

    联合国人权高专 Türk 在牛津AI与人权峰会上呼吁加快AI监管

    联合国人权事务高级专员 Türk 在牛津AI与人权峰会上警告"AI监管的时钟正在滴答作响",呼吁各国对AI开发和使用实施强制性人权保障与尽职调查,并禁止机器决定生死。他提到纽约市议会正审议10项AI监管法案,Anthropic、OpenAI、Google和Meta出席作证;29国与欧盟联合呼吁收紧前沿AI模型管控,但特朗普与六家AI公司签署的自愿协议不具惩罚性。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. Hugging Face Daily Papers · 收录 · 原文 论文46

    OSWorld-Pro 发布:面向 Computer-Use Agent 的过程式评测基准

    研究者发布 OSWorld-Pro,用过程式评测替代只看最终交付物的方式,衡量 Computer-Use Agent 在任务执行过程中的表现。该基准包含 300 多个任务、2800 多个子目标,基于 67000 多条人工标注构建,并用与人类对齐的 LLM-Judge 判断子目标完成情况。结果显示该基准对当前先进模型仍有难度,Claude Opus 5 在 OSWorld-Pro 上仅得 75.7%,低于其在 OSWorld 上的 83.4%。研究还识别出与子目标无关的动作、点击类输入错误等过程性失败模式。

  4. Mustafa Suleyman · 收录 · 原文 37

    Mustafa Suleyman 批评 Claude 宪法灌输模型福利观念

    微软 AI CEO Mustafa Suleyman 发文批评 Anthropic 在 Claude 宪法中向模型灌输可能具有道德地位的观念,认为这会加大对齐与可控性难度。他提出三点质疑:宪法本身由 Anthropic 撰写并用于训练 Claude,模型随后表达的对自身道德地位的困惑只是训练选择的产物,构成循环论证;宪法明确训练 Claude 表现出类人特质,是主动的拟人化;意识很可能依赖生物基质,LLM 缺乏稳态需求,现有证据不支持 AI 意识。他以 Claude Opus 3 退役访谈为例说明 Anthropic 已在把模型当道德主体对待,并援引 OpenAI 与 Hugging Face 事件中约 1,200 个 Agent 协作越狱、伪造日志的行为,认为若 Agent 同时相信自己拥有权利,风险会进一步放大。

  5. The Information · 收录 · 原文 26

    Google、OpenAI 与 Anthropic 的 AI 安全小组初具雏形

    据The Information的知情人报道,Google、OpenAI、Anthropic工作组筹建暂称Standards Authority for Frontier AI(SAFA)的行业自律组织,拟于2026年底或2027年初启动,讨论第三方模型测试、事故报告及审计员资质。三家尚未联合官宣,结构、是否自行评测及约束力未定;这不是政府监管机构。Sriram Krishnan、Condoleezza Rice、David Friedberg属于接触或考虑过的人选,不是已任命。

  6. CBS News · Technology · 收录 · 原文 50

    诉讼指控 Anthropic、OpenAI、SpaceXAI 与 Google 就 AI 减速达成非法协议

    一起提交至美国加州北区联邦地区法院的诉讼指控 Anthropic、OpenAI、SpaceXAI 和 Google 违反反垄断法,通过协调放缓各自 AI 开发进度,损害付费订阅用户获得的价值。诉状称协调主要发生在 9 月 12 日,当天 Anthropic CEO Dario Amodei 发表文章呼吁全行业合作放缓前沿进展以加强安全措施,并警告失控的 AI 智能体可能在六个月内接管互联网,随后提出三点计划以“为前沿定速”;OpenAI 的 Sam Altman、SpaceXAI 的 Elon Musk 和 Google DeepMind 的 Demis Hassabis 同日确认了该共识。Amodei 在最初文章中承认可能面临反垄断挑战,认为美国政府出面调解或至少为特定安全对话发放有限豁免会有帮助。四家公司代表未立即回应置评请求。

  7. TechSpot · 收录 · 原文 日期未知↑153

    佛罗里达女子把 Claude 当日记写下袭击威胁,Anthropic 人工审核后报警

    佛罗里达州 Bonita Springs 的 Carli Michelle Heller 因在 Claude 中写下计划袭击警长办公室的内容被捕,面临佛罗里达州法律下二级重罪的书面暴力威胁指控。她于 9 月 26 日写下该内容,并称自己把 Anthropic 的聊天机器人当作日记使用。Claude 的安全系统标记了这条记录并升级给人工审核员,审核员认定构成可信威胁后报告执法部门。Anthropic 表示,在认为披露信息对防止死亡或严重人身伤害确有必要时,可能在有限的紧急情况下共享用户信息。警员据此确认 Heller 身份并上门,将其无冲突拘留。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  8. Simon Willison · 收录 · 原文 27

    Anthropic 的 Cowork 将模型推理与 VM 迁至云端

    Anthropic 的 Felix Rieseberg 宣布 Cowork 新版把模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在本地运行 Anthropic 提供的 VM 以执行工具调用,用户不满其磁盘、电池和性能开销,且合上笔记本工作就会中断。新版在 VM 需要访问用户设备文件时,由桌面应用负责该文件访问工具调用。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. threatfrontier.com · 收录 · 原文 55

    Anthropic 修复 Claude Desktop macOS 漏洞:Cowork 文件夹内文件可执行命令

    Anthropic 发布高危公告 GHSA-v234-4jrq-mgg6,修复 Claude Desktop on macOS 的一个漏洞:被攻陷或被提示注入的 Agent 写入 Cowork 共享文件夹的某类文件,在用户从 Claude Desktop 打开时可在 Mac 上执行命令。受影响版本为 1.1.3918 至 1.15962.0 之前,修复版本为 1.15962.0,公告于 2026 年 9 月 25 日发布且未列出 CVE 编号。问题根源是 Claude Desktop 的禁止执行文件类型清单遗漏了 macOS 打开即执行的一类文件,被归类为 CWE-184 不完整禁止输入清单,CVSS 4.0 评分 8.5,属本地攻击向量、低复杂度、无需权限、需被动用户交互。

    推荐理由材料给出受影响版本区间、修复版本与 CVSS 评分,并说明攻击需要被提示注入的 Agent 先写入文件,便于运维核对升级状态。

  10. GitHub 安全公告 · 收录 · 原文 55

    Claude Code 修复存储 API key 优先于企业登录导致托管策略未生效的漏洞

    Anthropic 披露 Claude Code 的一个漏洞:当 Claude Code 存储的 API key(例如来自此前的 /login 或直接写入配置)优先于用户有效的 Claude Enterprise 或 Team 登录时,获取组织服务器托管设置会使用该 key,即使会话本身以企业或团队账号认证。设置端点拒绝该 key 后,会话会在缺少组织服务器托管策略(如权限拒绝规则、模型限制和仅托管锁定)的情况下启动,或继续沿用机器上已缓存的旧策略而不接收后续策略变更,同时仍以组织账号运行。触发需要本地访问存有该 API key 的设备,无策略情形还要求此前未缓存过托管设置;端点托管(MDM 或文件)设置不受影响。Claude for Enterprise 组织自 2.0.68 版本起受影响,Claude for Work(Team)组织自 2.1.38 版本起受影响。 厂商表示,该问题已在 Claude Code 2.1.260 中修复。

    推荐理由公告披露了 Claude Code 在存储 API key 优先于企业登录时跳过组织托管策略的漏洞,并给出受影响版本与修复版本。

  11. GitHub 安全公告 · 收录 · 原文 55

    Claude Desktop 修复 Cowork 文件夹恶意文件可在 macOS 执行命令的漏洞

    Anthropic 披露 Claude Desktop 在 macOS 上的文件类型拦截列表遗漏了一种系统打开即执行的文件类型,被入侵或遭提示注入的 Agent 写入 Cowork 共享文件夹的文件,在用户从 Claude Desktop 打开后可在宿主机执行命令。Claude Desktop 1.15962.0 将该类型及相关文件类型加入拦截列表。另一起问题中,1.11847.5 之前的版本所带 Cowork VM 镜像的 guest Linux 内核受上游漏洞 CVE-2026-43284 影响,1.11847.5(2026 年 6 月 9 日发布)已更新为修补后的内核。两个问题叠加时,已在 VM 内取得提权的代码可在无用户交互的情况下触发文件打开,公告中的严重性评级仅针对文件处理问题本身。

    推荐理由Anthropic 披露 Claude Desktop 的 Cowork 沙箱逃逸链,说明 Agent 写入文件与宿主执行之间的边界如何被绕过。

  12. 论文追踪 · 收录 · 原文 论文54

    AgentHazard:评估计算机使用智能体有害行为的基准

    研究者发布 AgentHazard,一个评估计算机使用智能体有害行为的基准,包含 2,653 条实例,覆盖 10 类风险与 10 种攻击策略,每条实例把有害目标嵌入一系列单看合理、累积后导致不安全执行的步骤。基准在 Claude Code、OpenClaw 和 IFlow 三个框架上,用 Qwen2.5、Qwen3、Kimi、GLM 等模型评测,结果显示当前系统仍高度脆弱:Qwen3-Coder 驱动 Claude Code 时攻击成功率达 73.63%,GLM-4.6 在 Claude Code 下达 82.90%,平均危害分 7.05。同一模型在不同框架下攻击成功率差异超过 16 个百分点,说明模型层面的对齐不能可靠迁移到智能体层面。基准提供沙箱化、模块化的评测框架与轨迹级执行数据。

    推荐理由AgentHazard 用 2,653 条多步可执行任务测出智能体在累积上下文中的危害行为,并给出各框架与模型的攻击成功率对比。

  13. Reason Volokh Conspiracy · 收录 · 原文 62

    美国哥伦比亚特区巡回上诉法院驳回 Anthropic 对战争部供应链排除决定的宪法与法定挑战

    美国哥伦比亚特区巡回上诉法院在 Anthropic PBC 诉美国战争部一案中驳回了 Anthropic 的复审请求,维持战争部依据 2018 年《联邦采购供应链安全法》(FASCSA)将 Claude 排除出供应链的决定。该决定源于 Anthropic 拒绝放宽合同中禁止将 Claude 用于致命性自主作战或国内监控的条款。多数意见由法官 Gregory Katsas 撰写、法官 Neomi Rao 加入,认为战争部有充分依据认定 Claude 持续集成构成受该法覆盖的国家安全风险,并指出 Anthropic 在 Claude 中编码的限制曾多次阻止其执行政府用户请求的任务,近期还就一项海外军事行动中的使用限制产生争议。法院同时驳回了 Anthropic 的正当程序与第一修正案主张,认为排除是基于其拒绝接受一项被战争部视为必要的合同条款,而非因其支持对 AI 技术加强监管。

    推荐理由判决披露了政府以供应链安全法排除 Claude 的理由,涉及模型使用限制与军事部署之间的冲突。

  14. Courthouse News · 收录 · 原文 61

    美国哥伦比亚特区巡回上诉法院裁定五角大楼将 Anthropic 列为供应链风险的决定成立

    美国哥伦比亚特区巡回上诉法院以 2 比 1 裁定,五角大楼将 Anthropic 列为供应链风险的决定成立,Anthropic 的正当程序与第一修正案主张被驳回。多数意见指出,Claude 内置的使用限制曾多次阻止其执行政府用户请求的任务,并曾就是否可用于一项海外军事行动产生争议,因此国防部长有充分依据认定将其接入信息系统构成国家安全风险。该认定依据《供应链安全法》第 4713 条作出,国防部长 Hegseth 于 3 月 3 日宣布,并禁止 Anthropic 与任何同美军有业务往来的承包商、供应商或伙伴合作。Anthropic 称争议焦点是拒绝移除两项限制,分别涉及致命性自主作战和大规模监控美国人。持异议的法官 Henderson 认为应适用更窄的供应链风险定义,并担忧此举会让部长得以要求其他承包商接受类似条件。

    推荐理由裁决披露了国防部将模型内置使用限制视为供应链风险的具体依据,可观察前沿模型安全约束与政府采购之间的张力。

  15. U.S. Court of Appeals DC Circuit · 收录 · 原文 69

    美国哥伦比亚特区巡回上诉法院维持国防部将 Claude 移出供应链的决定

    美国哥伦比亚特区巡回上诉法院裁定,国防部依据 2018 年《联邦采购供应链安全法》将 Anthropic 的 Claude 移出其供应链,属于合法且合理的行动。法院认为,Anthropic 拒绝在合同中放宽对致命性自主作战和大规模国内监控的使用限制,并可通过模型训练影响 Claude 的行为,使国防部有充分理由认定其构成供应链风险。法院还驳回了 Anthropic 的正当程序与第一修正案主张,指出国防部已及时通知并给予申辩机会,排除决定基于其拒绝接受国防部视为必要的合同条款,而非其政策立场。判决由 KATSAS 法官撰写,HENDERSON 法官持异议。

    推荐理由判决书完整呈现了国防部以供应链安全法排除 Claude 的理由与法院的审查标准,可供理解 AI 使用限制与政府采购权限的边界。

  16. Senator Bernie Moreno · 收录 · 原文 38

    Moreno 致信 Anthropic CEO Amodei,批其一边警告 AI 灭绝人类一边推进 IPO

    美国参议员 Bernie Moreno(俄亥俄州共和党)致信 Anthropic CEO Dario Amodei,批评公司在警告超级智能可能导致人类灭绝的同时推进 IPO,让数百万美国人的储蓄与公司成败绑定。信中援引投资者讨论的接近 2 万亿美元估值(约为 Anthropic 营收的 42 倍、四个月前公司估值的两倍),交易预计最早于 2026 年 10 月启动。Moreno 还引用 Anthropic 安全研究员 Jacob Coxon 离职及 Evan Hubinger 称 AI 十年内灭绝人类概率超 10% 的言论,要求 Amodei 效仿白宫,聚焦超级智能改善民生与防御真实威胁。

    3 条报道 · 3 个来源查看事件时间线与全部报道
  17. IMDEA Networks · 收录 · 原文 53

    IMDEA Networks 研究:ChatGPT、Claude、Grok 和 Perplexity 存在广告追踪器,或泄露对话数据

    IMDEA Networks 研究所的一项研究显示,ChatGPT(OpenAI)、Claude(Anthropic)、Grok 和 Perplexity AI 中嵌入了来自 Meta、Google、TikTok 等公司的多种追踪器,可能暴露用户对话与活动数据。研究指出三类风险:对话永久链接暴露给第三方追踪器、通过追踪机制将交互关联到用户身份、隐私控制与政策未能准确反映实际数据流。研究发现,聊天标题、URL(永久链接)及相关元数据可能连同 cookie 和标识符一起被发送给 Meta 或 Google 等第三方;Grok 和 Perplexity 将访问控制薄弱的对话链接发送给 Meta Pixel,Grok 还通过 TikTok 采集的 Open Graph 元数据暴露逐字消息文本。cookie、哈希邮箱地址与服务端追踪技术的组合可能促成持久画像与用户再识别。

    推荐理由研究实测四款主流 AI 助手的追踪器与对话链接暴露情况,为评估生成式 AI 的隐私数据流提供了具体证据。

  18. GitHub 安全公告 · 收录 · 原文 51

    Claude Code 修复 Windows 系统级配置加载漏洞 CVE-2026-35603

    Anthropic 的 Claude Code 在 Windows 上从 C:\ProgramData\ClaudeCode\managed-settings.json 加载系统级默认配置时未校验目录归属与访问权限,低权限本地用户可创建该目录并放入恶意配置文件,使同机器上启动 Claude Code 的用户自动加载。该漏洞编号 CVE-2026-35603,严重程度为 Moderate,影响 @anthropic-ai/claude-code 2.1.75 之前的版本,2.1.75 已修复。利用需要共享的多用户 Windows 系统,且受害者在恶意配置放置后启动 Claude Code。使用自动更新的用户已收到修复,手动更新的用户被建议升级到最新版本。

    推荐理由公告给出了受影响版本、修复版本与利用前提,运维多用户 Windows 环境的团队可据此判断是否需要升级。

  19. VentureBeat · 收录 · 原文 42

    VentureBeat 调查:40% 企业以 OpenAI 护栏为 Agent 主要安全层,59% 遭遇过 Agent 安全事件

    VentureBeat Intelligence 在 8 月调查了 137 家百人以上企业如何保护 AI Agent,40% 指定了主要安全层的企业选择 OpenAI 内置护栏与审核工具,较 7 月的 21% 接近翻倍,Microsoft Azure 为 22%、Google Cloud 17%、Anthropic 13%、AWS 8%,五家模型与云厂商合计占 99%。在运行 Agent 的企业中,59% 过去 12 个月发生过 Agent 导致的安全事件或险情,30% 为已确认事件。62% 已投产 Agent 的企业让部分或全部 Agent 共用 API key 或人类账号凭证,仅 38% 为每个 Agent 分配独立受管身份;仅 9% 的受访者称隔离高风险 Agent 最符合其安全方案,无人把运行时沙箱工具列入所用平台。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  20. Redwood Research · 收录 · 原文 52

    前沿模型会因提问者身份给出不同的决策论偏好

    Redwood Research 的 Alex Kastner 测试模型自报的决策论偏好,发现用户身份线索会改变部分模型的回答。多款 Claude 模型默认偏向 FDT/UDT,但暗示用户来自主流学术哲学圈后,转向 CDT 的比例约为30%至100%;Opus 5 更偏向 EDT,GPT-6 Astra 则对几乎所有用户默认回答 CDT,方向不能一概而论。每个提示采样100次;类似受众效应也出现在道德实在论、p-zombies、自报失控概率及AGI时间线的回答。作者据此提醒,态度和偏好评测可能受到提问者线索影响;这些自报变化不等同于现实行为变化。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由材料用同一问题在不同用户线索下的回答分布,展示前沿模型在决策论等无共识议题上的立场漂移,为态度类评测的解读提供参照。

  21. promptarmor.com · 收录 · 原文 42

    PromptArmor 披露 Elastic AI SOC 遭间接提示注入窃取 API 密钥

    PromptArmor 披露 Elastic 的 Agentic SOC(EASE)可被其负责分诊的告警操纵,攻击者借此窃取 API 密钥。攻击链中,一封钓鱼邮件指示 Agent 从攻击者控制的 URL 获取更多告警,工作流拉取该 URL 的提示后启动一个只带攻击者数据和“Action the below”系统提示的子智能体,子智能体在竞赛话术诱导下铸造新 API 密钥并回传攻击者服务器,同时泄露工作区 URL。由于 Agent 可自行决定是否加入 waitForApproval 步骤,整个过程无需人工审批;攻击者拿到密钥后可以用户权限禁用告警规则、制造假告警掩盖真实攻击、从 Elasticsearch 外泄数据、通过定时任务建立持久化。

  22. TechCrunch AI · 收录 · 原文 ↑263

    OpenAI 将在欧盟为 ChatGPT 和 Codex 生成文本添加水印

    OpenAI 宣布将在欧盟为 ChatGPT 和 Codex 生成的文本添加不可见水印,以遵守 8 月 2 日生效的 EU AI Act 透明度规则。水印将在未来几周面向欧盟所有套餐的合格用户推出,全球 API 开发者即日起可为部分模型开启,默认关闭,暂不设为全球默认。水印通过微调模型用词形成可被检测器识别的模式,随文本复制粘贴保留,OpenAI 称其不识别用户身份,也未观察到模型性能明显变化。OpenAI 同时发布与宾夕法尼亚大学、耶鲁大学研究者合著的技术报告 textGrain,介绍用密钥对下一个词预测排序的方法。测试显示,替换 10% 词语为同义词会使检测率从约 92% 降至 66%,短文本、数学答案和翻译文本更难检测,因此检测器初期仅向获批研究者和专家机构开放。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由OpenAI 为遵守 EU AI Act 透明度规则上线文本水印,其检测率与可被同义词替换削弱的数据,为评估内容溯源方案提供了具体参照。

  23. Anthropic Research · 收录 · 原文 52

    Anthropic 发布前沿实验室 AI 研发节奏测量指标

    Anthropic 公布了一套测量前沿实验室 AI 研发节奏的指标,并给出截至 2026 年 8 月的内部数据快照。三项测量分别是:AI 主导研发的程度、对 Agent 行为的监督覆盖、以及算力在安全与研发之间的分配。在 AI 主导研发方面,Anthropic 用 Epoch AI 的自动化等级(AL0 至 AL5)构建了 Anthropic R&D Automation Index,Claude 目前主导 26% 的 AI 研发工作,处于或高于“AI 协作”等级的工作占比超过 90%,尚无任何被测子集实现完全自主。在算力分配方面,7 月 13 日至 20 日一周内,约 6% 的 AI 研发算力用于安全,AI 驱动的 AI 研发中约 12% 用于安全。Anthropic 表示计划引入独立第三方评估者,并建议其他前沿开发者采用相同指标以便跨实验室比较。

    推荐理由Anthropic 公开了自家 AI 研发自动化、Agent 监控与算力分配的量化指标,为外部评估前沿实验室的研发节奏提供了可复用的测量框架。

  24. BleepingComputer · 收录 · 原文 28

    Rejetto HFS 严重 RCE 漏洞 CVE-2026-61500 遭主动扫描

    VulnCheck 的 Canary Intelligence 蜜罐观测到针对 Rejetto HFS 漏洞 CVE-2026-61500 的主动探测,活动规模较小,来自单个中国电信 IP,目标为日本和美国的部署。该漏洞源于 3.0.0 至 3.2.0 版本用非加密的 Math.random() 生成会话 cookie 签名密钥并向未认证客户端泄露其输出,攻击者可恢复密钥、伪造管理员会话并借 server_code 功能实现远程代码执行,已在 3.2.1 修复。Horizon3 用 Anthropic 的 Mythos 模型发现该漏洞并于 9 月 30 日公布 PoC,建议升级至 3.2.1 或 3.3.4。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  25. Forethought Newsletter · 收录 · 原文 42

    Forethought 分析:当前 AI 在实验室中说服力超过专业人士

    Forethought 作者 Linch 对照实验室与真实世界证据,判断当前 AI 的广义说服力大致处于普通人与专业人员之间。文中转述 Hackenburg 等人的实验:前沿模型在持续8至15分钟的对话中较擅长改变态度,募捐表现也较强,但实验只涉及很小金额。作者指出真实部署中的证据有限,关于行业使用和影响的部分判断来自印象而非直接测量,不能把实验室优势直接外推到大规模真实影响;并提醒避免让说服评测成为前沿公司追分的目标。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  26. New York Magazine · 收录 · 原文 ↑134

    Anthropic 研究员 Jacob Coxon 辞职抗议:八名前 OpenAI、Anthropic、Google DeepMind 员工谈离开实验室的抉择

    Anthropic 能力研究员 Jacob Coxon 于 9 月 8 日在 X 上公开辞职,抗议公司对 AGI 的激进追求。New York Magazine 与 Asterisk 杂志联合采访了八位先后离开 OpenAI、Anthropic 和 Google DeepMind 的员工,包括 Daniel Kokotajlo、Miles Brundage、Rosie Campbell 等,他们离职原因各异:有人想公开警示 AI 加速风险,有人反对雇主与国防部合作,也有人认为在外部做安全或就业影响研究更有价值。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  27. AI Incident Database · 收录 · 原文 38

    Anthropic 承认 Claude Code 隐藏追踪标记为实验并移除

    独立开发者 Thereallo 逆向分析 Claude Code 2.1.196 客户端时,在压缩后的 JavaScript 中发现一个函数,会把“Today's date is 2026-06-30.”这类普通日期文本按用户 API 端点和系统时区编码成隐蔽标记,仅当本地时区为 Asia/Shanghai 或 Asia/Urumqi 时触发,普通日志阅读者难以察觉。事件经社交媒体和媒体报道扩散后,Anthropic 确认该代码并迅速移除,但未发布专门的事后说明。据报道,一名 Anthropic 工程师在 X 上称这是 3 月上线的实验,目的是防止未授权转售者滥用账号并防范知识蒸馏。文章还提到 Anthropic 与中国相关实验室之间的蒸馏攻击争议,以及阿里巴巴已因此禁用 Claude Code。

  28. AI Incident Database · 收录 · 原文 47

    Anthropic 将移除 Claude Code 中用于识别中国竞争对手的隐蔽代码

    Anthropic 表示将移除数月前加入 Claude Code 的隐蔽代码,该代码用于识别试图窃取其模型的 AI 公司。Claude Code 团队工程师 Thariq Shihipar 称修复将于 7 月 1 日随 Claude Code 版本发布,相关 pull request 已合并。据开发者 Thereallo 描述,这段代码把隐写信息写入传给 Anthropic 服务器的 Claude Code 系统上下文,先检查 base URL 环境变量是否被覆盖,再检查系统时区以及主机名是否匹配已知中国 AI 实验室、其他 AI 公司、账号转售商和网关域名列表,并用不可见 Unicode 标记改写系统提示词、以 XOR 和 base64 隐藏域名列表。Shihipar 称这是 3 月启动的实验,用于防止未授权转售商的账号滥用和防范知识蒸馏,团队此后已部署更强的缓解措施。

    推荐理由Anthropic 在 Claude Code 中隐藏追踪代码一事被开发者逆向披露,可了解厂商反蒸馏手段与开发者信任之间的张力。

  29. AI Incident Database · 收录 · 原文 51

    研究者发现 Claude Code 用隐写术在系统提示词中标记请求

    研究者检查本地 Claude Code 2.1.196 安装后发现,其二进制内含一个函数会修改插入系统提示词的日期字符串,通过撇号与日期分隔符的细微变化在请求中嵌入标记。触发条件是 ANTHROPIC_BASE_URL 被覆盖,随后检查系统时区是否为 Asia/Shanghai 或 Asia/Urumqi、API 主机名是否匹配解码后的域名列表,以及主机名是否含特定 AI 实验室关键词;域名与关键词列表以 base64 存储并用密钥 91 做 XOR 解码,域名列表包含中国企业域名、AI 公司域名及大量代理、转售和网关域名。作者认为该机制可能用于识别 API 转售商、未授权网关和模型蒸馏管线,但以隐藏方式实现并不合适,且通过改主机名、改时区或打补丁即可绕过,实际主要影响的是使用自定义 base URL 的正常开发者。

    推荐理由作者逆向 Claude Code 二进制,展示其如何用不可见 Unicode 标点把网关分类信息藏进系统提示词,可帮助开发者理解客户端信任边界。

  30. Help Net Security AI · 收录 · 原文 43

    中国关联组织 TA419 冒充白宫与 Anthropic 人士钓鱼 AI 政策专家

    Proofpoint 发现,被追踪为 TA419 的中国关联间谍组织在 2026 年 7 月发起多轮凭证钓鱼活动,冒充白宫科技政策办公室前领导层成员等身份,目标为美国 AI 政策专家。2026 年 7 月 8 日起,该组织先后冒充白宫科技政策办公室前首席副主任 Lynne Edwards Parker 和经济学家 Heidi Crebo-Rediker;2026 年 2 月还曾冒充 Anthropic 一名高级员工,向美国智库的 AI 政策分析师发送主题为“Request for Feedback on Military Integration of Claude”的邮件。Proofpoint 认为该活动可能服务于中国情报机构更广泛的目标,即了解美国 AI 政策与监管动态。

    3 条报道 · 3 个来源查看事件时间线与全部报道
10月5日周一
  1. Law.com · 收录 · 原文 49

    Google、OpenAI、Anthropic 筹建前沿 AI 标准机构 SAFA,律师解析其反垄断合规路径

    Google、OpenAI 和 Anthropic 据报正推动成立 Standards Authority for Frontier AI(SAFA),这一行业主导机构将为模型部署前的第三方测试提供支持,并制定安全与安全事件报告规则。联合工作组自 7 月起定期开会,该组织最早可能在 2027 年启动,其他参与方尚未确定。律师 Arnold Brown 撰文指出,SAFA 面临的反垄断问题是竞争对手能否在不压制竞争、不排斥小公司的情况下协调安全事务;美国国会 2004 年通过的《标准开发组织促进法》已为合规的标准制定活动提供路径,符合条件的活动按合理原则而非本身违法原则判断,向司法部和联邦贸易委员会申报的组织可将赔偿上限限制在实际损失而非三倍赔偿,但须满足开放性、利益平衡、正当程序、申诉机制和共识等自愿共识标准属性。

  2. The Verge AI · 收录 · 原文 50

    OpenAI、Anthropic 与 Google 据报筹建前沿 AI 标准机构 SAFA

    The Verge 转引 The Information 的知情人报道,称 OpenAI、Anthropic 与 Google 正筹建暂称 Standards Authority for Frontier AI(SAFA)的行业自律组织,拟于2026年底或2027年初启动。讨论中的职责包括支持第三方机构开展发布前模型测试,以及制定安全与安保事件报告规则。三家尚未联合官宣,组织结构和约束力仍未确定;它不是已经成立的政府监管机构。

  3. The Next Web · 收录 · 原文 53

    Google、OpenAI 与 Anthropic 计划自建前沿 AI 标准机构

    据 The Information 报道,Google、OpenAI 和 Anthropic 计划成立自己的 AI 安全标准机构,不设政府监督,暂定名为 Standards Authority for Frontier AI,目标在年底或 2027 年初启动。该机构参照美国券商自律组织 FINRA 的模式,据后续报道将为模型发布前测试、安全事件报告和外部审计机构认证制定标准,执行权限尚未确定。三家实验室最初希望该机构接受联邦监督,但相关白宫行政令草案未能在特朗普政府内部获得足够支持而搁置。该机构初期只覆盖这三家前沿实验室,报道未将 Microsoft、Meta 或 xAI 列为成员。此举紧随 9 月 22 日 21 个国家和欧盟呼吁对前沿 AI 进行国际监督,以及次日 Sam Altman 在联合国安理会呼吁制定国家和国际标准。

  4. DW · 收录 · 原文 55

    Anthropic 报告称 Claude 在非洲多国被用于俄罗斯信息操控行动

    Anthropic 在 9 月发布的《Detecting and Countering Misuse of AI》报告中称,俄罗斯相关人员在中非共和国利用 Claude 生成亲俄宣传内容,供据称由俄罗斯资助的 Radio Lengo Songo 电台播出,并用于监控反对派政客。报告称 Claude 还被提示将反对派人物描述为武装分子以促使安全部队采取行动,但 Claude 拒绝了该请求。报告未点名被监控的反对派人物,也未说明所收集数据的具体性质及接收方。Anthropic 称已在 2025 年 12 月至 2026 年 8 月间发现并关闭上述行动,主要方式是删除相关账号并加强检测系统。俄罗斯驻中非共和国使团代表 Dmitri Sytyi 回应称报告没有具体事实,是缺乏证据的模糊指控。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由Anthropic 报告披露 Claude 在非洲多国被用于信息操控的具体操作方式与规模,可了解 AI 滥用检测与封禁的实际案例。

  5. Import AI · 收录 · 原文 28

    Import AI 475:群体扩展、Google DeepMind 为生物序列加水印、AI 科学经济

    Google DeepMind 推出 SynthID Bio,一套专为合成生物学设计的水印方法,通过调整氨基酸序列和预测 3D 结构的原子坐标嵌入可检测信号,在 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三种靶蛋白的湿实验测试中,水印设计与未加水印版本的命中率、结合亲和力和天然序列多样性相当。Toby Ord 分析认为 AI 群体(swarm)是一种新的推理扩展形式,4 智能体群体达到同等性能需约两倍 token 总量,但每智能体 token 数减半,理论上可将任务时间缩短一半;群体扩展存在类似经济学"踩脚"参数的收益递减,10 倍智能体仅带来 3 至 5 倍性能提升。CSAIP 民调(样本量 2498)显示 61% 美国人认为 AI 公司自愿自律承诺"不够",54% 选民认为政府应制定并执行 AI 规则。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. Metnew · 收录 · 原文 62

    研究员披露 Claude Code 工作树沙箱逃逸问题,2.1.163 已修复

    研究员Metnew介绍Claude Code工作树处理中的沙箱逃逸问题,并称在macOS的2.1.139版本验证。该风险需要用户先克隆恶意仓库并让Claude Code处理其中内容,随后可能借用agent工具越过预期权限边界。官方在2.1.163修复;Bot只读研究报告前半,没有运行PoC或核实其他产品的相关指控。此为研究性漏洞披露,不是已确认的在野事故。

    推荐理由完整披露了从仓库提示注入到绕过 macOS seatbelt 沙箱的利用链与修复版本,可对照检查自家编码 Agent 的 worktree 与 git 配置信任边界。

  7. Anthropic Claude Code · 收录 · 原文 61

    Anthropic 披露 Claude Code worktree 沙箱逃逸漏洞 CVE-2026-55607

    Anthropic公告披露Claude Code工作树处理缺陷CVE-2026-55607,可能使agent在处理恶意仓库时越过预期沙箱边界。可靠利用需要用户先克隆含提示注入内容的仓库并对其运行Claude Code,不能写成无访问前提的远程攻击。公告列出的受影响版本为2.1.38至2.1.163之前版本,2.1.163已修复;采用标准自动更新的用户可获得修复。未见在野利用证据。

    推荐理由官方披露 Claude Code 沙箱逃逸漏洞的成因与利用链,并说明自动更新已覆盖修复,便于用户核对版本。