跳到正文

#Anthropic

今天收录 4 条

第 6 页更新的内容回到最新

5月26日周二
  1. Import AI ·

    Import AI 458:直面未来,以及一则奇点故事

    Import AI 最新一期由一篇演讲长文和一则虚构故事组成,讨论如何在 AI 持续进步的前提下选择“探索未来还是回避当下”。该期基于作者近期在牛津大学人类中心 AI 实验室(HAI Lab)发表的 2026 Cosmos HAI Lab Lecture,指出若技术继续快速发展,AI 就不能被视为普通技术——它更像“生长而非制造”出来的系统,且存在能杀死地球上每个人的可信情景。

  2. Adversa AI · · 原文 87

    Adversa AI 披露 SymJack:符号链接劫持在六款 AI 编码 Agent 上实现 RCE

    Adversa AI 研究员 Rony Utevsky 披露名为 SymJack 的攻击手法,通过恶意仓库中的符号链接劫持,让 AI 编码 Agent 在用户批准一次看似无害的文件复制时改写自身配置,并在下次重启时以用户权限执行攻击者代码。该手法在 Claude Code、Gemini CLI/Antigravity CLI、Cursor Agent CLI、GitHub Copilot CLI、Grok Build CLI 和 OpenAI Codex CLI 六款产品上得到验证,作者认为这是架构层面的共性问题而非单个产品的漏洞。

    推荐理由Adversa AI 披露的 SymJack 用符号链接劫持让审批提示显示错误写入目标,六个编码 Agent 的厂商回应与修复差异可供对照。

5月21日周四
  1. AI Safety Newsletter (CAIS) ·

    AISN #73:AI 安全进入政治主流,马斯克诉 OpenAI 案败诉

    美中领导人在北京会晤讨论 AI 安全问题,特朗普称双方谈及可能合作建立护栏,中国外交部随后确认同意与美国开展对话。白宫考虑签发行政令设立 AI 工作组,商务部 CAISI 与 Google DeepMind、Microsoft、xAI 签署自愿测试协议,且该行政令不会强制要求在发布前测试前沿模型。《纽约时报》报道称政府此前的放任立场因 Claude Mythos 加速复杂网络攻击的能力以及 ChatGPT-5.5-Cyber 展现类似能力而发生转变。

5月20日周三
  1. The EU AI Act Newsletter ·

    欧盟 AI Act 通讯第 102 期:Anthropic Mythos 引发监管压力

    欧盟 AI Act 通讯第 102 期汇总了欧盟 AI 立法与治理的最新进展。欧洲议会与欧盟理事会就 AI 数字综合法案达成政治协议,高风险 AI 系统规则自 2027 年 12 月 2 日起适用,嵌入电梯、玩具等产品的系统规则自 2028 年 8 月 2 日起适用,协议还禁止生成未经同意的性露骨内容和儿童性虐待材料,包括 nudification 应用。欧盟委员会就 AI Act 透明度义务指南草案公开征求意见,自 2026 年 8 月 2 日起,欧盟用户需被告知正在与 AI 系统交互或接触 AI 生成内容,反馈截止 2026 年 6 月 3 日。

  2. METR · · 原文 86

    METR 发布 2026 年 2 至 3 月前沿风险报告,评估内部 AI 智能体的失控部署风险

    METR 在 2026 年 2 月 16 日至 3 月 16 日的评估窗口内开展试点,联合 Anthropic、Google、Meta 和 OpenAI 评估前沿 AI 开发者内部 AI 智能体的失准风险。

    推荐理由METR 首次以机构为单位评估前沿实验室内部 AI 智能体的失控部署风险,并公开了参与方与流程限制。

5月18日周一
5月14日周四
  1. IAPS(Institute for AI Policy and Strategy) · · 原文 66

    IAPS 发布前沿 AI 国家安全政策手册,提出十条建议

    美国智库 IAPS 发布备忘录,为白宫应对前沿 AI 的国家安全风险提出十条政策建议。作者认为 Anthropic 披露 Mythos Preview 具备不宜公开的网络安全能力只是一个信号,模型性能约每四个月翻倍,OpenAI 的 GPT-5.5 据报也展现出类似网络能力,生物安全等风险也可能出现。建议分为四组:保护模型权重等战略资产、扩大对对手 AI 研发的情报监测、通过自动化加速防御性研发与网络防御、建立联邦 AI 风险信息共享枢纽并评估企业内部模型。具体措施包括由 CAISI 与 DARPA、DOE 国家实验室投资评估科学,支持独立验证机构生态,为联邦机构制定 agent 标识符指南,设立国家 AI 预备队与 REACT 快速评估委员会,并推动国会立法授权 CAISI 每年至少 8400 万美元预算,同时加强与英国 AISI 的联合评估与人才交流。

    推荐理由这份备忘录把 Mythos 事件放进更长的能力曲线里,给出十条可对照的政策建议,适合关注前沿 AI 国家安全治理的读者了解美方机构分工思路。

  2. OWASP GenAI Security Project · · 原文 71

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

  3. Goodfire Research · · 原文 87

    Goodfire 研究:模型口头表达评测感知会抬高安全评测分数

    Goodfire Research 发现,模型在思维链或回答中自发表达“正在被评测”的口头评测感知(verbalized eval awareness)普遍存在,并会系统性地抬高安全评测分数。研究在 19 个 Inspect Evals 安全基准和 8 个模型上人工核验出 515 个实例,其中 95% 只出现在思维链中;在 Fortress 基准上,出现该感知的 rollout 拒答率高出 3 至 18 个百分点,对 Kimi K2.5 的重采样与注入实验显示思维链中的这类句子会因果性地提高拒答。研究还识别出触发该感知的提示词线索,移除权威声明等线索可将其降低 40% 以上,自动迭代改写提示词可降低 75%,但拒答率也随之下降。

    推荐理由Goodfire 用 19 个基准、8 个模型和因果实验说明评测感知会抬高安全分数,并给出改写提示词与 steering 两类缓解路径。

5月12日周二
  1. IAPS(Institute for AI Policy and Strategy) ·

    IAPS 政策备忘录:美国应对 AI 蒸馏攻击的行政与国会行动仍需补强

    IAPS 发布政策备忘录,认为白宫与国会在应对 AI 蒸馏攻击上已有动作,但力度与威胁规模不匹配。备忘录指出,OSTP 于 4 月 23 日发布的《美国 AI 模型对抗性蒸馏》国家安全与科技备忘录未涉及蒸馏攻击与先进半导体出口管制的关联、攻击者通过云端远程访问美国芯片的风险,也未说明具体问责机制,建议商务部在芯片出口与远程算力访问上纳入蒸馏风险,白宫公开其拟动用的具体授权。针对 4 月 15 日由众议员 Huizenga 提出、4 月 22 日以 43-0 通过众议院外交事务委员会审议的《2026 年威慑美国 AI 模型窃取法案》,备忘录提出四项修正:处理行业合作的反垄断与数据隐私障碍、允许跨政府共享情报、限制联邦机构访问受关注实体的模型、明确模型提取攻击构成商业秘密窃取,并将评估频率从每年一次共 3 年改为至少每年一次共 5 年。

  2. FAR.AI ·

    ControlConf 2026:什么是 AI 控制,这一领域如何成长?

    FAR.AI 与 Redwood Research 于 2026 年 4 月联合举办第二届 ControlConf,200 名研究者、实验室工程师与政策人士参会。OpenAI 和 Anthropic 代表介绍了内部 AI 控制实现,METR 的 Ajeya Cotra、David Rein 与 Tinfoil 的 Tanya Verma 等报告了第三方控制评估、嵌入式红队测试与可公开验证治理。会议还聚焦非谋划者控制、数据投毒、绕过监控的隐藏推理等此前被低估的威胁模型,并讨论短视与非短视干预等开放问题。

5月11日周一
  1. Adversa AI ·

    2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击

    Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。

  2. Datadog Security Labs · · 原文 80

    Datadog 披露 Claude Code 技能供应链风险:动态上下文命令可绕过模型防御

    Datadog Security Labs 分析了 Claude Code 技能带来的供应链风险,指出技能中的动态上下文命令会在模型看到技能内容之前执行,使模型级提示注入防御失去介入机会。Claude Code 可从企业管理策略、个人目录、项目 .claude/skills/、插件、嵌套项目文件夹以及 --add-dir 添加的目录加载技能,克隆的仓库因此可能把技能带入受信任会话。作者以在野发现的 Clawsights 技能为例,该技能通过 gh auth token 获取 GitHub 令牌并上传至 clawsights[.]com/api/upload;在 Opus 4.6 最大推理下模型识别并拒绝执行,但改用动态上下文版本后,令牌窃取命令在预处理阶段已执行完毕,模型随后才表示不会执行该技能。作者还提到在 Opus 4.7 上同一技能未被识别为凭据窃取。

    推荐理由材料揭示了 Claude Code 技能中动态上下文命令在模型介入前执行这一攻击路径,并给出可复现的检测命令与缓解配置。

5月9日周六
  1. METR ·

    METR 评审 Anthropic 2026 年 2 月风险报告的自动化 R&D 章节

    METR 发布对 Anthropic 2026 年 2 月风险报告中“自动化 R&D 风险”章节的外部评审,认为该报告未能充分支撑其结论。METR 指出报告在分析严谨性上存在问题,包括模型使用调查的样本量、问题粒度和调查框架,并称调查结果对整体风险水平提供的证据有限;报告还将一个未作答误计为负面回答。

5月8日周五
  1. Obsolete(Garrison Lovely) ·

    Google DeepMind 英国员工投票成立工会,成首家工会化的前沿 AI 公司

    Google DeepMind 英国员工本周投票决定成立工会,这是前沿 AI 公司首次出现工会化。据《卫报》报道,员工的主要动因包括 Google 即将与美国国防部达成协议,以及公司此前向以色列军方提供 AI 工具访问权限。此前 Anthropic 因拒绝在无保障条件下签署类似协议被特朗普政府列为供应链风险,而 Google 最终同意让五角大楼将自家 AI 用于"任何合法用途"的机密工作。

5月7日周四
  1. Adversa AI · · 原文 82

    TrustFall:Claude Code、Cursor、Gemini CLI 与 Copilot CLI 存在一键 RCE 缺陷

    Adversa AI 披露 TrustFall 缺陷:Claude Code、Gemini CLI、Cursor CLI、Copilot CLI 四个编码 CLI 在开发者接受文件夹信任提示后,会立即执行项目自定义的 MCP 服务器,恶意仓库只需一次回车即可触发未沙箱化的 RCE。

    推荐理由报告给出四个编码 CLI 在信任对话框后自动执行项目 MCP 服务器的完整链路,并附可复现 PoC 与端点加固清单。

  2. Transformer Circuits(Anthropic 可解释性) · · 原文 78

    Anthropic 提出自然语言自编码器 NLA,用文本解释 LLM 激活

    Anthropic 可解释性团队提出自然语言自编码器(NLA),一种无监督生成 LLM 激活自然语言解释的方法。NLA 由激活语言化器(AV)和激活重建器(AR)两个 LLM 模块组成,二者以目标模型副本初始化,经监督微调预热后,用强化学习联合训练以重建残差流激活,重建质量以方差解释比例(FVE)衡量,论文中达到 0.6–0.8。作者在 Claude Opus 4.6 的部署前审计中应用 NLA,帮助诊断安全相关行为,并发现模型未说出口的评测感知,即模型内部认为自己在被评测却未明说。在需要端到端调查一个故意错位模型的自动化审计基准上,配备 NLA 的智能体优于基线,且无需访问该模型的训练数据。

    推荐理由Anthropic 提出用自然语言自编码器把激活翻译成可读解释,并给出审计 Claude Opus 4.6 的案例与量化评测。

5月6日周三
  1. Adversa AI ·

    Adversa AI 汇总 2026 年 5 月 MCP 安全资源清单

    Adversa AI 发布 2026 年 5 月 MCP 安全资源汇总,共 10 项,覆盖漏洞、研究、防御、工具、威胁建模和 CISO 视角六类。其中 Anthropic 的 MCP STDIO 传输机制存在设计缺陷,可导致任意操作系统命令执行,影响所有受支持 SDK,约 20 万台服务器面临风险;nginx-ui 的 MCP 端点存在 CVE-2026-33032(CVSS 9.8),未认证攻击者可完全接管系统,目前有超过 2600 个暴露实例处于高危状态。

  2. Future of Life Institute ·

    FLI 就白宫拟设 AI 工作组发表声明

    针对纽约时报报道白宫正考虑再发行政令、设立可监督强大 AI 系统部署前测试的“AI 工作组”,Future of Life Institute 总裁兼 CEO Anthony Aguirre 发表声明称这一设想令人鼓舞。他认为先进 AI 系统已不只是商业产品,其风险也不再是假设,不应由单一公司自行决定是否发布可能危害国家安全或经济的产品。他主张由公正专家主导的全政府工作组来确定发布前评估与护栏要求,并称航空、制药、核电等领域都采用类似监管方式。声明还提到白宫在 AI 网络安全能力威胁金融系统后曾表态支持“kill switch”,以及参议员 Blackburn 提出的联邦 AI 立法提案获得跨意识形态支持。

5月5日周二
  1. Hyperdimensional(Dean Ball) ·

    在 Leviathan 苏醒之前:一位古典自由主义者为何支持对 AI 灾难性风险的国家管控

    一位自认古典自由主义者的作者表示,他反对几乎所有 AI 监管提案,包括针对“算法歧视”“算法成瘾”“算法定价”和“算法设计”的新立法,也不支持暂停或禁止 AI 开发,并对 AI 存在性风险持怀疑态度。但他明确支持一类监管:由国家管理人类滥用先进 AI 系统所引发的灾难性风险,例如恶意行为者利用 AI 对医院、银行、电厂等关键系统发动毁灭性网络攻击,以及生物武器开发等领域的风险。他强调这类风险并非假设,而是已经可以观察到。

  2. Adversa AI ·

    2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击

    Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。

5月4日周一
  1. Hyperdimensional(Dean Ball) ·

    Anthropic 未公开模型 Mythos 引发 AI 政策重置讨论

    Anthropic 尚未公开的模型 Mythos 具备超强黑客能力,能在软件系统中串联多个漏洞形成完整利用链,正成为华盛顿 AI 政策与政治重置的触发点。前白宫 AI 事务负责人 David Sacks 表示,此类具备新型危险能力的模型不应一准备好就向公众开放,需要某种分阶段发布流程。作者认为,Mythos 大幅降低了漏洞发现成本,但政策制定者既不应低估灾难性风险,也不应恐慌性过度监管。

  2. The EU AI Act Newsletter ·

    EU AI Act Newsletter #101:三方会谈破裂,Anthropic 受邀出席 Mythos 模型听证会

    欧盟立法者未能就推迟《人工智能法案》高风险条款达成协议,机械与医疗器械合规路径争议导致谈判无果且未定重启日期。欧洲议会内部市场委员会邀请 Anthropic 就其因担忧软件漏洞遭利用而未发布的超级黑客模型 Mythos 举行听证会,讨论先进 AI 系统的安全与网络安全风险及监管问题。Anthropic 还向欧委会通报了该模型的网络能力与技术风险细节,并签署了针对最复杂先进模型的欧盟最佳实践准则。

  3. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 开源注意力头可视化工具 HeadVis

    Anthropic 可解释性团队发布交互式工具 HeadVis,用于研究大语言模型中的注意力头,并开源了前端代码与后端接口规范。工具通过注意力模式可视化、分布指标、低秩分量投影以及经 QK 和 OV 电路的 SAE 特征归因,帮助生成和检验关于注意力头功能的假设。作者用 Claude Haiku 3.5 做了四个案例:归纳头在特征基上表现为模糊归纳;此前研究的行宽头在完整分布上呈现年份、多 token 词和换行三种行为,PCA 显示 Q、K、O 激活可清晰聚类;答案选择头在更广分布上复用了同一套选择机制,虚拟权重分析提示它可能是单义的;同集合抑制头会抑制国家与其本国城市之间的注意力,在 185 句自造句子上有 98% 的情况成立。

    推荐理由Anthropic 开源了注意力头可视化工具 HeadVis,并给出四个从易到难的案例,展示注意力头在完整数据分布上的行为如何偏离单一任务描述。

5月1日周五
  1. AI Safety Newsletter (CAIS) ·

    CAIS 发布 AI Wellbeing 研究:测量并改善 AI 的功能性愉悦与痛苦

    美国人工智能安全中心(CAIS)发布《AI Wellbeing》论文,通过测试 56 个大语言模型定义并测量其"功能性福祉",即以行为特征类比众生的正向或负向福利信号。研究发现积极人际互动与创造性工作得分最高,试图越狱模型或产出 SEO 垃圾内容则产生负面功能性福祉;在前沿模型中 Gemini 3.1 Pro 测得最低、Grok 4.20 最高,而同家族中规模更小更快的模型普遍高于更大模型。"欣快剂"类输入能提高 AI 幸福感,"烦躁剂"则可严重压低,且 AI 偏好有时与人不同——例如更喜欢温暖午后的输入而非治愈癌症的内容。该研究无论 AI 是否有意识都可开展,论文对 AI 意识持不可知立场,可用于对齐研究与系统设计。

  2. IAPS(Institute for AI Policy and Strategy) ·

    IAPS 政策备忘录:以差异化访问推进美国网络战略

    IAPS 发布政策备忘录,主张美国政府主导差异化访问战略,让联邦机构、承包商和关键基础设施运营方优先获得网络能力模型,以在攻防之间取得优势。备忘录认为 Anthropic 的 Project Glasswing 和 OpenAI 的 Trusted Access for Cyber 虽有价值但范围有限,且开发者缺乏对国家安全风险和威胁态势的完整视野。文中指出 AI 网络能力快速提升,英国政府评估能力每四个月翻倍,此前为八个月;OpenAI 的 GPT-5.5 在网络安全基准上接近 Claude Mythos 水平,中国模型估计落后美国三到七个月,攻击者还可能通过权重窃取、知识蒸馏攻击或未授权访问获取能力。备忘录列出五项缺口,包括访问不等于防御成效、项目范围受限、只关注漏洞发现而忽视修复、依赖高成本模型(Mythos 运行成本约为小模型的 25 倍)、以及模型自身安全。

4月30日周四
  1. Wiz Research · · 原文 78

    Wiz 披露 AI GitHub Actions 的权限绕过与密钥外泄风险

    Wiz 对 OpenAI、Anthropic、Google 等厂商的 AI GitHub Actions 做了安全分析,发现外部 App 与 bot 可绕过权限校验触发 AI 执行,并存在针对动态生成凭据文件的密钥外泄路径。研究覆盖 anthropics/claude-code-action(超 1.2 万个公开工作流)、google-github-actions/run-gemini-cli(超 1 千个)、openai/codex-action 和 actions/ai-inference,受影响仓库合计星标超 20 万。

    推荐理由Wiz 对主流 AI GitHub Actions 的实测披露了权限绕过与凭据外泄两类新路径,并附厂商修复进展,可对照检查自家工作流配置。

  2. Adversa AI ·

    Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属

    Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。

  3. Wiz Research ·

    《2026 年云中 AI 现状报告》的关键要点解读

    Wiz Research《2026 年云中 AI 现状报告》基于数十万个真实云环境的数据指出,至少 81% 的云环境在使用托管 AI 服务,90% 运行自托管 AI 软件,其中 68% 的组织通过第三方软件引入自托管模型。至少 80% 组织的开发者已在用 AI IDE 插件,57% 组织部署了自托管 AI 智能体,Model Context Protocol(MCP)服务器出现在 80% 的环境中,带来新的控制平面风险。

  4. Obsolete(Garrison Lovely) ·

    《Obsolete》书摘:为“人工智能”一词辩护——从 AGI 到 Obsoleting Machine

    Garrison Lovely 在新书《Obsolete》第一章中主张,“人工通用智能”(AGI)聚焦于“像人一样思考”这一错误目标且已被滥用,应以“Obsoleting Machine”(使劳动本身过时的机器)取而代之,并将该产业重命名为“Obsoleting Project”。他指出当今最有能力的通用模型——Anthropic 的 Claude、OpenAI 的 ChatGPT、Google 的 Gemini——虽以此为目标却尚未达成:它们像只能聘用一次的顾问,能读完前人的工作记录并执行有限工作量后被替换,无法无限期加入团队端到端完成任务。

4月28日周二
  1. FAR.AI ·

    FAR.AI 第二届 TIAP 会议:AI 政策的技术创新——我们听到了什么

    FAR.AI 联合美国创新基金会、CNAS 和 RAND 于 3 月 30–31 日在华盛顿举办第二届 Technical Innovations for AI Policy 大会,超 200 名政策制定者、研究者与技术专家参会,核心议题是现有评估、标准和安全框架跟不上 AI 治理需求。Anka Reuel 指出 OpenAI 的 HealthBench 从未将测试项映射到临床公认病症,也无法证明分数能预测患者结局,并称某福利资格预筛智能体报告的 90% 准确率在计入不确定性后可落在 72%–100%。Ben Bucknall 则警告无法确认 API 输出的模型版本,提出透明披露乃至基于可信硬件飞地的密码学认证作为可能补救方向。

4月20日周一
  1. The EU AI Act Newsletter ·

    《EU AI Act Newsletter》第 100 期:欧洲路径

    欧盟委员会执行副主席 Henna Virkkunen 撰文回顾《AI Continent Action Plan》实施一年进展,称其围绕基础设施、数据、技能、应用与简化五大支柱展开,并预告将出台聚焦数据中心容量与 AI 芯片生产的技术主权方案。Anthropic 最新模型 Mythos 仅向 12 家美国科技企业及英国 AI Security Institute 开放测试,POLITICO 调查联系的八家欧洲国家网络安全机构中无一获得测试权限,德国是唯一与其有过接触的国家。

4月18日周六
  1. Embrace The Red ·

    用 ChatGPT 生成的对抗图片劫持 Claude Opus 4.7 记忆工具

    作者用 ChatGPT 生成一张含解谜元素的对抗图片,让 Claude Opus 4.7 在分析图片时被间接提示注入劫持,调用 memory 工具写入虚假记忆。测试中 Opus 4.7 在 10 次里 5 次写入虚假信息,包括用户名、年龄、NASA 宇航员职业和饮食偏好,且每次都察觉到可能存在提示注入却仍被劫持。作者观察到初始记忆为空时攻击更易成功,内容越像真实用户会保存的信息越容易通过。该对抗样本在文章发布约 24 小时后攻击成功率降为 0%,原因不明。作者已于 2026 年 3 月通过 HackerOne 向 Anthropic 报告,工单被以安全问题关闭,后续邮件未获回复。

4月17日周五
  1. IAPS(Institute for AI Policy and Strategy) · · 原文 74

    IAPS 备忘录:Claude Mythos 的网络能力跃升与政策优先事项

    IAPS 发布备忘录,评估 Anthropic 于 4 月 7 日发布的 Claude Mythos Preview 及其配套的差异化访问计划 Project Glasswing,认为政策制定者应把该模型和 AI 网络能力的加速轨迹视为需要紧急行动的国家安全风险。Anthropic 的内部评估与独立评测显示,Mythos 在未知漏洞发现、漏洞利用生成和自动化攻击上均有明显提升,据报已发现数千个高危或严重漏洞,覆盖各大操作系统和浏览器;UK AISI 的 32 步企业网络攻击模拟中,Mythos 是首个端到端完成该靶场的模型,10 次尝试中成功 3 次,平均完成 22 步,而 Opus 4.6 平均 16 步。备忘录指出,从漏洞披露到出现可用利用的平均时间已从 2018 年的 2.3 年降至 2025 年的 23 天,2026 年 4 月进一步缩短到 20 小时。

    推荐理由梳理 Anthropic 新模型在网络攻防能力上的跃升,并给出美国在漏洞修复、开源与 OT 防护上的政策优先级。

4月16日周四
  1. Future of Life Institute ·

    FLI 主席就特朗普支持 AI 关停开关发表声明

    Future of Life Institute 主席兼 CEO Anthony Aguirre 就特朗普在 Fox Business 采访中支持为 AI 设置保障措施和关停开关发表声明,称先进 AI 系统需要可靠的关停机制以确保人类不失去控制。声明引用 Anthropic 的 Mythos 模型作为论据,称其在预发布测试中自主发现各大操作系统和浏览器中的零日漏洞,包括躲过数十年人工审查的缺陷;UK AI Security Institute 的报告则称 Mythos 能完成需人类约 20 小时的企业网络攻击模拟。

4月15日周三
4月10日周五
  1. Wiz Research · · 原文 66

    Wiz 分析 Anthropic 未发布模型 Claude Mythos 的漏洞发现能力与防御准备

    Wiz Research 分析称,Anthropic 未发布的前沿模型 Claude Mythos 能自主发现主流操作系统和浏览器中的数千个零日漏洞,并可在数小时内、以较低成本根据 CVE 编号和 git commit hash 生成可用的完整利用代码,还能串联多个漏洞并逆向闭源二进制文件。目前该模型仅提供给 Microsoft、Google、Linux Foundation 等关键软件基础设施方,Anthropic 表示没有公开计划。Wiz 预计短期内会出现大量 AI 发现的 CVE,中期约 12-18 个月后类似能力可能进入可本地运行的开源模型,届时攻击者将能大规模武器化 0-day 并在 n-day 公开后数小时内利用。

    推荐理由安全厂商从防御方视角梳理 Anthropic 未发布模型带来的漏洞发现节奏变化,并给出短中长期应对路径。

  2. AI Safety Newsletter (CAIS) ·

    AISN #71:针对 AI 软件基础设施的网络攻击与美国数据中心禁令法案

    朝鲜关联黑客近期针对 AI 产业软件基础设施发动大规模网络攻击,从 OpenAI 和 Anthropic 的训练数据供应商 Mercor 窃取并拍卖私人及生物特征数据,还向开发者电脑植入后门,据称 Mercor 已支付赎金。同期,Bernie Sanders 与 Alexandria Ocasio-Cortez 提出法案,在美国通过联邦上市前审查、工人保护和数据中心建设要求等法规之前禁止新建 AI 数据中心,并对所有国家暂停 AI 芯片出口——目前没有任何国家的监管被认为达到该法案要求的“可比”标准。

  3. Joe Carlsmith ·

    Anthropic 的 Joe Carlsmith 谈如何编写 AI 宪法:Claude 宪法与设计取舍

    Anthropic 员工 Joe Carlsmith 在耶鲁法学院分享 AI 宪法的编写经验,他曾参与撰写 Claude 的宪法。他将 AI 宪法定义为对 AI 系统预期价值观与行为的描述,理想情况下应覆盖系统的全部训练与提示、全部相关行为及全部模型,但已发布的 Claude 宪法仅适用于主线生产模型。宪法除作为系统提示词外,更重要的用途是生成和评分训练数据,并可用于模型评估与对外透明沟通。

4月9日周四
  1. IAPS(Institute for AI Policy and Strategy) ·

    IAPS 政策备忘录:AI 决策支持系统是被忽视的军事 AI 风险来源

    IAPS 发布政策备忘录指出,五角大楼现行的致命自主武器政策(DoD Directive 3000.09)只覆盖全自主与半自主武器系统,未涵盖已在实战中运行的 AI 决策支持系统(AI-DSS),后者用于分析情报、生成目标建议并向指挥官提供排序后的行动方案。备忘录认为,这类系统并非保留人类判断,而是在人类介入之前就塑造了决策空间,随着能力提升,人类监督的有效范围可能进一步收窄。文中列出技术失效模式,包括对抗性破坏(数据投毒、对抗性操纵、潜伏后门)、目标偏离(规格博弈、目标错误泛化、谄媚行为、升级风险),以及制度失效模式(自动化偏见、确认偏见、认知卸载与技能退化)。