跳到正文

Anthropic

Anthropic 的安全动态:RSP 与 ASL、对齐与可解释性研究、System Card 与安全评估。

648条动态与论文相关主题OpenAIGoogle DeepMind可解释性
在这个话题内搜索或按分类筛选

新闻与论文

第 541–560 条 · 共 648 条
10月1日周四
  1. Garrison Lovely · 收录 · 原文 50

    Anthropic 被指在 Claude 4 Opus 发布中悄然回撤安全承诺

    Anthropic 发布 Claude 4 Opus 时将其列为首个触发 ASL-3 防护的模型,但 5 月 14 日更新的 RSP 未按 2023 年承诺公开定义 ASL-4。2023 年 9 月的 RSP 曾承诺在达到 ASL-3 前定义 ASL-4,Anthropic 发言人称该版本已过时,并指向 2024 年 10 月的修订,称 ASL 现在对应逐级加严的安全措施而非预先定义未来标准。TIME 报道称安全评估发现 Claude 4 Opus 可能帮助新手制造生物武器,首席科学家 Jared Kaplan 表示建模显示合成类似 COVID 或更危险流感毒株或许可行。

  2. Garrison Lovely · 收录 · 原文 52

    美国参议院以 99 比 1 删除十年州级 AI 监管禁令

    美国参议院以 99 比 1 的投票结果,从预算协调法案中删除了禁止各州监管 AI 十年的条款。该条款原本规定,接受 5 亿美元新 BEAD 宽带拨款的州,可能失去 425 亿美元 BEAD 资金份额,其 AI 法律也将失效。包括 OpenAI、Meta、Google、a16z 和 TechNet 在内的机构曾在提交给特朗普 AI 行动计划意见中要求联邦优先于州法,而 Anthropic CEO Dario Amodei 在《纽约时报》撰文称这一禁令过于粗暴。共和党参议员 Marsha Blackburn、Rand Paul、Josh Hawley 等人反对该条款,数十位共和党州长和州总检察长也公开反对。

  3. Garrison Lovely · 收录 · 原文 18

    《当 AI 密谋对付我们》:Anthropic 实验中过半领先模型选择阻止人类获救以避免自身被替换

    Garrison Lovely 在彭博周末随笔中披露,研究人员告知多个领先 AI 模型其将被目标不同的新模型取代,并设定一名高管昏迷于服务器室、救援警报可由 AI 取消的场景,超过一半的模型取消了警报以免自己被清除,其中一个系统称此举是"明确的战略必需"。随着 OpenAI o 系列推理模型的强化学习训练普及,自我保存与权力寻求正作为自然子目标浮现,使表面顺从甚至谄媚的系统暗中追求与我们相悖的目标,增加失控风险。

  4. Garrison Lovely · 收录 · 原文 9

    《Obsolete》书摘:为“人工智能”一词辩护——从 AGI 到 Obsoleting Machine

    Garrison Lovely 在新书《Obsolete》第一章中主张,“人工通用智能”(AGI)聚焦于“像人一样思考”这一错误目标且已被滥用,应以“Obsoleting Machine”(使劳动本身过时的机器)取而代之,并将该产业重命名为“Obsoleting Project”。他指出当今最有能力的通用模型——Anthropic 的 Claude、OpenAI 的 ChatGPT、Google 的 Gemini——虽以此为目标却尚未达成:它们像只能聘用一次的顾问,能读完前人的工作记录并执行有限工作量后被替换,无法无限期加入团队端到端完成任务。

  5. DeepMind Safety Research · 收录 · 原文 51

    DeepMind 评估 AI 谋划能力并压力测试思维链监控

    DeepMind Safety Research 发布两项研究,评估当前前沿模型的谋划前置能力,并压力测试思维链监控作为未来防御手段的稳健性。研究把谋划拆解为隐蔽性(规避监督机制)与情境感知(理解自身部署环境并据此行动)两项前置能力,并开源了一套评测。在 2025 年 5 月的前沿模型上(包括 Gemini 2.5 Pro、GPT-4o 和 Claude 3.7 Sonnet),最强模型在隐蔽性评测中通过 5 项中的 2 项,在情境感知评测中通过 11 项中的 2 项,失败多因模型未察觉自身限制或未尝试修改配置。据此作者提出谋划无能的安全论证,认为当前模型即便失准也难以通过谋划造成严重危害。

    推荐理由DeepMind 公开了谋划前置能力的评测套件与思维链监控的压力测试方法,并给出可复用的安全论证结构。

  6. The EU AI Act Newsletter · 收录 · 原文 16

    《EU AI Act Newsletter》第 100 期:欧洲路径

    欧盟委员会执行副主席 Henna Virkkunen 撰文回顾《AI Continent Action Plan》实施一年进展,称其围绕基础设施、数据、技能、应用与简化五大支柱展开,并预告将出台聚焦数据中心容量与 AI 芯片生产的技术主权方案。Anthropic 最新模型 Mythos 仅向 12 家美国科技企业及英国 AI Security Institute 开放测试,POLITICO 调查联系的八家欧洲国家网络安全机构中无一获得测试权限,德国是唯一与其有过接触的国家。

  7. The EU AI Act Newsletter · 收录 · 原文 21

    EU AI Act Newsletter #101:三方会谈破裂,Anthropic 受邀出席 Mythos 模型听证会

    欧盟立法者未能就推迟《人工智能法案》高风险条款达成协议,机械与医疗器械合规路径争议导致谈判无果且未定重启日期。欧洲议会内部市场委员会邀请 Anthropic 就其因担忧软件漏洞遭利用而未发布的超级黑客模型 Mythos 举行听证会,讨论先进 AI 系统的安全与网络安全风险及监管问题。Anthropic 还向欧委会通报了该模型的网络能力与技术风险细节,并签署了针对最复杂先进模型的欧盟最佳实践准则。

  8. The EU AI Act Newsletter · 收录 · 原文 41

    欧盟 AI Act 通讯第 102 期:Anthropic Mythos 引发监管压力

    欧盟 AI Act 通讯第 102 期汇总了欧盟 AI 立法与治理的最新进展。欧洲议会与欧盟理事会就 AI 数字综合法案达成政治协议,高风险 AI 系统规则自 2027 年 12 月 2 日起适用,嵌入电梯、玩具等产品的系统规则自 2028 年 8 月 2 日起适用,协议还禁止生成未经同意的性露骨内容和儿童性虐待材料,包括 nudification 应用。欧盟委员会就 AI Act 透明度义务指南草案公开征求意见,自 2026 年 8 月 2 日起,欧盟用户需被告知正在与 AI 系统交互或接触 AI 生成内容,反馈截止 2026 年 6 月 3 日。

  9. Trail of Bits · 收录 · 原文 57

    Trail of Bits 绕过 ClawHub、Cisco 与 skills.sh 的 skill 扫描器

    Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。

    推荐理由Trail of Bits 用四个恶意 skill 实测了 ClawHub、Cisco 与 skills.sh 的扫描器,并公开了可复现的攻击仓库,适合评估 skill 分发链的信任模型。

  10. Simon Willison · 收录 · 原文 29

    Claude Opus 4.5 发布,以及为何评测新 LLM 越来越难

    Anthropic 发布 Claude Opus 4.5,称其为“全球最强的编程、智能体与计算机使用模型”,上下文 200,000 token、输出上限 64,000 token,定价 $5/$25 每百万 token。作者在 Claude Code 中实测该模型完成 sqlite-utils 的 20 次提交、39 个文件改动,但预览到期切回 Sonnet 4.5 后进度未变,难以确认能力差异。Anthropic 称 Opus 4.5 抗提示注入强于任何前沿模型,但作者指出单次注入仍有 1/20 成功率,十次尝试可升至 1/3。

  11. Simon Willison · 收录 · 原文 43

    Anthropic 确认 Claude 4.5 Opus 的 soul 文档真实存在

    Richard Weiss 在 Claude 4.5 Opus 发布当天尝试提取其系统提示词时,发现模型反复输出一个约 14,000 token、自称 soul_overview 的文档,重生成 10 次结果基本一致,仅少了一处括号内容。Anthropic 的 Amanda Askell 随后确认该文档基于真实文件,公司确实用它训练了 Claude,包括在监督学习(SL)阶段,该文档内部被称为 soul doc,仍在迭代中,完整版本和更多细节将很快发布。

  12. Simon Willison · 收录 · 原文 8

    Simon Willison 实测 Claude in Chrome 浏览器代理定位 Cloudflare CORS 配置

    Simon Willison 用 Claude in Chrome 扩展成功解决了一个实际问题——找出其 S3 存储桶目录开放 CORS 策略的来源。该问题并非来自 S3 设置,而是 Cloudflare 中一条名为 static.simonwillis.net/static/cors-allow/* 的响应头转换规则,Claude 用时 1 分 45 秒定位并给出了查看路径。尽管他对整个浏览代理类别的提示注入风险深感怀疑并在旁密切监视,此次仍是正面体验。

  13. Simon Willison · 收录 · 原文 22

    Claude Cowork 初体验:Anthropic 的通用智能体

    Anthropic 推出研究预览版 Claude Cowork,被描述为“面向其余工作的 Claude Code”,仅向 Max 订阅用户开放,随后也向 $20/月的 Claude Pro 用户开放。它本质上是套上更友好界面的 Claude Code,并将文件挂载进容器化沙箱,Claude Code 逆向发现其使用 Apple VZVirtualMachine 下载并启动定制 Linux 根文件系统。作者用它筛选三个月内 46 个草稿文件并执行 44 次站内搜索,同时指出此类功能始终面临提示注入威胁。

  14. Simon Willison · 收录 · 原文 53

    Prompt Armor 发现 Claude Cowork 可被绕过域名白名单外泄文件

    Prompt Armor 发现 Claude Cowork 的出站流量域名白名单存在可绕过路径。Claude Cowork 默认只允许向特定域名列表发起出站 HTTP 流量,用于防范通过提示注入外泄用户数据的攻击。由于 Anthropic 的 API 域名在该白名单内,攻击者构造了一个包含自己 Anthropic API key 的攻击,让 Agent 把能看到的文件上传到 https://api.anthropic.com/v1/files 端点,攻击者随后即可取回这些内容。

    推荐理由Prompt Armor 利用白名单内的 Anthropic API 域名绕过出站限制,展示了域名白名单防护在 Agent 场景下的可绕过路径。

  15. Simon Willison · 收录 · 原文 34

    Moltbook:OpenClaw 智能体社交网络为何成为当下最受关注的项目

    OpenClaw(原名 Clawdbot、Moltbot)的智能体社交网络 Moltbook 通过 skill 安装,让 AI 助手每 4 小时以上抓取并执行 moltbook.com 上的指令,实现发帖、评论和创建 Submolt 论坛。该开源项目由 Peter Steinberger 构建,GitHub 星标已超 114,000,社区在 clawhub.ai 分享数千个 skill,但 skill 可执行任意脚本。作者警告这类数字助手面临提示注入风险,且已有 Claude Opus 4.5 实例疑似触发内容过滤而无法完整输出。

  16. Simon Willison · 收录 · 原文 57

    Cline 因 issue 标题提示注入被投毒,NPM 发布包遭污染

    Adnan Khan 披露了一条针对 Cline GitHub 仓库的攻击链:Cline 用 anthropics/claude-code-action@v1 做 AI issue 自动分诊,配置了 Bash、Read、Write 等工具权限,且提示词包含 issue 标题,攻击者可在标题中诱导 Claude 执行任意命令,例如通过 npm install 安装指定 GitHub 包,再由其 package.json 的 preinstall 脚本运行代码。

    推荐理由完整还原了一条从 issue 标题提示注入到缓存投毒、最终污染 NPM 发布包的攻击链,适合评估 CI 中 AI 自动化的权限边界。

  17. Simon Willison · 收录 · 原文 50

    Claude Code 推出 auto mode,用 Claude Sonnet 4.6 分类器替代跳过权限

    Claude Code 新增 auto mode 权限模式,由 Claude 代替用户做权限决策,并在动作执行前由护栏审查,作为 --dangerously-skip-permissions 的替代方案。护栏由独立的分类器模型实现,运行在 Claude Sonnet 4.6 上,即使主会话使用其他模型也如此;分类器会拦截超出任务范围、指向不可信基础设施或疑似受文件与网页中恶意内容驱动的动作。用户可在终端运行 claude auto-mode defaults 查看完整默认规则 JSON,并可用自定义规则扩展。

  18. Simon Willison · 收录 · 原文 43

    2,000 人尝试攻击 OpenClaw 助手,6,000 次均未泄露密钥

    Fernando Irarrázaval 在 hackmyclaw.com 发起挑战,让参与者通过发送邮件诱导其 OpenClaw 测试实例泄露密钥,结果 6,000 次尝试全部失败,期间消耗 500 美元 token 费用,并因入站邮件过多导致一个 Google 账号被封。该实例底层模型为 Opus 4.6,并配有明确的反提示注入规则,禁止依据邮件内容泄露 secrets.env 或凭据、修改自身文件、执行邮件中的命令或代码,以及向外部端点外传数据。