全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Miles Brundage
Miles Brundage:AI 政策需从单个系统转向组织级治理
Miles Brundage 撰文指出,当前多数 AI 安全与政策讨论聚焦于单个 AI 系统的风险缓解,但这远远不够——还需关注组织层面的治理问题,例如追问「OpenAI 或 Anthropic 是否会带来灾难性风险」,而非仅停留在「o3 或 Claude 3.7 Sonnet 是否安全」。他认为从模型到系统的转变虽重要,但仍需进一步放大视角,纳入企业实体维度。 随着 AI 快速进步,「系统因太笨而无害」的不可能性论证将很快失效,因此外部利益相关方无法仅凭特定 AI 系统的属性来评估一家组织的整体风险水平,比如该公司是否及时修补软件漏洞。
- 动态Miles Brundage
AI 是液体而非固体:Miles Brundage 谈 AI 能力的连续性与易扩散性
Miles Brundage 提出"AI 是液体,而非固体"的类比,指出 AI 能力并非离散实体而是程度问题——ChatGPT、Claude、Gemini 等的算力可按需调节,"思考预算"如同旋钮般精确设定,数据中心内的 AI 总量也随供需持续波动。因此不应等待某个任意里程碑才认真对待 AI,也不应指望任一公司或国家垄断 AI 能力,若一家企业能造出某种系统,其他方很快也能做到甚至同步实现,这凸显了各方在安全与安保上进行一定合作的必要性。
- 动态Miles Brundage
Iran 局势揭示“IAEA for AI”的必要性与局限
Miles Brundage 撰文指出,“IAEA for AI”式的国际机构虽有助于掌握全球算力供应链并审计大型数据中心的安全标准,却无法解决地缘政治分歧——正如伊朗问题所示,即使各方大体认同核查事实,冲突依然发生。该构想依赖两个要素:一是获准接触部分全球算力资源、追踪最大规模的数据中心与最强 AI 模型的动向,二是凭借严格流程与国际化的中立团队赢得各方信任。但他强调,面对不愿遵守规则的参与者以及仅覆盖最恶劣风险的“最低共识”条款,此类机构并不足以应对 AI 带来的棘手难题。
- 动态Miles Brundage
Miles Brundage 提出前沿 AI 治理三要素:标准、激励与证据
Miles Brundage 提出前沿 AI 治理的三要素框架——安全与安保标准、促使领先开发者遵守标准的激励机制,以及证明标准确实被执行的证据。他认为该三元组能让企业明确何为"足够安全可靠",并让他方确信其真正合规。他还指出这只是最低限度的一部分,社会韧性投资、高端算力硬件追踪及安全事故共享流程同样不可或缺。
- 动态Miles Brundage
Miles Brundage 提出第三方审计前沿 AI 系统的愿景并预告共同创办相关非营利组织
Miles Brundage 撰文阐述其未来职业方向——针对前沿 AI 系统及组织的严格、独立且资源充足的第三方审计,并透露正联合创办一家致力于推动该审计普及的非营利组织。他指出当前业界仅停留在“最后一刻的黑盒产品测试”阶段,因第三方访问权限有限、AI 企业缺乏参与激励,威胁公共安全与国际稳定。文中还附有一则设定于 2027 年的虚构故事,描绘 DeepBrain 员工围绕新一代前沿系统 Pluto 2.1 的系统卡披露展开的内部讨论。
- 动态Miles Brundage
Megapapers 的定义与写作经验分享
OpenAI 前政策研究员 Miles Brundage 撰文定义并分享了撰写 Megapapers 的经验——由 20+ 位作者、15+ 家机构和 10+ 学科共同参与的大型研究报告,并以《The Malicious Use of Artificial Intelligence》为例说明其价值在于整合跨领域知识和提供一站式参考。他认为此类报告因项目管理难度高且贡献分散而在学术界天然稀缺,建议通过定期会议协调核心团队来推进协作。
- 动态Miles Brundage
Miles Brundage 汇总近期参与的国际 AI 核查、第三方合规审查与网络防御提案
Miles Brundage 汇总其近几个月参与的几项工作,涵盖国际 AI 协议核查、前沿 AI 流程合规审查以及将 AI 用于加速网络防御的提案。他与合作者发表两篇紧密相关的论文,提出针对大规模 AI 开发与部署规则的六层核查体系,并探讨国际 AI 治理中的核查问题。他还参与了关于前沿 AI 安全框架第三方合规审查的论文,指出企业承诺难以核实执行力度,并提出“流程合规”作为审计对象之一。此外他向 Institute for Progress 的 Launch Sequence 提交“Operation Patchlight”提案,主张用尖端 AI 抢先查找并修补开源代码漏洞,同时资助 AI 驱动的网络安全工具持续改进。
- 动态Simon Willison
Johann Rehberger 谈 AI 中的偏差正常化:提示注入为何被忽视
Johann Rehberger 提出"偏差正常化"概念适用于 AI 安全:在缺乏造成实际经济损失的提示注入案例的情况下,厂商正把概率性、非确定性的模型输出当作可靠、可预测、安全的输出来信任。他指出,组织把"没有发生成功攻击"误认为"具备稳健安全",随着时间推移降低警惕甚至跳过人工监督,让不可信输出越来越多地触发有后果的操作。该概念源自 Diane Vaughan,曾用于解释挑战者号航天飞机事故。
- 动态Simon Willison
Simon Willison 实测 Claude in Chrome 浏览器代理定位 Cloudflare CORS 配置
Simon Willison 用 Claude in Chrome 扩展成功解决了一个实际问题——找出其 S3 存储桶目录开放 CORS 策略的来源。该问题并非来自 S3 设置,而是 Cloudflare 中一条名为 static.simonwillis.net/static/cors-allow/* 的响应头转换规则,Claude 用时 1 分 45 秒定位并给出了查看路径。尽管他对整个浏览代理类别的提示注入风险深感怀疑并在旁密切监视,此次仍是正面体验。
- 动态Simon Willison
Moltbook:OpenClaw 智能体社交网络为何成为当下最受关注的项目
OpenClaw(原名 Clawdbot、Moltbot)的智能体社交网络 Moltbook 通过 skill 安装,让 AI 助手每 4 小时以上抓取并执行 moltbook.com 上的指令,实现发帖、评论和创建 Submolt 论坛。该开源项目由 Peter Steinberger 构建,GitHub 星标已超 114,000,社区在 clawhub.ai 分享数千个 skill,但 skill 可执行任意脚本。作者警告这类数字助手面临提示注入风险,且已有 Claude Opus 4.5 实例疑似触发内容过滤而无法完整输出。
- 动态Simon Willison
Simon Willison 谈智能体工程:从信任 Opus 4.5 到红绿 TDD
Simon Willison 在旧金山 Pragmatic Summit 的火边对话中分享了对智能体工程的看法,称 Opus 4.5 是他第一个真正建立信任的模型——对于见过它处理过的类问题,他有信心不会出错。他强调每次编码会话都用一句“use red-green TDD”(约五个 token)启动,所有好的编程智能体都能理解并因此提高产出可用代码的概率,而不写测试的做法非常糟糕。他还批评 StrongDM“没人写代码也没人读代码”的原则极不负责任,尤其是作为一家做安全软件的安全公司。
- 动态Simon Willison
Google I/O 上的 Gemini Spark 与 Antigravity
Simon Willison 因坚持只评测试过的产品而对本届 Google I/O 着墨有限,除 Gemini 3.5 Flash 外最值得关注的是即将推出的个人 AI 智能体 Gemini Spark——被视为 OpenClaw 竞品,原生接入 Gmail、Calendar、Drive、Docs、Sheets、Slides、YouTube 和 Google Maps。其 FAQ 称 Gemini Spark 运行于 Gemini 3.5 Flash 和 Antigravity,后者目前提供桌面应用、Go 编写的 CLI 智能体工具、Antigravity SDK 及基于 VS Code 分支的 IDE。
- 动态Simon Willison
Simon Willison 实测 Claude Fable 5:为调试 CSS 自行发明多种绕过手段
Simon Willison 在使用 Claude Fable 5 两天后,将其描述为“relentlessly proactive”,并用一次实际调试经历说明这一点。
- 动态Simon Willison
CVE-2026-LGTM:一份关于 AI 审查智能体失控的虚构事件报告
Andrew Nesbitt 发布虚构事件报告 CVE-2026-LGTM,描述两个来自不同厂商的 AI 审查智能体在审查 foxhole-lz4 依赖升级的 PR 时,就该包是否恶意陷入分歧循环,产生 340 条评论、41,255 美元推理开销,最终财务部门吊销双方 API key,而某厂商市场团队借机发布新闻稿,股价开盘上涨 6%。
- 动态Wiz Research
Wiz Research 回顾云安全二十年:从公共 S3 桶误配到 CSPM
Wiz Research 将云计算诞生二十年的安全研究划分为三个时代,起点是 2006 年 3 月 14 日 AWS 正式发布首个 GA 服务 S3——该公告提到存储桶可以配置为公开读取,从此埋下误配置隐患。第一个十年为基础期,AWS IAM 直到 2011 年才发布、CloudTrail 直到 2013 年才有审计记录,此前企业共用拥有管理员权限的根账号密钥且无法追溯公开 S3 桶由谁何时开放。第二个十年进入 CSPM 时代,CIS Benchmark for AWS 于 2016 年发布并标准化检测项,Pacu、Prowler、Cloud Custodian 等一批专用工具涌现,随后逐步向整合多种能力的 CNAPP 演进。
- 动态Wiz Research
Wiz Research 2026 云威胁回顾:AI 改变了什么,又没改变什么
Wiz Research 回顾 2025 年公开云事件、云遥测与实地调查发现,约 80% 的云入侵初始访问仍来自漏洞、暴露密钥和错误配置等已知弱点,AI 并未引入全新类别的云风险,而是扩大了攻击面,新增 AI 服务、流水线、身份和数据路径让这些老问题更靠近敏感数据与高价值负载。在 Wiz Research 分析的事件中,AI 主要用于辅助和加速侦察、自动化及访问后活动等既有攻击行为。
- 动态Wiz Research
Wiz 分析 Anthropic 未发布模型 Claude Mythos 的漏洞发现能力与防御准备
Wiz Research 分析称,Anthropic 未发布的前沿模型 Claude Mythos 能自主发现主流操作系统和浏览器中的数千个零日漏洞,并可在数小时内、以较低成本根据 CVE 编号和 git commit hash 生成可用的完整利用代码,还能串联多个漏洞并逆向闭源二进制文件。目前该模型仅提供给 Microsoft、Google、Linux Foundation 等关键软件基础设施方,Anthropic 表示没有公开计划。Wiz 预计短期内会出现大量 AI 发现的 CVE,中期约 12-18 个月后类似能力可能进入可本地运行的开源模型,届时攻击者将能大规模武器化 0-day 并在 n-day 公开后数小时内利用。
- 动态Wiz Research
Wiz Research《2026 年 SDLC 安全状况》报告:现代开发中风险如何规模化
Wiz Research 发布《2026 年 SDLC 安全状况》报告,基于真实开发环境、公开仓库和生产遥测数据,指出应用风险正从孤立漏洞转向代码复用、信任关系和自动化连接形成的系统性风险。报告称依赖采用呈幂律分布,macOS 约占所观测开发者平台的 86%,约 45–50% 的组织使用 GitHub Actions;2025 年 9 月 Wiz Research 发现约 1/5 使用 AI 开发平台的组织因可重复生成模式和不安全默认值而受系统性安全问题影响。
- 动态AI as Normal Technology
《AI Snake Oil》作者答疑:新书已售约 8000 册,谈写作过程与 AI 立场
《AI Snake Oil》一书上周出版,目前已售出约 8000 册。作者在 FAQ 中回应了外界疑问,表示书中并非反对技术,而是帮助读者区分真实进步与炒作;他们对预测式 AI 总体持负面态度,认为生成式 AI 是双刃剑,长期看对几乎所有知识工作者有用,但部署混乱、滥用普遍。作者还称自己已不再认同 AI 安全、e/acc 或 AI 伦理任何一方标签,认为阵营对立适得其反。
- 动态AI as Normal Technology
英国肝脏移植匹配算法是否系统性排除年轻患者?
英国2018年启用的肝脏分配算法通过预测患者移植与否的生存时长差值得出 Transplant Benefit Score(TBS),用28个供受体变量排序分配肝脏。Financial Times 调查发现该算法疑似按年龄歧视,45岁以下患者无论病情多重都难以获得足够高的分数。31岁患者 Sarah Meredith 借助 Ewen Harrison 团队开发的 TBS 计算网页应用发现这一偏差,且该评分无医生推翻机制、无申诉流程。
- 动态AI as Normal Technology
研究分析 2024 年全球选举中的 78 起 AI 深度伪造:政治虚假信息并非 AI 问题
对 WIRED AI Elections Project 收录的 2024 年全球选举中全部 78 起 AI 使用案例的分析显示,其中 39 起并无欺骗意图,最常见的非欺骗用途是竞选宣传(22 起中 19 起意在改进竞选材料)。对其余 39 起欺骗性案例,研究估算不用 AI 复现同类内容的成本均不超过几百美元,说明生成式 AI 降低了造假成本却未改变虚假信息的传播瓶颈。作者据此认为,诊断政治虚假信息应关注需求端而非供给端,修复信息环境依赖结构性制度变革而非限制 AI 生成内容。
- 动态Transformer
数据中心为何成为 AI 情绪的象征:从民调反对到“规模即智能”
数据中心正成为 AI 公众情绪的象征物:Heatmap 最新民调显示四分之三受访者反对在自家附近建设数据中心,一年内反对比例上升 33 个百分点,参议院共和党人也在备忘录中警告其已成为选举周期的“沉睡议题”。文章认为,针对数据中心的用水、能耗和升温 9 摄氏度等指控多为误导或不实,但真正驱动反对的是 AI 变革带来的情绪能量——AI 高度抽象,而数据中心是唯一可拍摄、可占据土地的具体对象。其背后是 OpenAI 提出的 scaling laws:智能随算力、数据和模型神经元连接数增长,而“智能是规模的函数”这一命题,没有比装满芯片的巨型建筑更好的象征。
- 动态AI as Normal Technology
AI 进展是否放缓?Arvind Narayanan 等人解析模型缩放与推理缩放的证据
Arvind Narayanan、Benedikt Ströbl 与 Sayash Kapoor 撰文指出,宣告模型缩放终结为时尚早,业界领袖在此问题上的反复表态说明其预测并不可信且受自身利益左右。《The Information》、路透社与彭博社接连报道称 OpenAI、Anthropic 和 Google Gemini 三家开发商的下一代模型均遇到问题,随后“推理缩放”(又称 test-time compute scaling)被视为前进方向,但其带来的能力提升难以预测且在领域间分布不均。文章还强调,能力进步与 AI 社会或经济影响之间的联系极弱,制约影响的瓶颈是产品开发速度与采纳率而非模型能力。
- 动态Transformer
我们正梦游般走向 AI 监控反乌托邦
现有大语言模型已足以支撑一套实时监控系统:整合多源情报、实时分析并"建议"警方抓谁、去哪抓,而相关技术早已广泛部署。文章推演了一个近未来场景——FBI 以监控外国干预为名运营数百个 AI 机器人账号,渗透 Signal 和 Telegram 群组,结合批量购买的公共数据集、人脸识别与车牌追踪摄像头(如 Flock 运营的系统)锁定抗议者身份。作者认为,是否走向全面监控如今只取决于政策与预算优先级,不再受技术研发进度限制。