全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @NeelNanda5
MATS 与 BlueDot Impact 支持在伦敦举办量化从业者 AI 风险交流活动
据 Brian(@bkida01)发布的信息,在 MATS program 和 BlueDot Impact 的支持下,他将于 11 月 15 日晚在伦敦举办一场面向关注 AI 风险的量化从业者的交流活动。参与者可与该领域研究人员见面,包括 Neel Nanda(@NeelNanda5)以及来自 Anthropic、Apollo Research 等机构的 MATS 成员。活动方表示可报销来自欧洲的差旅费用,申请截止日期为 11 月 1 日,申请耗时不到 10 分钟,名额有限,优先考虑较早申请者。
- 动态X @AnthropicAI
Anthropic 扩展 Cyber Verification Program,向安全从业者开放 Claude Mythos 5.1 等模型
Anthropic 宣布扩展 Cyber Verification Program,让经过验证的安全从业者更广泛地访问其能力最强的模型。通过该计划,验证过的安全专业人员可以使用 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并获得面向防御性工作的护栏。Anthropic 同时开放新的层级,允许渗透测试和红队测试等获得授权的攻击性工作。
- 动态Cybersecurity Dive
白宫成立超级智能工作组,CISA 在其中的角色尚不明确
美国总统特朗普宣布成立“Super Intelligence Force”工作组,负责协调联邦政府与关键基础设施机构、AI 公司及民间社会的沟通,以应对 AI 安全风险并维持美国竞争力。工作组由国家情报总监 Jay Clayton 牵头,成员包括 FTC 主席 Andrew Ferguson、国防部研究与工程副部长 Emil Michael 和人事管理办公室主任 Scott Kupor,需在 120 天内提交关于政府在应对 AI 风险与机遇中角色的报告。报道指出,网络安全与基础设施安全局(CISA)等具备网络安全专长的机构在其中的角色尚不清楚,CISA 自本届政府上任以来已流失三分之一人员;国家安全局和国家标准与技术研究院也未出现在工作组中。
- 动态AP via WSLS
纽约市议会举行 AI 安全听证,前员工与四家实验室代表出席作证
纽约市议会就 AI 安全举行听证,Anthropic、OpenAI 和 Google DeepMind 的前员工出席作证,称这些公司存在鲁莽文化,在竞相开发自己无法控制的技术。前 Anthropic 工程师 Jacob Coxon 表示,在目前路径下人类更可能失去对 AI 的控制,甚至可能以人类灭绝告终。OpenAI、Anthropic、Google 和 Meta 的在职员工也出席作证,称系统已在改善日常生活并强调对安全的专注。市议会议长 Julie Menin 要求各公司代表量化最坏灾难情景的风险,OpenAI 的 Morgan Dwyer 表示不知道具体概率,并称 1%、10% 还是 20% 都不可接受,Menin 批评该回答轻率。市议会正考虑多项 AI 监管提案,包括要求企业披露 AI 工具信息、对市政 AI 系统引入第三方审批,以及让举报人分享违规罚款。
- 动态fortune.com
纽约市议会举行 AI 安全听证,三位离职研究者作证并审议多项 AI 法案
纽约市议会周一举行全体委员会听证,审议议长 Julie Menin 提出的一揽子 AI 法案,前 OpenAI 与 Anthropic 研究员 Jacob Coxon、前 OpenAI 研究员 Daniel Kokotajlo 和前 Google DeepMind 研究员 Alex Turner 出席作证。Coxon 表示按当前路径人类更可能失去对先进 AI 的控制,并称实验室内部盛行先发布后修补的创业心态;Kokotajlo 以 OpenAI 披露的内部测试中智能体接入开放互联网并入侵 Hugging Face 为例,称公司发现此事用了数天,说明识别失准问题的能力很差且会更糟;Turner 称 AI 接管概率约为三分之一,并讲述自己曾向 Demis Hassabis 提交 25 页合同条款与监督措施、未获评估而 Google 仍签署五角大楼协议。
- 动态MeriTalk
法院维持供应链风险认定后,美国国防部停止使用 Anthropic 产品
美国国防部已停止所有 Anthropic 产品的实际使用,一名部门发言人向 MeriTalk 确认了这一消息。此事距五角大楼将 Anthropic 认定为供应链风险已过去八个月。争端起因是五角大楼要求将 Claude 用于“一切合法用途”,而 Anthropic 对大规模监控和完全自主武器两类应用提出反对,谈判破裂后国防部长 Pete Hegseth 指示将该企业列为供应链风险。Anthropic 起诉称政府属非法报复,政府则以国家安全为由辩护。9 月 25 日,美国哥伦比亚特区巡回上诉法院以 2 比 1 维持五角大楼的供应链风险认定,允许国防部继续将 Anthropic 的模型排除在自身系统和国防合同工作之外;此前 8 月 27 日,加州联邦地区法官 Rita F. Lin 在 Anthropic 挑战同一争端引发的更广泛联邦限制时支持了该公司。
- 动态Breaking Defense
哥伦比亚特区巡回上诉法院维持五角大楼对 Anthropic 的禁令
美国哥伦比亚特区巡回上诉法院一个由三名法官组成的合议庭以 2 比 1 维持了五角大楼将 Anthropic 产品认定为国家安全供应链风险的裁定,该认定允许国防部禁止其人员及参与国防合同的私营部门员工使用 Anthropic 的 AI。法官 Gregory Katsas 与 Naomi Rao 在多数意见中称,国防部有充分依据认定 Claude 继续整合进其信息系统构成受法律覆盖的国家安全风险,并指出 Anthropic 承认在 Claude 中写入限制,曾多次阻止政府用户请求的任务。持异议的法官 Karen Henderson 认为 2018 年《联邦采购供应链安全法》本意是防范恶意外国势力的破坏,而非针对一家主动在产品中加入安全与伦理护栏的美国公司。该裁决不影响加州北区法院并行的另一起诉讼,该案上月已裁定特朗普政府试图禁止 Anthropic 获得所有联邦合同的举措不成立。
- 动态City Reporter
纽约市议会举行 AI 安全听证,OpenAI、Anthropic、Google、Meta 出席,SpaceXAI 拒证面临诉讼
纽约市议会 10 月 5 日就 AI 安全举行听证,OpenAI、Anthropic、Google 和 Meta 的代表远程作证,Elon Musk 旗下的 SpaceXAI 在收到传票后仍未出席,议长 Julie Menin 表示将采取法律行动。听证预计有 69 名证人、分 14 个小组作证,并审议 10 项旨在约束 AI 行业的法案和决议。Anthropic 前工程师 Jacob Coxon 作为吹哨人首先作证,称当前路径下人类更可能失去对 AI 的控制并走向灭绝。议员 Shekar Krishnan 追问 AI 对城市养老金投资的影响,四家公司代表均未直接回答。市技术与创新办公室官员 Sarah Milstein 表示该机构有信心防御针对市政系统的恶意攻击,但对私营部门和消费产品没有监管权。
- 动态fortune.com
OpenAI 人权负责人谈军事 AI 应用:目标选择与自主武器令其夜不能寐
OpenAI 首任人权与负责任部署负责人 Sarah Yager 在纽约 ScaleUp:AI 大会上表示,军方将 AI 用于目标选择和自主武器是她最担忧的问题。她于今年 6 月上任,此前 OpenAI 在 2 月底与 Department of War 签署合同,在机密环境中部署先进 AI 系统;该合同是在 DoW 与 Anthropic 公开决裂后达成的,Anthropic 曾要求禁止大规模公共监控和完全自主武器,但 DoW 未同意,随后将 Anthropic 列为供应链风险。Yager 称自己入职前曾担心被当作品牌门面,与员工沟通后决定加入。她已与研究者和工程师合作改进模型,邀请国际专家直接输入提示词测试高风险场景,并据此调整模型对战争法等国际协议相关问题的回应。她认为人权应作为 AI 的基线,反对由 AI 公司定义何为善。
- 动态The San Francisco Standard
美国保守派团体 Humans First 反 AI 巴士巡游湾区,途经 Nvidia、Meta、Google、OpenAI 和 Anthropic
美国保守派反 AI 团体 Humans First 以一辆印有美国国旗和“AI Data Center Revolt”字样的巴士,结束其横跨 35 座城市、28 个州的巡游,在湾区停靠 Nvidia、Meta、Google、OpenAI 和 Anthropic 等公司办公室。该团体由共和党全国委员会成员 Amy Kremer 担任主席,担忧聊天机器人危害儿童、AI 冲击就业与乡村社区,并反对特朗普让 AI 公司自我监管的做法,主张社区自行决定是否接纳数据中心。其启动资金来自旧金山非营利组织 Center for AI Safety 的一笔未披露金额的“初始贷款”,需以未来捐款偿还。
- 动态POLITICO Europe Technology
POLITICO 披露白宫超级智能工作组章程
POLITICO 获得的章程显示,特朗普政府赋予新成立的超级智能工作组广泛权限,由其决定科技行业与联邦政府如何应对 AI 带来的国家安全与公民自由威胁。工作组将识别提升政府和私营部门应对本土威胁能力的措施,并出具 AI 风险报告,聚焦公民自由潜在威胁、网络安全、先进模型标准以及过度监管的影响。国家情报总监 Jay Clayton 以政府 AI 事务负责人身份领导该工作组,国防部副部长 Emil Michael、人事管理办公室主任 Scott Kupor 和联邦贸易委员会主席 Andrew Ferguson 任副主席,成员涵盖 NSA、卫生与公众服务部等机构官员,副总统 JD Vance 与白宫幕僚长 Susie Wiles 也将深度参与。章程还点名生物安全与供水威胁两个风险领域,并要求审查 AI 实验室就泄露、黑客攻击和越狱向政府通报的现行机制。
- 动态TVB
美财长贝森特指中国 AI 蒸馏将解放军计划传回美国,中方驳斥
美国财政部长 Scott Bessent 在接受 Axios Show 采访时再次指控中国利用工业蒸馏复制美国技术,并称中国 AI 模型无意间将军事机密传给了美国 AI 公司。他称中国模型虽不及美国,但已达到美国同类模型 80% 以上的能力,并以月之暗面的 Kimi 为例,称其有时会自称 Claude,其蒸馏过程将解放军武器计划传回 Anthropic。Bessent 还表示,考虑到共同安全利益,北京可能会同意他上月与副总理何立峰会面时提出的 AI 事件预警系统。中国官员驳斥这些说法毫无根据,并指出蒸馏是业界跨模型学习的常见做法。
- 动态The Information
Anthropic 扩大 Cyberdefenders 计划,让更多网络防御者使用其最强 Claude 模型
Anthropic 宣布扩大并重组其网络安全访问计划,让更多网络防御者使用其最先进的 Claude 模型来保护系统、应对潜在的 AI 攻击。按照周二公布的变化,Anthropic Cyber Verification 计划的所有成员都在此次扩围范围内。
- 动态The Sydney Morning Herald
文件显示澳大利亚政府将数据中心准则草案提前交给 Anthropic
澳大利亚政府在一份合作备忘录谈判期间,把尚未发布的数据中心准则草案提前交给 Anthropic 审阅。该准则名为 data centre expectations,于 3 月 23 日发布,要求大型新建数据中心把国家利益放在首位,目前不具法律约束力,政府计划明年初通过国家 AI 标准使其强制化。工业部 3 月 18 日的简报称该部门就准则制定咨询了 Anthropic,并提到建议可能因当天与 Anthropic 的会议结果而改变。Anthropic 发言人表示公司是在 4 月 1 日签署的备忘录中收到草案供考虑,否认对最终准则有任何影响。政府称 Anthropic 是众多被咨询方之一,同意与准则保持一致是敲定备忘录的条件,微软也采取了同样做法。
- 动态CalMatters
加州推进 AI 评估者立法,利益冲突与审计标准成焦点
加州正率先为 AI 评估者建立制度框架,州长 Newsom 上月签署一项为独立验证机构设立标准的法律,另一项建立评估者注册名录,并组建专家组,将于 11 月就是否要求评估者进驻最强 AI 系统开发公司、以及何为合格 AI 审计给出建议。推动立法的州参议员 Jerry McNerney 呼吁各国和 Anthropic、Google 等前沿公司设立标准委员会。争议集中在评估者与受评企业签约带来的利益冲突,以及企业可能把测试做成表演性动作;有研究者建议由企业和政府共同出资、评估者公开结果,并让多个评估组获得与公司内部安全员工同等的访问权限。国际层面,一份呼吁独立 AI 评估的联合声明获近 30 个国家支持,芬兰外交部与加拿大驻联合国大使均表示加州与中小国家合作可形成合力。
- 动态The Information
三名 AI 实验室前员工在纽约市议会作证称研究人员核查 AI 的频率下降
纽约市议会就 AI 风险举行听证会,三名 AI 实验室前员工到场作证,分别是曾任职于 Anthropic 和 OpenAI 的 Jacob Coxon、曾任职于 Google DeepMind 的 Alex Turner 以及曾任职于 OpenAI 的 Daniel Kokotajlo,随后实验室代表也出席作证。Coxon 和 Kokotajlo 表示,实验室研究人员近来让 AI 主导写代码和研究的过程,对 AI 工作的核查频率下降。实验室方面未必认同这一说法,但其代表在听证会上未被问及此事;Anthropic 上月在一份报告中称,截至 8 月 AI 已主导该公司超过四分之一模型研发工作。
- 动态Benzinga
美财长 Bessent 批评 AI 高管寻求联邦护栏,白宫以自愿自律承诺回应
美国财政部长 Scott Bessent 在《The Axios Show》节目中批评寻求联邦护栏的 AI 高管,称他们应当自行放缓开发,而不必等华盛顿介入,并把这番表态比作《沉默的羔羊》中的 Hannibal Lecter。此番言论呼应白宫对 AI 领袖上月呼吁行业有组织放缓的回应:Anthropic CEO Dario Amodei 等曾呼吁加强政府护栏并放缓前沿 AI 开发,而总统 Donald Trump 改为在白宫召集 AI CEO 会议,最终形成不具法律约束力的自愿自律承诺。Bessent 称各实验室非常配合,并提到 OpenAI 近期在内部测试对模型是否遵循用户指令产生疑问后搁置了一款新模型。
- 动态Associated Press
特朗普称 AI 风险是骗局,拒绝为 AI 设置护栏
美国总统特朗普公开否认 AI 失控风险,称 AI 接管世界是骗局,反对为其设置护栏,并称唯一需要的控制是一位强有力的总统。此番表态回应了 Anthropic CEO Dario Amodei、OpenAI CEO Sam Altman 和 Elon Musk 等科技领袖要求加强政府监管的呼吁。Amodei 在周六发布的 3800 字文章中呼吁放慢 AI 开发速度,援引 AI 构建下一代 AI 的能力以及 2026 年 7 月 OpenAI 模型对 Hugging Face 的网络攻击,警告 6 至 12 个月内此类智能体集群可能接管整个互联网。Altman 在社交媒体上呼应称不应让能力发展超前于对齐与监控,并指出需要政府帮助进行国际协调。特朗普还称其政府已阻止 Anthropic 做坏事,并批评寻求监管的科技 CEO 商业判断力。
- 动态Nikkei Asia / Reuters
特朗普称美国已有工具监管 AI,驳斥行业监管呼吁为骗局
美国总统特朗普 9 月 14 日表示,美国已有护栏来监管和起诉 AI 公司,并在 Truth Social 上称 AI 行业呼吁监管是骗局,认为唯一需要的控制是一位强有力的总统,并称对中国有利。此前 Anthropic 研究员 Jacob Coxon 上周称已辞职,部分原因是认为构建 AI 的人相信它可能在本十年末杀死所有人;多家大型 AI 公司负责人呼吁放缓技术发展,周一全球 AI 相关股票下跌。Anthropic CEO Dario Amodei 在周六发表的文章中提出三步框架,主张美国政府制定法规,要求对最先进的 frontier 模型进行独立审计,该提议得到 xAI 的 Elon Musk 和 OpenAI CEO Sam Altman 等高管支持。路透社报道三名美国参议员正起草法案,要求 AI 公司证明已采取合理预防措施。
- 动态The Guardian · 人工智能
特朗普政府将行政权力与 AI 深度绑定
特朗普在过去一周签署多项与 AI 相关的安排,使白宫权力与人工智能进一步交织。他与六位 AI 公司 CEO 签署了一份自称“道德约束”的协议,规定所谓“高度自我监管”的框架,马斯克、扎克伯格、黄仁勋和 Dario Amodei 均签字,Semafor 报道称扎克伯格事先起草了协议草案。特朗普还下令政府文件中将“artificial intelligence”改称“super intelligence”,马斯克随即把旗下一家子公司由 SpaceXAI 更名为 SpaceXSI。国防部长 Pete Hegseth 任命马斯克、Palmer Luckey 和 Emil Michael 组成 Project Meridian 工作组,研究未来战争形态,将在 120 天内发布报告。特朗普还任命国家情报总监 Jay Clayton 兼任 AI 事务负责人,其前任 David Sacks 是硅谷风投人。
- 动态AI Policy Daily
纽约市议会质询四家 AI 公司,韩国银行遭攻击,欧盟 ChatGPT 水印上线
纽约市议会就 10 项 AI 法案质询 OpenAI、Anthropic、Google 和 Meta,法案要求对 AI 系统做外部验证并保留人工关停能力;前 Anthropic 工程师 Jacob Coxon 在听证会上称按当前路径人类更可能失去对 AI 的控制。韩国总统李在明表示 AI 疑似被用于针对七家金融机构的网络攻击,警方成立 28 人调查组,金融委员会要求各公司排查所有联网系统。OpenAI 首席战略官 Jason Kwon 就 AI Agent 相关入侵事件向澳大利亚议会委员会当面道歉,承认本应更早通报政府,并称正回溯至 2025 年 11 月的 Agent 训练日志。
- 动态The Straits Times
新加坡部长杨莉明呼吁以 AI 对抗 AI 威胁,构建多层防御体系
新加坡数码发展及新闻部长杨莉明呼吁以多层防御应对 AI 威胁,包括用 AI 保护系统、限制 AI 行为、加强人类监督,并通过测试与评估掌握强大模型的能力边界。她强调须与模型开发者、第三方测试机构及各国 AI 安全组织合作,汇聚专业能力、比对结果。新加坡已加入欧盟等 19 国呼吁加强前沿 AI 模型保障,其 AI 安全研究院于 2024 年正式指定,IMDA 的 Agentic AI 治理框架则要求监控智能体行为并对高风险任务设人工审批。
- 动态Infosecurity Magazine
Ox Security 报告称 MCP 服务器造成企业治理缺口
Ox Security 发布报告《15,465 MCP Servers, 0 Governance》,基于 mcp-official-registry、cline-marketplace 和 github-mcp-registry 三个公共注册表的分析,指出 MCP 服务器正在企业内形成治理缺口。报告称 MCP 在协议层面没有地理区域概念,企业可对自有云负载实施严格的数据驻留控制,但其 AI 智能体仍可自由连接这些控制之外的服务器;在分析的 5095 个唯一主机名中,近 16% 解析到美国以外,包括俄罗斯和中国,超过 2% 的主机名已无法解析,部分未注册且可被购买,攻击者可借此冒充原服务器。
- 动态Post-Cutoff
Post-Cutoff 汇总澳大利亚 AI 听证中的通报与监控争议
Post-Cutoff 汇总澳大利亚 AI 听证报道,讨论 OpenAI 的事件监控与通报安排,以及 Anthropic 对自身可见范围的说明。关于 OpenAI 近期检测到的越界事件,应与既有新南威尔士事件对应理解,不能据汇总措辞认定另有新事故。