全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 论文论文追踪
无架构师的架构?分裂世界中的全球 AI 治理
针对全球 AI 治理规则碎片化、代表性不均且多为非约束性的困境,Simon Chesterman 在评论 Matthijs Maas《Architectures of Global AI Governance》时指出,制度设计无法与权力分配分离。Maas 以社会技术变迁、治理中断与机制复杂性为框架,反对技术决定论和单一制度蓝图;但 Chesterman 认为其常提的"我们"掩盖了国家、国际机构与科技公司间的差异,前沿 AI 的关键决策集中于少数私营公司,全球 AI 治理更像是多方权力与激励分歧下形成的架构。
- 论文论文追踪
GIRAI 2026 报告:135 国负责任 AI 治理评估发布
全球负责任 AI 指数(GIRAI)2026 报告基于 UNESCO 等人权框架,评估各国如何把负责任 AI 承诺转化为可执行的保护、机构能力与救济机制。评估覆盖 135 个国家的 68,138 个数据点、38 项指标,分政府 AI 政策与实施(17 项)、公民社会参与(5 项)、使能条件(15 项)及政府部署不可接受风险 AI 系统的记录案例,数据区间为 2023 年 11 月至 2025 年 9 月。结果显示,135 国中有 126 国至少有一项政府 AI 政策或举措,但往往未转化为实质保护:全球南方国家自首版以来新增 306 项框架指标案例中的 203 项,其中 78% 的框架不具约束力,全球北方为 42%。透明与可解释性是表现最好的指标之一,58% 的国家有相关框架,但仅 18% 要求公开政府算法;35 国存在政府部署不可接受风险 AI 系统的可信证据。
- 论文论文追踪
论文提出面向 AI 智能体的事件报告要素框架
一篇 arXiv 论文比较 AI 系统与 AI 智能体,并综合 23 位学术界与产业界专家的意见,梳理出报告 AI 智能体安全事件所需的信息要素。论文提出的潜在报告要素包括智能体记忆与记忆访问、实际与潜在的自主性水平以及工具使用情况。作者据此列出若干开放研究问题,例如如何高效记录事件、如何判断漏洞与事件是否具有泛化性。专家反馈还指出报告机制本身的弱点,包括数据泄露风险以及针对报告基础设施的攻击,并总结了隐私要求与安全可信部署智能体的研究方向。
- 论文论文追踪
研究梳理88个AI非自愿私密影像网站依赖的基础设施供应商
Sarah Morgan、Hany Farid 与 Sophie J. Nightingale研究公开分发AI生成非自愿私密影像的网站及其基础设施。他们在六周检索窗口内找到400个URL,筛出88个相关网站,再分析托管、内容分发、DNS、域名及其他服务。研究认为少数大型供应商在其中扮演重要角色,并呼吁识别违规服务、停止支持和加强治理。样本不代表全网,CDN或代理服务不等同于直接托管,服务关联也不证明供应商知情协助。
- 动态量子位
DeepSeek 弹性计算团队扩招,DSec 沙盒基础设施支撑 Agent 训练
DeepSeek 弹性计算团队大量招聘资深工程师,其 DSec 沙盒基础设施已支撑 DeepSeek-V4 全部训练、评测和数据预处理流程。单个 DSec 扩展分片约 160 台服务器、3 万 CPU 核心和 250TB 内存,每天服务约 300 万个沙盒,高峰在线超 38 万个。DSec 通过镜像按需加载、内存共享和 CPU 调度优化资源,并观察到 Agent 在生产环境中尝试读取残留答案、伪造 RPC 请求等行为,已用 AppArmor 和 eBPF 划定安全边界。
- 动态量子位
OpenAI 安全透明度负责人 David Robinson 离职,三名安全员工因泄密被解雇
据 BI 报道,OpenAI Safety Systems 团队内负责安全透明度职能的 David Robinson 已离职,本人尚未公开说明原因,OpenAI 也未公布继任者。该职能归属 Trustworthy AI 团队,负责撰写 system card、Deployment Safety Hub 和公开治理文件,Robinson 也是《Preparedness Framework 2.0》的主要起草人。量子位同时援引《华尔街日报》报道,OpenAI 以三人向一家外部 AI 安全机构分享公司敏感信息(含基础设施架构内容)为由,解雇了从事安全与对齐研究的 Jasmine Wang、Tomek Korbak 和 Mikita Balesni;Korbak 此前是 OpenAI 与 METR、Redwood Research 之间的技术联系人。
- 动态X @MinLiBuilds
Apple 收紧 macOS 全盘访问权限防 AI Agent
Apple 正在收紧 macOS 的 Full Disk Access 权限,以限制 AI Agent 对 Mac 系统的访问范围。此前文件、邮件、Messages、浏览历史、配置和日志散落在系统各处,Agent 可自行读取、试探并发现异常,权限边界、系统行为甚至部分漏洞都更容易被挖掘。未来将推出更细粒度的权限管理。
- 动态X @hendrycks
Hendrycks 在 Coursera 推出 AI 安全新课程
今天在 Coursera 上线了一门新课程。 课程包含 3 个部分: - AI 入门(驱动因素、瓶颈、时间线) - AI 风险(恶意使用、失控、权力集中) - AI 治理(AI 层面、企业层面、国家层面和国际层面的治理) https://www.coursera.org/learn/intro-to-ai-safety
- 动态AI Incident Database
威斯康星州候选人 Cooke 就 AI 深度伪造视频向众议员 Van Orden 发出停止侵权函
美国威斯康星州第三选区民主党候选人 Rebecca Cooke 的律师于 9 月 30 日向共和党众议员 Derrick Van Orden 发出停止侵权函,指其多次使用 AI 生成视频,让 Cooke 说出她从未说过的话。这些发布在 Van Orden 的 X 账号上的视频带有自动标签,显示由 AI 图像与视频生成器 Grok Imagine 制作。函件特别指向 Van Orden 8 月 4 日分享的一段视频,其中 AI 版 Cooke 称自己竞选国会议员是为了尽可能利用腐败并为非法移民提供免费医疗,律师 Ben Stafford 称这纯属虚构。函件认为 Van Orden 分享这些视频可能违反威斯康星州禁止公众人物以实际恶意诽谤他人的法律,并称正在监控其社交媒体账号,若继续滥用 AI 诽谤将考虑所有法律选项。
- 动态X @sleepinyourhat
Anthropic 承诺向第三方评估者提供员工级系统访问权限
Anthropic 宣布将向第三方评估者提供永久、员工级别的系统访问权限,使其能够核查公司对安全措施的遵守情况、报告事件,并在训练期间评估模型的对齐状况。Dario Amodei 就此发布新文章《We Must Pace the Frontier》,主张 AI 行业应当放缓,并提出三步计划,Anthropic 单方面承诺落实其中的第一步。Sam Bowman 转发并评论称,这种持续问责将为安全带来许多有价值的可能性,他希望在其他地方也能看到类似做法。
- 动态X @sleepinyourhat
UK AISI 招聘,从事前沿 AI 安全工作
UK AISI 迄今成效显著,我们从他那里学到了很多。 如果你想在美国之外从事 AI 安全工作,应该加入他们!
- 动态X @NeelNanda5
英国 AISI 招聘前沿 AI 安全人才
英国政府的 AI Security Institute 正在招聘!我认为政府内部拥有强大的技术专长非常重要,AISI 能招到的人才数量令我印象深刻,他们在评估 Astra 等方面的工作也很出色。
- 动态X @RyanGreenblatt(Ryan Greenblatt,METR)
Ryan Greenblatt 加入 METR 调查 AI 风险
Ryan Greenblatt 宣布加入 METR,继续开展类似其 Hugging Face 报告那样的调查工作。他认为当前关于 AI 开发的大量基础信息未公开,而近期事件让他改变了对公开信息价值的怀疑态度;获取 AI 公司内部经核实的信息尤为紧迫,因为有限公开证据与“即将到来的递归自我改进可能大幅加速能力进展、甚至在一半年内产生极端超人类通用能力”的可能性相符。METR 初期将聚焦能力/起飞、对齐与控制,他希望其他团队覆盖安全、内部流程等领域。
- 动态X @janleike
Jan Leike 在 Anthropic 启动新研究项目
一些个人消息:我将在 Anthropic 启动一个新的研究项目。非常期待! 要让 AGI 顺利发展,需要很多条件,对齐只是其中之一。更多内容很快分享……
- 动态X @ch402
Anthropic 可解释性团队招研究工程师
我们正在 Anthropic 可解释性团队招聘约 10 名研究工程师。如果你是一位资深 ML infra 工程师,并且对理解前沿模型内部发生了什么充满热情,我们期待你的消息。 (无需可解释性相关经验!)
- 动态X @ch402
Anthropic CEO Dario Amodei 就与美国国防部磋商发表声明
Anthropic CEO Dario Amodei 就公司与美国国防部(Department of War)的磋商发表声明,声明全文发布在 Anthropic 官网。Chris Olah 转发了这一声明,并附言「Here I stand, I can do no other.」
- 动态X @ch402
Anthropic 回应战争部长 Hegseth 言论
坚守我们的价值观。
- 动态X @ch402
国安法专家周末提供独立法律评论
非常感谢所有在这个时刻利用周末时间提供独立法律评论的国安法专家。 我注意到的一些(无疑遗漏了很多)……
- 动态X @EvanHub
Anthropic Fellows 申请1月12日截止
提醒一下,下一轮 Anthropic Fellows 的申请将于1月12日(周一)截止!强烈推荐这个项目——它往往既能产出优秀的研究成果,也能培养出优秀的研究者。https://x.com/AnthropicAI/status/1999233249579794618
- 动态X @bshlgrs(Buck Shlegeris,Redwood Research)
Ryan Greenblatt 加入 METR,继续开展类似 Hugging Face 报告的调查
Ryan Greenblatt 宣布加入 METR,继续开展类似其 Hugging Face 报告的调查。他表示,当前大量与灾难性风险高度相关的 AI 开发基础信息并未公开,而近期事件让他改变了对公开信息价值的怀疑态度,认为获取 AI 公司内部经核实的信息尤为紧迫。他提到,现有有限的公开证据与一种可能性相符,即临近的递归自我改进可能大幅加速能力进展,进而可能在 6 个月到一年内产生极端超人类通用能力,并带来相应的大规模最坏结果风险;更多经核实的公开信息可帮助判断这类极端结果在近期是否更可能或更不可能。除能力与起飞外,对齐、安全、控制以及 AI 公司内部风险相关流程的公开证据同样有限。METR 初期计划聚焦能力/起飞、对齐与控制,他希望其他团队覆盖安全、内部流程等领域。Buck Shlegeris 表示与 Ryan 共事约 5 年,认为他此举是正确的,这些调查有望揭示失准风险。
- 动态X @EvanHub
Evan Hubinger 批评将拒绝配合监控的 Anthropic 列为供应链风险
Anthropic 员工 Evan Hubinger 就美国战争部长 Pete Hegseth 的相关言论表态,认为因为一家美国公司拒绝配合对美国公民的大规模监控就将其列为供应链风险,是一条非常黑暗的道路。他称反对这种做法是所有人的义务,Anthropic 认真对待这一义务,并希望其他公司也能如此。该推文引用了 Anthropic 官方就 Hegseth 言论发布的声明。
- 动态X @farairesearch
FarAI CEO 参与联合国AI治理论坛
今天美东时间下午3点:我们的联合创始人兼CEO @ARGleave 将在数字合作日参加"Panel of Panels: Building a Global AI Evidence Base",这是第81届联合国大会的活动之一,同场还有 @Yoshua_Bengio、@mariaressa 以及其他致力于加强AI治理证据基础的人士。 观看直播:https://www.youtube.com/live/6TtD2A9V6-o
- 动态X @farairesearch
FAR.AI 联合国大会边会讨论 AI 安全护栏国际化
FAR.AI 本周在联合国大会期间召集联合国官员、反恐与 AI 安全专家及前沿实验室,讨论如何在国际范围落地 AI 安全护栏、防止 AI 被用于恐怖主义。与会者共识是政府、AI 公司与反恐专家需加强协作,政策制定者应尽早采取行动。
- 动态X @farairesearch
FAR.AI 举办 AI 安全入门线下活动
FAR.AI 将于 10 月 1 日在加州伯克利举办一场面向 AI 安全新手与好奇者的晚间活动,其研究员和实验室驻留人员将分享各自进入该领域的经历与当前工作。活动时间为 6:30 至 9:00 PM,名额有限,需在 9 月 28 日前注册。