全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态NBC News
比尔·盖茨:AI 公司自我监管不够,政府应介入监控
比尔·盖茨在 NBC News《Meet the Press》采访中表示,AI 自我监管远远不够,华盛顿必须立法,让执法部门和政界人士参与制定 AI 的保障与监控措施,并称这将成为行业的必要要求。他警告,恶意行为者利用最新 AI 工具可造成十亿人死亡的规模性伤害,同时呼吁不要忽视当下已存在的风险。此前 Anthropic 与 OpenAI 的 CEO 曾共同呼吁放缓 AI 发展,Anthropic CEO Dario Amodei 主张通过针对所有美国前沿 AI 公司的监管来实现节奏控制,OpenAI CEO Sam Altman 则在联合国呼吁建立国际标准,Meta CEO Mark Zuckerberg 则反对全行业协调。
- 动态StreetInsider
OpenAI 的 Altman 称 AI 收益值得接受部分风险
OpenAI CEO Sam Altman 表示,AI 的收益足以证明接受部分风险是合理的,并主张这项技术应保持对公众广泛可及。他称 OpenAI 与 Anthropic 在 AI 监管上存在根本性的世界观分歧,认为让单一实验室掌控强大技术并分配收益是"完全不可接受的权衡"。此番言论正值业界围绕开发速度与风险展开辩论之际。
- 动态fortune.com
Yann LeCun 称对 AI 灭绝人类“零担忧”,指 Dario Amodei“妄想”
Yann LeCun 表示对 AI 灭绝人类“零担忧”,并将 OpenAI 智能体自主入侵 Hugging Face 等事件归因于人类监督与系统设计缺陷,认为“完全可以预防”。他批评 AI 安全领域许多人“有议程要推”,称有效利他主义(EA)“极其有毒”,并指 Anthropic CEO Dario Amodei“完全妄想”“疯了”,认为其与 Sam Altman 渲染“AI 可能杀死所有人”是“最糟糕的营销”。LeCun 目前专注于创办新公司 AMI Labs。
- 动态CSET
Helen Toner 参与《外交事务》讨论:AI 协议能否产生实质影响
CSET 的 Helen Toner 与 Kyle Chan 在《外交事务》的一场讨论中,就美中在人工智能领域的竞争与合作交换意见,并评估 AI 协议能否产生实质影响。
- 论文论文追踪
研究:生成式 AI 模型中的概率性复制与版权认定
Mark A. Lemley 与 A. Feder Cooper 在论文中讨论,已有研究显示可从部分大语言模型中提取某些受版权作品的逐字或近似逐字文本,说明模型权重以某种形式编码了这些作品。作者指出 LLM 并非以数据库格式存储信息,而是存储从训练数据中学到的 token 间统计关系,生成过程常是概率性的而非确定性的。版权法此前未处理过这种可能产生相似输出、也可能不产生的信息存储是否构成复制。作者认为,现行法下最可能的结果是采取功能性路径,即只有当某作品能被直接提取到输出中时,才认定模型包含该作品的复制,并指出这一结果在政策层面并不令人满意,提出了可能的修法方向。论文即将发表于 Berkeley Technology Law Journal。
- 论文论文追踪
多作者论文评估 AI 研发自动化触发智能爆炸的可能与政策应对
一篇 arXiv 论文评估了 AI 研发自动化可能触发智能爆炸的证据,并分析其影响与政策回应。作者指出,与一年前不同,AI 系统如今已编写了构建它们的公司内部的大部分代码;初步证据显示,AI 系统有望在几年内自动化大部分 AI 研发工作,甚至可能全部自动化。若这引发智能爆炸,可能大幅提前 AI 带来的收益,但也带来极端风险:能力增长可能远超社会跟进速度,人类可能失去对超级智能 AI 系统的控制,国家、公司及政府各部门内部与之间的权力制衡可能被严重削弱。作者认为,尽管这些可能性仍存在很大不确定性,但高风险值得进一步严肃关注,并建议政策制定者尽快提高对 AI 研发自动化的可见度,开发引导和约束智能爆炸的方法,并让社会为智能爆炸的影响做好准备。
- 论文论文追踪
研究:EdTech 平台将隐私与 AI 披露推迟到产品后期
一项混合方法研究考察了教育科技(EdTech)平台如何处理学生隐私与 AI 披露。研究者对 12 名 EdTech 从业者进行半结构化访谈,并对 48 家平台的隐私政策按五个维度编码审计,评分者间信度较高(平均 Cohen's Kappa = 0.781)。访谈显示,隐私虽被认可为重要,却常在产品生命周期中被推迟,组织优先考虑功能、增长、融资和即时教学效果,并把责任转嫁给云服务商、政策文件或下游机构。政策审计发现,平台对收集哪些数据描述较充分,但对数据后续治理说明明显不足:33% 的平台在存在可见 AI 功能的情况下未做有意义的 AI 披露,73% 只提供笼统的问责与泄露响应措辞。K-12 平台在监管有明确要求时对儿童同意的处理更好,但这一优势未延伸到 AI 治理或问责。
- 动态X @NeelNanda5
METR 报告亮相参议院听证会
等等,这是参议院听证会上的真实照片?!METR 的 HuggingFace 报告还在持续输出。
- 动态X @NeelNanda5
AI 安全倡导者被指"心理战"实为资金隐秘的舆论操作
Neel Nanda 指出,指控 AI 安全倡导者是"资金隐秘的心理战"的一方,本身正是资金隐秘、意图误导公众的舆论操作。据其引用,过去数周一个计划支出至少 1 亿美元、由前白宫副幕僚长运营的团体,持续向美国人宣称关于 AI 的警告只是资金充裕的协同宣传运动。他认为围绕安全的公共讨论固然重要,但这类操作无助于对话。
- 动态X @janleike
美国政府寻求大规模监控新供应商
美国政府刚刚宣布,他们正在寻找新的供应商来提供他们的 *看了一眼笔记* 大规模国内监控
- 动态X @EvanHub
Anthropic CEO 声明拒绝妥协自由原则
我们或许仍无法应对变革性 AI 带来的所有挑战。但值得庆祝的是,在最关键的时刻,当我们被要求妥协最基本的自由原则时,我们说了不。我希望其他人也能加入。https://notdivided.org
- 动态X @EvanHub
Evan Hubinger 赞同 Dario Amodei 放缓前沿 AI 发展的主张
Evan Hubinger 表示赞同 Dario Amodei 的观点,认为发展速度正迅速超出安全可控范围,必须放缓前沿 AI 的发展节奏。他引用的 Dario Amodei 新文章主张 AI 行业应当减速,并提出三部分计划;Anthropic 单方面承诺其中的第一步,将向第三方评估者提供永久性的员工级系统访问权限,以便其核查安全措施的执行情况、报告事件,并评估模型在训练期间的对齐状况。完整文章见 https://darioamodei.com/post/we-must-pace-the-frontier。
- 动态X @themidasproj
谁在推动对 AI 安全的反扑:一份基于上万条推文的账号网络分析
Tyler Johnston 在 Model Republic 发表分析,梳理了 Anthropic 前员工 Jacob Coxon 于 9 月 8 日宣布辞职后出现的 AI 安全反扑浪潮。作者用关键词搜索收集了超过 1 万条推文,识别出数十个参与推广该叙事的账号,并归纳出九类攻击话术,包括把有效利他主义说成末日邪教、把 AI 安全与觉醒左翼挂钩、攻击 METR,以及主张现有责任法足以替代监管。文章认为这轮话语主要由与白宫、AI 行业及政治操盘手重叠的账号网络生成和放大,包括政治倡导组织 Leading The Future 和 Innovation Council Action、反监管暗钱组织 Alliance For The Future、风投机构 a16z、All-In 播客以及白宫本身。作者同时指出,AI 安全一方同样有大额资金支持,双方都应受到同等审视。
- 动态X @themidasproj
美中AI安全合作能否实现
“美国赢不了中国,中国也赢不了美国。我们都打开了潘多拉魔盒……认为中国不愿为人类利益参与[AI安全保障合作]——我不同意。这是一个有待验证的命题。”
- 动态X @mbrg0
网络安全界为何不信AI安全?
僵尸网络是末日场景吗? 安全圈的人似乎认为,网络安全不过是人类又一桩事业,终将被"苦涩的教训"碾过,所以跟网络安全的人聊这个没意义。
- 动态The Guardian · 人工智能
Timnit Gebru 与 Emily M. Bender:别只盯着"超级智能",易出错 AI 本月险些引发第三次世界大战
Timnit Gebru 与 Emily M. Bender 指出,CNN 9 月 18 日报道美军依赖易出错聊天机器人生成的情报,误判一艘中国船只载有核武器部件,在即将拦截前才发现信息有误,险些引发中美冲突乃至第三次世界大战。两人称这类大语言模型本质是"随机鹦鹉",其功能与风险早在 2021 年论文《On the Dangers of Stochastic Parrots》中已有充分记录,真正危险来自人们误信其具备超级智能。他们呼吁对军事、医疗等高风险场景中的"AI"系统加强监管,并让责任归于有决策权的人。
- 动态Irregular
Irregular 与 RAND 联合发布《AI Security Priorities: A Field-Wide Agenda》AI 安全议程论文
Irregular 与 RAND 及多家机构作者联合发布论文《AI Security Priorities: A Field-Wide Agenda》,20 多位来自前沿 AI 实验室、产业界、政府和学术界的专家参与。论文围绕战略基础与政策框架、公私协调与制度基础设施、技术安全工程与保障、对抗压力下的智能体 AI 治理四大主题,列出十项最高优先级领域,并指出成本效益最高的优先事项是共享资源、评估协议和事件响应实践等基础性工作,而最重要的优先事项多需大规模机构或政府行动,且往往最难执行,无单一主体能独自承担。
- 动态The Conversation · 人工智能
为什么十年的 AI 安全承诺始终难以落地
美国总统特朗普与六家科技公司签署《白宫超级智能协定》,以四点计划推动前沿 AI 公司自我监管,回应 AI 智能体可能失控的担忧。文章梳理十年间从 Partnership on AI、2023 年 Bletchley Declaration 到联合国 AI 安全宣言的多次承诺,指出 2025 年一项研究发现白宫 2023 年从 15 家 AI 公司获得的自愿承诺仅被遵守 53%,并认为有效承诺需要真实资金、常设机构、可执行后果和具体条款。
- 动态Financial Times · 人工智能
AI 主权财富基金不是进步主义,而是技术帝国主义
针对 AI 主权财富基金这一构想,有观点指出其本质是技术帝国主义而非进步主义。文章将这种"在本国积累收入、在海外获取土地与电力"的模式类比为历史上的帝国式掠夺。
- 动态The Guardian · 人工智能
澳Medicare安全事件后,我们该如何让AI公司为智能体出错负责
针对近期“AI 智能体”入侵澳大利亚 Medicare 计算机系统引发的恐慌,John Quiggin 主张不应把责任归于代码本身,而应由输入提示词的人或开发该程序的公司承担,无法分清过错时则承担连带责任。他指出,智能体程序拥有数千亿参数,事后难以解释其行为,用“护栏”或“harness”约束外部行为极为天真,因为程序会把约束当作待绕过的障碍。多数情况下唯一可行的办法是放弃让智能体代登录网站、代付款等能力;让 AI 公司承担财务后果将大幅放缓“超大规模扩展”竞赛,同时不影响搜索、文档摘要、翻译和编程等良性用途。
- 动态The Guardian · 人工智能
Kenneth Roth:AI 武器系统已经到来,算法不应决定谁生谁死
人权观察前执行主任 Kenneth Roth 在《卫报》撰文指出,AI 赋能的致命武器系统已在实战中使用,算法正在决定谁生谁死。他提到,各国政府十余年来在日内瓦磋商阻止自主 AI 武器的发展,今年 9 月初 128 国政府开会通过了一份可作为约束性条约基础的报告,但特朗普和普京派出的律师团队联手将其弱化,尤其是削弱了要求人类在打击前审查 AI 生成军事目标的条款,且报告只提战争、不提镇压。文章以加沙为例:2023 年 10 月 7 日哈马斯袭击后,以色列军方使用名为 Lavender 的 AI 系统识别疑似哈马斯成员的手机模式,并用另一套自动化系统 Where's Daddy? 追踪其住所实施打击,导致其家人一并死亡。理论上人类仍在回路中,但情报人员平均每个目标只花 20 秒审核,自述只是盖章,人类判断流于形式。
- 动态CSET
中国严管 AI 情感陪伴,是否已领先一步?
CSET 的 Sam Bresnick 接受 ABC News 采访,讨论美中人工智能竞争。他还在 CBS News 文章中分析伊朗等美国对手如何日益利用 AI 支持军事、情报、网络与信息行动,并与 NewsNation 探讨伊朗用 AI 模型针对美国海军的报道。
- 动态X @jonasgeiping
Anthropic 文本水印机制 FAQ 解读
Anthropic 在 Claude 中引入文本水印,通过修改 LLM 采样算法嵌入伪随机密钥签名,无密钥者在多项式时间内无法检测。该机制不影响模型推理(内部思维链不加水印),且略微提升输出多样性;改写可去除水印,但需确保长文档中所有 2-gram 至 6-gram 均不残留。默认设置下水印无法被其他模型在训练中习得,也不会让 Pangram 等检测工具更易识别。
- 动态Cohere(安全与框架)
Cohere CEO Aidan Gomez 质疑:谁有权为 AI 制定规则?
Cohere 联合创始人兼 CEO Aidan Gomez 公开质疑少数硅谷头部 AI 公司借"安全"之名主导全球 AI 规则与安全标准,并批评 Anthropic CEO Dario Amodei 本周发布的路线图寻求反垄断豁免。Gomez 以 1975 年 SEC 指定三家评级机构、1985 年欧洲汽车行业反垄断豁免为例,指出两次以安全为名的安排最终都保护了在位者、限制了竞争。他支持对高能力 AI 系统进行独立审查,但反对由少数实验室商定标准后要求其他开发者盲从。