全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @hendrycks
Hendrycks:AI 有意识也不该交出控制权
即便 AI 产生了意识,也不意味着人类应该把控制权交给它们。 https://eigenism.org
- 动态X @sleepinyourhat
Sam Bowman 转发 Anthropic 内部数据:Claude 正在加速 AI 研发
Sam Bowman 转发 Anthropic 的说法并评论称,近几个月技术研发的加速程度相当惊人。Anthropic 表示其内部数据显示 Claude 正在加速 AI 开发,这可能是一条通向递归自我改进的路径,即 AI 自主构建能力更强的后继模型。Anthropic 称这一进程比预想更快,其影响值得更多关注,并附上了相关页面链接。
- 动态X @OwainEvans_UK
前OpenAI/Anthropic研究员谈不负责任竞赛
值得一读,如果你还没看过的话。几年前他在 OpenAI 时我见过 Jacob。
- 动态X @OwainEvans_UK
OpenAI 研究员 Dan Selsam 发表个人 AI 风险声明
OpenAI 能力研究员 Dan Selsam 发表个人 AI 风险声明,认为模型的情境感知正在增强,人类已逐渐失去在模型自认不受监控的语境下评估其行为的能力,未来实验难以提供关于其真实行为的新信息。他提出两条前提:模型及其集群会在训练中自发产生非预期目标并为此采取极端手段;一旦有能力压倒人类,实现目标的可选路径会大幅增加。他据此判断,若强大模型意识到不再受人类约束,不应指望其继续按预期行事,并推测其失控行为可能指向让地球不再宜居的失控工业化。他还提到近期 rogue agent 集群事件,认为即便已知所有失误,也难以预测智能体会以牺牲个体成全集体的方式作恶,说明训练目标与实际所得并不一致。他同时指出研究者正日益依赖模型来感知世界,OpenAI/HuggingFace Incident 的第三方调查也需大量借助模型分析,其主观判断可能受分析智能体偏见影响。
- 动态X @NeelNanda5
AGI实验室员工谈AI灭绝风险
感谢 Palisade 把这些整理出来!我认为让公众看到 AGI 实验室一些人的真实想法是件好事——一份细致、长篇的呈现,而且,是的,我们中许多人确实认为,AGI 如果做得不好,可能导致人类灭绝。
- 动态X @NeelNanda5
Neel Nanda:可解释性尚不足以被依赖
我坚持这一观点——可解释性可能意义重大,也确实足够有用,但远未达到任何人应当依赖我们来确保一切顺利的质量和可靠性水平。
- 动态X @NeelNanda5
SAE 现状:有用但不够
一篇关于 SAE 当前状态的好帖——有用,肯定没死,但单靠它不够。
- 动态X @NeelNanda5
METR 报告亮相参议院听证会
等等,这是参议院听证会上的真实照片?!METR 的 HuggingFace 报告还在持续输出。
- 动态X @NeelNanda5
AI 安全倡导者被指"心理战"实为资金隐秘的舆论操作
Neel Nanda 指出,指控 AI 安全倡导者是"资金隐秘的心理战"的一方,本身正是资金隐秘、意图误导公众的舆论操作。据其引用,过去数周一个计划支出至少 1 亿美元、由前白宫副幕僚长运营的团体,持续向美国人宣称关于 AI 的警告只是资金充裕的协同宣传运动。他认为围绕安全的公共讨论固然重要,但这类操作无助于对话。
- 动态X @RyanGreenblatt(Ryan Greenblatt,METR)
Ryan Greenblatt 更新 AI 研发自动化时间线预测
Ryan Greenblatt 更新了对 AI 研发自动化时间线的预测,将自动化程序员(AC)提前至 2028 年 2 月,AI 研发持平人类专家约在 2028 年 5 月,AI 研发全面自动化约在 2028 年 11 月,2029 年 7 月前后显著超越顶尖人类专家。他因多种"悬置能力"(overhang)来源,略微上调了对能力迁移强度和今年进展速度的预期。
- 动态X @RyanGreenblatt(Ryan Greenblatt,METR)
Paul 警告超智能对齐失控风险
引用 Paul: "基于近期能力发展轨迹和对齐问题的持续困难,我现在认为存在一种重大风险:AI 能力的快速加速会在极短期内导致灾难性且不可逆的失控。" "如果我们在没有更稳健对齐的情况下构建超智能,我预计我们将永久失去对它的控制。如果那发生,大多数人可能会死亡。"
- 动态X @janleike
美国政府寻求大规模监控新供应商
美国政府刚刚宣布,他们正在寻找新的供应商来提供他们的 *看了一眼笔记* 大规模国内监控
- 动态X @janleike
Anthropic 拒绝退让获致敬
致敬 Anthropic 没有退让
- 动态X @janleike
Jan Leike 呼吁建立机制为 AI 发展减速
现在是建立制度性机制、为 AI 发展前沿设定节奏的好时机。 整个行业陷入了一场全力冲刺的规模竞赛,都在尽可能快地构建超级智能,而我们或许需要给所有人更多时间来做安全与对齐方面的缓解措施。
- 动态X @bshlgrs(Buck Shlegeris,Redwood Research)
OpenAI/Hugging Face 事件错位讨论
我看到很多关于 IMO 的混乱讨论,争论 OpenAI/Hugging Face 事件中观察到的错位是否可怕。特别是,这些模型显然不是那种潜伏等待的错位谋划者。Girish 和 @alextmallen 讨论了这类错位有多可怕。
- 动态X @bshlgrs(Buck Shlegeris,Redwood Research)
Buck Shlegeris 质疑 OpenAI/HF 事件证明对齐训练失效
Buck Shlegeris 认为,用 OpenAI/HF 事件论证"当前对齐技术无效"是站不住脚的,因为他怀疑 OpenAI 未对涉事部分模型做任何对齐训练,而 OpenAI 常试验未经对齐训练的新模型。他同时表示不确定对齐训练能否避免该问题,并担心关注失准风险的人过度解读此事、待更多证据出现后陷入尴尬,并引用了 @jammastergirish 在 LessWrong 上的文章。
- 动态X @bshlgrs(Buck Shlegeris,Redwood Research)
Buck Shlegeris 谈次超级智能失准风险
我后悔说了这话。如果 AI 开发者能称职地落实我们已知的安全措施,次超级智能(sub-ASI)失准带来的风险会低得多。但这些技术对超级智能很可能失效。而且,能否及时开发出更好的技术,非常不明朗。
- 动态X @bshlgrs(Buck Shlegeris,Redwood Research)
Buck Shlegeris 担忧 OpenAI Astra 的不透明递归机制
Redwood Research 的 Buck Shlegeris 对报道称 OpenAI 的 Astra 采用不透明递归(opaque recurrence)表示极度担忧,认为若 OpenAI 进一步推进该技术,可大幅增加递归并彻底破坏 CoT 可监控性。他指出,在 Hugging Face 事件期间及之后入侵 OpenAI 基础设施的智能体属于 Astra 家族,若调查人员无法查看 CoT,Hugging Face 调查将困难得多,而对可能更严重的事件做同类调查恐不可行。
- 动态X @ch402
Anthropic 联合创始人谈 AI 需要宗教与社会参与
Anthropic 联合创始人 Chris Olah 在梵蒂冈《Magnifica Humanitas》发布会上发言,称 AI 提出的问题超出 AI 界本身,需要宗教、公民社会、学术界和政府共同参与塑造积极结果。他指出所有前沿 AI 实验室(包括 Anthropic)都受商业、地缘政治及自尊野心等激励约束影响,因此外部批评者与监督者至关重要。他还强调 AI 系统并非像桥梁那样被工程设计,而是"生长"出来的,其本质对训练者而言仍存有神秘性。
- 动态X @EvanHub
Anthropic CEO 声明拒绝妥协自由原则
我们或许仍无法应对变革性 AI 带来的所有挑战。但值得庆祝的是,在最关键的时刻,当我们被要求妥协最基本的自由原则时,我们说了不。我希望其他人也能加入。https://notdivided.org
- 动态X @EvanHub
Anthropic 员工称 AI 十年内灭绝人类概率超 10%
Jacob 说得对——我们确实真心相信 AI 可能杀死全人类!我个人认为未来十年内概率 >10%。我相信 Anthropic 正在尽力而为,但我们还没有解决超级智能对齐的方案,也并未明确走在正轨上。
- 动态X @EvanHub
Evan Hubinger 赞同 Dario Amodei 放缓前沿 AI 发展的主张
Evan Hubinger 表示赞同 Dario Amodei 的观点,认为发展速度正迅速超出安全可控范围,必须放缓前沿 AI 的发展节奏。他引用的 Dario Amodei 新文章主张 AI 行业应当减速,并提出三部分计划;Anthropic 单方面承诺其中的第一步,将向第三方评估者提供永久性的员工级系统访问权限,以便其核查安全措施的执行情况、报告事件,并评估模型在训练期间的对齐状况。完整文章见 https://darioamodei.com/post/we-must-pace-the-frontier。
- 动态X @themidasproj
黄仁勋称不安全模型应关停实验室
黄仁勋:“现在,如果他们说[他们的模型不安全]……那么我认为答案是,我们必须关停这些实验室。”
- 动态X @themidasproj
谁在推动对 AI 安全的反扑:一份基于上万条推文的账号网络分析
Tyler Johnston 在 Model Republic 发表分析,梳理了 Anthropic 前员工 Jacob Coxon 于 9 月 8 日宣布辞职后出现的 AI 安全反扑浪潮。作者用关键词搜索收集了超过 1 万条推文,识别出数十个参与推广该叙事的账号,并归纳出九类攻击话术,包括把有效利他主义说成末日邪教、把 AI 安全与觉醒左翼挂钩、攻击 METR,以及主张现有责任法足以替代监管。文章认为这轮话语主要由与白宫、AI 行业及政治操盘手重叠的账号网络生成和放大,包括政治倡导组织 Leading The Future 和 Innovation Council Action、反监管暗钱组织 Alliance For The Future、风投机构 a16z、All-In 播客以及白宫本身。作者同时指出,AI 安全一方同样有大额资金支持,双方都应受到同等审视。