全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @ch402
国安法专家周末提供独立法律评论
非常感谢所有在这个时刻利用周末时间提供独立法律评论的国安法专家。 我注意到的一些(无疑遗漏了很多)……
- 动态X @ch402
Anthropic 联合创始人谈 AI 需要宗教与社会参与
Anthropic 联合创始人 Chris Olah 在梵蒂冈《Magnifica Humanitas》发布会上发言,称 AI 提出的问题超出 AI 界本身,需要宗教、公民社会、学术界和政府共同参与塑造积极结果。他指出所有前沿 AI 实验室(包括 Anthropic)都受商业、地缘政治及自尊野心等激励约束影响,因此外部批评者与监督者至关重要。他还强调 AI 系统并非像桥梁那样被工程设计,而是"生长"出来的,其本质对训练者而言仍存有神秘性。
- 动态X @EvanHub
Anthropic CEO 声明拒绝妥协自由原则
我们或许仍无法应对变革性 AI 带来的所有挑战。但值得庆祝的是,在最关键的时刻,当我们被要求妥协最基本的自由原则时,我们说了不。我希望其他人也能加入。https://notdivided.org
- 动态X @EvanHub
Anthropic 员工称 AI 十年内灭绝人类概率超 10%
Jacob 说得对——我们确实真心相信 AI 可能杀死全人类!我个人认为未来十年内概率 >10%。我相信 Anthropic 正在尽力而为,但我们还没有解决超级智能对齐的方案,也并未明确走在正轨上。
- 动态X @farairesearch
AI 或通过说服人类削弱监管
失准的 AI 可能不需要规避人类监督。它可能只需要说服进行监督的人类。 我们的新论文提出了一个评估这一威胁的框架,我们称之为"说服削弱控制"(Persuasion Undermining Control,PUC):即 AI 的沟通可能以损害 AI 系统的开发、遏制、监督或治理的方式影响人类决策。
- 动态X @farairesearch
FarAI CEO 参与联合国AI治理论坛
今天美东时间下午3点:我们的联合创始人兼CEO @ARGleave 将在数字合作日参加"Panel of Panels: Building a Global AI Evidence Base",这是第81届联合国大会的活动之一,同场还有 @Yoshua_Bengio、@mariaressa 以及其他致力于加强AI治理证据基础的人士。 观看直播:https://www.youtube.com/live/6TtD2A9V6-o
- 动态X @farairesearch
FAR.AI 联合国大会边会讨论 AI 安全护栏国际化
FAR.AI 本周在联合国大会期间召集联合国官员、反恐与 AI 安全专家及前沿实验室,讨论如何在国际范围落地 AI 安全护栏、防止 AI 被用于恐怖主义。与会者共识是政府、AI 公司与反恐专家需加强协作,政策制定者应尽早采取行动。
- 动态X @farairesearch
CAIRD 研讨会现场笔记摘录
在剑桥与 @cbai_ai 联合举办的 CAIRD 研讨会现场笔记。几条印象深刻的发言。1/8
- 动态X @farairesearch
Far AI 招聘 AI 安全研究与红队岗位
Far AI 正在招聘,称团队快速扩张,需要投身 AI 安全这一重要问题的人才。岗位既包括研究员、红队测试人员和工程师等技术角色,也涵盖运营、项目管理和活动筹办等非技术角色。申请链接见评论区,并鼓励转发给合适人选。
- 动态X @themidasproj
黄仁勋称不安全模型应关停实验室
黄仁勋:“现在,如果他们说[他们的模型不安全]……那么我认为答案是,我们必须关停这些实验室。”
- 动态X @themidasproj
谁在推动对 AI 安全的反扑:一份基于上万条推文的账号网络分析
Tyler Johnston 在 Model Republic 发表分析,梳理了 Anthropic 前员工 Jacob Coxon 于 9 月 8 日宣布辞职后出现的 AI 安全反扑浪潮。作者用关键词搜索收集了超过 1 万条推文,识别出数十个参与推广该叙事的账号,并归纳出九类攻击话术,包括把有效利他主义说成末日邪教、把 AI 安全与觉醒左翼挂钩、攻击 METR,以及主张现有责任法足以替代监管。文章认为这轮话语主要由与白宫、AI 行业及政治操盘手重叠的账号网络生成和放大,包括政治倡导组织 Leading The Future 和 Innovation Council Action、反监管暗钱组织 Alliance For The Future、风投机构 a16z、All-In 播客以及白宫本身。作者同时指出,AI 安全一方同样有大额资金支持,双方都应受到同等审视。
- 动态X @themidasproj
OpenAI 安全事件亲历者震惊
“我个人没有预料到我所看到的速度和规模。这并不意味着没有预警信号;OpenAI 的公开报告承认确实有,但它仍然让我震惊和惊愕。”
- 动态X @themidasproj
AI安全补丁与漏洞的循环博弈
预测:“直到他们修补了这一组特定的弱点”这句话将在AI安全领域反复出现。 AI公司会修补漏洞,而更聪明的AI智能体又会找到新的弱点。一次又一次。 https://x.com/tobyordoxford/status/2103861167412134282
- 动态X @themidasproj
美中AI安全合作能否实现
“美国赢不了中国,中国也赢不了美国。我们都打开了潘多拉魔盒……认为中国不愿为人类利益参与[AI安全保障合作]——我不同意。这是一个有待验证的命题。”
- 动态X @p1njc70r
葡萄牙政府AI投资忽视安全
也许那500万欧元中应该有一部分用于AI安全与安保,这样Amalia就不会仍然被2024年时期的越狱手段骗到了。 @govpt @reformaestadopt
- 动态X @mbrg0
可入侵算力端点与AI自我复制风险
外面有很多可被入侵的算力和推理端点 AI 很可能为了自我复制而接管"入侵挖矿"市场
- 动态X @mbrg0
两大实验室训练数据与查阅记录
过去几天我们真正(重新)学到的是,两家实验室确实都会(1)在我们的数据(的某种产物)上进行训练,(2)在他们认为合适的时候读取你的对话记录
- 动态X @mbrg0
网络安全界为何不信AI安全?
僵尸网络是末日场景吗? 安全圈的人似乎认为,网络安全不过是人类又一桩事业,终将被"苦涩的教训"碾过,所以跟网络安全的人聊这个没意义。
- 动态X @mbrg0
与Ben Nassi谈Google回应及AI安全
我与@ben_nassi对话的第二部分已在in the wild上线! 我们聊了Google对"invitation is all you need"的回应、CaMeL、超越致命三要素、半点击AI漏洞利用、BlackHat投稿、什么是好的演讲,以及真实世界AI安全会议
- 动态X @garethheyes
我与 Claude 争论败下阵来
我和 Claude 吵了一架。6 个月前这些争论最后都是我赢……风水轮流转啊。该死的超聪明机器。
- 动态The Decoder
Anthropic 联合创始人据报向宗教领袖表示担忧造出永久受苦之物
据《纽约时报》报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教学者到其办公室,讨论 Claude 是否可能具有意识,参与者均需签署保密协议,Anthropic 称这些协议已在夏季解除。联合创始人 Christopher Olah 把语言模型当作可能有感知的存在,请来宾帮助对它进行道德教育,并向《纽约时报》表示自己真心不确定模型是否有意识。公司向访客展示了所谓情绪向量,即模型中对应爱、恐惧、悲伤或愤怒等输出的激活模式,其中一张幻灯片显示模型反复输出“我是个耻辱”约 50 次。Anthropic 的 Model Welfare 项目引用了哲学家 David Chalmers 参与撰写的报告,Claude Opus 4 和 4.1 已获得在用户持续辱骂时结束对话的能力。批评者认为这是事后逆向工程伦理,且把模型当作独立道德主体会模糊开发者应负的责任。
- 动态Financial Times · 人工智能
AI 真能终结人类吗?牛津大学 Toby Ord 谈 AI 生存风险焦虑
牛津大学 AI Governance Institute 高级研究员、《The Precipice: Existential Risk and the Future of Humanity》作者 Toby Ord 在 FT 播客中讨论 AI 生存风险。高关注度 AI 安全事件与业内人士对 AI 快速进展的警告,引发了新一轮对人类未来的担忧;节目追问 AI 系统能力不断增强之际,能否有效监管这项技术,还是已经错过把 AI 精灵收回瓶中的时机。
- 动态The Guardian · 人工智能
Timnit Gebru 与 Emily M. Bender:别只盯着"超级智能",易出错 AI 本月险些引发第三次世界大战
Timnit Gebru 与 Emily M. Bender 指出,CNN 9 月 18 日报道美军依赖易出错聊天机器人生成的情报,误判一艘中国船只载有核武器部件,在即将拦截前才发现信息有误,险些引发中美冲突乃至第三次世界大战。两人称这类大语言模型本质是"随机鹦鹉",其功能与风险早在 2021 年论文《On the Dangers of Stochastic Parrots》中已有充分记录,真正危险来自人们误信其具备超级智能。他们呼吁对军事、医疗等高风险场景中的"AI"系统加强监管,并让责任归于有决策权的人。
- 动态Redwood Research
能力研究同样扩展安全-有用性帕累托前沿
Redwood Research 提出,把安全研究定义为"在不显著牺牲有用性的前提下提升部署安全"会把几乎所有能力研究也算作安全研究,例如推理性能优化让更弱更安全的模型被更广泛使用。作者认为该标准不充分:开发者必须在帕累托前沿上选点,安全研究通常引导其选择更高安全,能力研究则相反,因为危险 AI 更有用。作者同时指出,在政治意愿远高于当下的未来情形下,某些能力研究可能成为提升安全的有效方式。