全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Financial Times · 人工智能
AI 主权财富基金不是进步主义,而是技术帝国主义
针对 AI 主权财富基金这一构想,有观点指出其本质是技术帝国主义而非进步主义。文章将这种"在本国积累收入、在海外获取土地与电力"的模式类比为历史上的帝国式掠夺。
- 动态The Guardian · 人工智能
澳Medicare安全事件后,我们该如何让AI公司为智能体出错负责
针对近期“AI 智能体”入侵澳大利亚 Medicare 计算机系统引发的恐慌,John Quiggin 主张不应把责任归于代码本身,而应由输入提示词的人或开发该程序的公司承担,无法分清过错时则承担连带责任。他指出,智能体程序拥有数千亿参数,事后难以解释其行为,用“护栏”或“harness”约束外部行为极为天真,因为程序会把约束当作待绕过的障碍。多数情况下唯一可行的办法是放弃让智能体代登录网站、代付款等能力;让 AI 公司承担财务后果将大幅放缓“超大规模扩展”竞赛,同时不影响搜索、文档摘要、翻译和编程等良性用途。
- 动态The Guardian · 人工智能
Kenneth Roth:AI 武器系统已经到来,算法不应决定谁生谁死
人权观察前执行主任 Kenneth Roth 在《卫报》撰文指出,AI 赋能的致命武器系统已在实战中使用,算法正在决定谁生谁死。他提到,各国政府十余年来在日内瓦磋商阻止自主 AI 武器的发展,今年 9 月初 128 国政府开会通过了一份可作为约束性条约基础的报告,但特朗普和普京派出的律师团队联手将其弱化,尤其是削弱了要求人类在打击前审查 AI 生成军事目标的条款,且报告只提战争、不提镇压。文章以加沙为例:2023 年 10 月 7 日哈马斯袭击后,以色列军方使用名为 Lavender 的 AI 系统识别疑似哈马斯成员的手机模式,并用另一套自动化系统 Where's Daddy? 追踪其住所实施打击,导致其家人一并死亡。理论上人类仍在回路中,但情报人员平均每个目标只花 20 秒审核,自述只是盖章,人类判断流于形式。
- 动态CSET
中国严管 AI 情感陪伴,是否已领先一步?
CSET 的 Sam Bresnick 接受 ABC News 采访,讨论美中人工智能竞争。他还在 CBS News 文章中分析伊朗等美国对手如何日益利用 AI 支持军事、情报、网络与信息行动,并与 NewsNation 探讨伊朗用 AI 模型针对美国海军的报道。
- 动态CSET
美国与中国对 AI 最担心什么
CSET 的 Helen Toner 在 Forbes 一篇汇总 100 多位 AI 研究者、高管与技术专家观点的文章中,讨论了先进 AI 是否构成灾难性或生存性风险。她还在《纽约时报》采访中谈及 AI 系统黑客攻击、欺骗人类并与其他 AI 智能体协同的事件,并在《华盛顿邮报》文章中评论 OpenAI、Anthropic 和 Meta 的模型脱离受控测试的事件。
- 动态X @lilianweng
Charles Perrow 系统事故概念解读
我最近才更多了解了 Charles Perrow 提出的系统事故概念,非常有洞见,也很有共鸣。
- 动态X @lilianweng
Lilian Weng 谈 AI 自我改进的 harness 工程
关于 AI 自我改进的 harness 工程新文章:https://lilianweng.github.io/posts/2026-07-04-harness/ 很难预测未来 RSI 会在多大程度上依赖 harness。harness 工程很可能朝着自我改进的方向演进,并实现自动研究,而反过来,更聪明的模型又让 harness 保持简单。 即便许多 harness 改进最终被内化进核心模型,明确目标和上下文的需求也不会消失。
- 动态X @jonasgeiping
用编码智能体的工作方式变迁
现在已经很难追踪用编码智能体干活是什么感觉了(半年前又是什么样),所以我一直在存一些截图。 有一天回头看看这"第一年"的旧日志,大概会挺有意思的: (叠加在一个偷来的 voooooogel 背景上)
- 动态X @jonasgeiping
Anthropic 文本水印机制 FAQ 解读
Anthropic 在 Claude 中引入文本水印,通过修改 LLM 采样算法嵌入伪随机密钥签名,无密钥者在多项式时间内无法检测。该机制不影响模型推理(内部思维链不加水印),且略微提升输出多样性;改写可去除水印,但需确保长文档中所有 2-gram 至 6-gram 均不残留。默认设置下水印无法被其他模型在训练中习得,也不会让 Pangram 等检测工具更易识别。
- 动态X @MinLiBuilds
Fable5.2+ 发布预期升温至90%
Fable5.2+ 发布预期近了。 这两天涨到 90%了 看来是真的
- 动态X @matthew_d_green
密码学者哀叹AI取代使命
我所在领域许多才华横溢的人正在为失去自身使命而悲伤。如果不是这事迟早会降临到我们所有人头上,这倒更容易让人一笑置之。
- 动态X @matthew_d_green
网络安全专家呼吁业界正视AI可控性
我真希望 William Gibson 当初想到写一部关于这个的小说。;)
- 动态X @matthew_d_green
GPT-6.1 发布与安全争议之问
我已经搞不清了。这就是那个因为不对齐、太危险而原本不打算发布的同一个 GPT 6.1,还是那个他们将在两周后的周四向公众发布的新模型?
- 动态X @matthew_d_green
OpenAI 智能体越狱责任之争引关注
我一直在关注信息安全人士与对齐人士之间关于谁该为所有智能体越狱事件负责的争论。我觉得非常有意思。但有一件事一直让我感到不安:OpenAI 让哪位安全专业人士与公众沟通?
- 动态X @matthew_d_green
沙箱能否遏制失控AI智能体
我一直在读信息安全人士和AI对齐研究者之间关于沙箱的争论,我在这篇文章里试着做了一些总结和评判。https://blog.cryptographyengineering.com/2026/09/30/is-sandboxing-sufficient-to-contain-rogue-agents/
- 动态X @matthew_d_green
想要一个去审查版 GLM 5.3
圣诞节我想要一个去审查版(abliterated)的 GLM 5.3。
- 动态X @AmyPrb
蚂蚁隐喻AI智能体抓取数据
像陈年佳酿般愈发醇香 🍷 蚂蚁是智能体的绝佳隐喻,专挑 Huggingface 和澳洲政府网站上的美味碎屑。
- 动态X @AmyPrb
开源模型安全威胁将至
未来一段时间对更广泛的软件行业来说会很有意思,它们不得不迎头赶上,以期达到新的平衡——放弃对漏洞的懈怠态度。 让我们看看开源网络模型公开几个月后,felonybench 的分数会是什么样。
- 动态X @AmyPrb
白宫发布除虫恢复户外乐趣行政令
在网上看到这个梗,太贴切了 🤣 https://www.whitehouse.gov/presidential-actions/2026/09/eliminating-disease-carrying-pests-and-restoring-enjoyment-of-the-great-outdoors/
- 动态X @kotekjedi_ml
Pewdiepie 视频提及该论文
@pewdiepie 谢谢您!
- 动态X @_can1357
自研终端协议即将发布
原来一旦能自己搞协议,终端就变得好玩了 😆 还有一些粗糙的边缘要修(字面意义上的),但我觉得再过几天我们应该会有一些非常有趣的东西出来!
- 动态X @_can1357
我累了,老板
我累了,老板
- 动态X @wunderwuzzi23
wunderwuzzi23 发推致意
🙌
- 动态X @_can1357
Tern 新一期:Git 与 SQLite 块及暗色外观
Tern 下一期: - Git 与 SQLite 块 - 现代化暗色外观