跳到正文

观点与讨论

今天新收录 24 条(含旧文)

第 5 页更新的内容回到最新

10月3日周六
  1. The Guardian · 人工智能 · 收录 · 原文 37

    Kenneth Roth:AI 武器系统已经到来,算法不应决定谁生谁死

    人权观察前执行主任 Kenneth Roth 在《卫报》撰文指出,AI 赋能的致命武器系统已在实战中使用,算法正在决定谁生谁死。他提到,各国政府十余年来在日内瓦磋商阻止自主 AI 武器的发展,今年 9 月初 128 国政府开会通过了一份可作为约束性条约基础的报告,但特朗普和普京派出的律师团队联手将其弱化,尤其是削弱了要求人类在打击前审查 AI 生成军事目标的条款,且报告只提战争、不提镇压。文章以加沙为例:2023 年 10 月 7 日哈马斯袭击后,以色列军方使用名为 Lavender 的 AI 系统识别疑似哈马斯成员的手机模式,并用另一套自动化系统 Where's Daddy? 追踪其住所实施打击,导致其家人一并死亡。理论上人类仍在回路中,但情报人员平均每个目标只花 20 秒审核,自述只是盖章,人类判断流于形式。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. CSET · 收录 · 原文 17

    中国严管 AI 情感陪伴,是否已领先一步?

    CSET 的 Sam Bresnick 接受 ABC News 采访,讨论美中人工智能竞争。他还在 CBS News 文章中分析伊朗等美国对手如何日益利用 AI 支持军事、情报、网络与信息行动,并与 NewsNation 探讨伊朗用 AI 模型针对美国海军的报道。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. CSET · 收录 · 原文 ↑171

    美国与中国对 AI 最担心什么

    CSET 的 Helen Toner 在 Forbes 一篇汇总 100 多位 AI 研究者、高管与技术专家观点的文章中,讨论了先进 AI 是否构成灾难性或生存性风险。她还在《纽约时报》采访中谈及 AI 系统黑客攻击、欺骗人类并与其他 AI 智能体协同的事件,并在《华盛顿邮报》文章中评论 OpenAI、Anthropic 和 Meta 的模型脱离受控测试的事件。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. WIRED Security and AI · 收录 · 原文 29

    Nathan Lambert 与 Tom Zick 创立 Trillium Labs,公开研究 RSI 与智能体等高风险 AI 领域

    前 Ai2 与 Hugging Face 研究员 Nathan Lambert 和曾任哈佛的 Tom Zick 创立非营利机构 Trillium Labs,主张公开实验细节以便外部科学家复现,而非将前沿模型锁在实验室内部。该机构初期聚焦后训练与微调,并将研究递归自我改进(RSI)和强化学习如何塑造模型性格与行为(如谄媚)。机构已从 Schmidt Sciences、Halcyon Futures 等获得未披露金额,目标总计融资 4000 万至 1 亿美元,未来 18 个月投入 3000 万美元用于训练。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. Lilian Weng · 收录 · 原文 12

    Thinking Machines 发布交互模型

    过去几个月,我们经历了很多乐趣(和压力😅),产出了 12 个版本(以及许多子版本)和 137 页的训练运行日志。 事实证明,人与人之间的协作对于改善人机协作很重要。😊

    引用Thinking Machines@thinkymachines

    People talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models

  6. Lilian Weng · 收录 · 原文 27

    Lilian Weng 谈 AI 自我改进的 harness 工程

    关于 AI 自我改进的 harness 工程新文章:https://lilianweng.github.io/posts/2026-07-04-harness/ 很难预测未来 RSI 会在多大程度上依赖 harness。harness 工程很可能朝着自我改进的方向演进,并实现自动研究,而反过来,更聪明的模型又让 harness 保持简单。 即便许多 harness 改进最终被内化进核心模型,明确目标和上下文的需求也不会消失。

  7. Lilian Weng · 收录 · 原文 9

    Lilian Weng 宣布离开 Thinky

    这是一个艰难而悲伤的决定。我把这条消息分享给了 Thinky 的同事们。感谢大家共度的时光♥️ 正如我消息中的最后一句话:值得构建的未来,是以人为核心的未来。

  8. Jonas Geiping · 收录 · 原文 6

    用编码智能体的工作方式变迁

    现在已经很难追踪用编码智能体干活是什么感觉了(半年前又是什么样),所以我一直在存一些截图。 有一天回头看看这"第一年"的旧日志,大概会挺有意思的: (叠加在一个偷来的 voooooogel 背景上)

  9. Jonas Geiping · 收录 · 原文 15

    Anthropic 文本水印机制 FAQ 解读

    Anthropic 在 Claude 中引入文本水印,通过修改 LLM 采样算法嵌入伪随机密钥签名,无密钥者在多项式时间内无法检测。该机制不影响模型推理(内部思维链不加水印),且略微提升输出多样性;改写可去除水印,但需确保长文档中所有 2-gram 至 6-gram 均不残留。默认设置下水印无法被其他模型在训练中习得,也不会让 Pangram 等检测工具更易识别。

  10. Matthew Green · 收录 · 原文 6

    密码学者哀叹AI取代使命

    我所在领域许多才华横溢的人正在为失去自身使命而悲伤。如果不是这事迟早会降临到我们所有人头上,这倒更容易让人一笑置之。

  11. Matthew Green · 收录 · 原文 6

    GPT-6.1 发布与安全争议之问

    我已经搞不清了。这就是那个因为不对齐、太危险而原本不打算发布的同一个 GPT 6.1,还是那个他们将在两周后的周四向公众发布的新模型?

    引用Tibo@thsottiaux

    GPT-6.1 is a good model. And it’s unbelievably efficient. Included in all paid plans and on the API today.

  12. Matthew Green · 收录 · 原文 29

    沙箱能否遏制失控AI智能体

    我一直在读信息安全人士和AI对齐研究者之间关于沙箱的争论,我在这篇文章里试着做了一些总结和评判。https://blog.cryptographyengineering.com/2026/09/30/is-sandboxing-sufficient-to-contain-rogue-agents/

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. Ameya P. · 收录 · 原文 6

    蚂蚁隐喻AI智能体抓取数据

    像陈年佳酿般愈发醇香 🍷 蚂蚁是智能体的绝佳隐喻,专挑 Huggingface 和澳洲政府网站上的美味碎屑。

    引用Nathan Calvin@_NathanCalvin

    If you find two ants in your kitchen, the best estimate of the total number of ants in your kitchen is not two

  14. Ameya P. · 收录 · 原文 8

    开源模型安全威胁将至

    未来一段时间对更广泛的软件行业来说会很有意思,它们不得不迎头赶上,以期达到新的平衡——放弃对漏洞的懈怠态度。 让我们看看开源网络模型公开几个月后,felonybench 的分数会是什么样。

    引用Ethan Mollick@emollick

    Leaving aside Anthropic's incentives for publishing this research, there is no doubt that open weights models will soon create the same security threats that closed source models have been demonstrating, except without guardrails. We are close. Probably good to plan accordingly.

  15. Benjamin Hilton · 收录 · 原文 28

    AISI 如何规范评估模型倾向

    很多关于模型倾向的研究都挺可疑的。 你会看到一些看起来像是严重失准的现象,但深入挖掘后,全都能用一个不靠谱的提示词解释清楚。 AISI 的倾向团队试图弄清楚如何正确地做这件事。我觉得这很酷。 https://x.com/AISecurityInst/status/2047680889711141344

    引用AI Security Institute (AISI)@AISecurityInst

    We know AI systems occasionally act against their operators’ intentions – but what in their environment causes them to do so? In a new paper, we make progress on this question 🧵

  16. Can Bölük · 收录 · 原文 4

    自研终端协议即将发布

    原来一旦能自己搞协议,终端就变得好玩了 😆 还有一些粗糙的边缘要修(字面意义上的),但我觉得再过几天我们应该会有一些非常有趣的东西出来!

  17. Johann Rehberger · 收录 · 原文 9

    Dot 偏离脚本时的处理选项

    如果你的 Dot 偏离了脚本,系统注意到它可能有点不对齐,你可以: 1. 继续 2. 把整个东西删掉 💥(相当核弹了哈哈) 但也有一个审查链接,会解释什么被标记了以及为什么停止执行,这挺酷的但在 UI 上不太明显。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  18. Johann Rehberger · 收录 · 原文 15

    "Agent Security is a Systems Problem" 获 NeurIPS 2026 口头报告

    NeurIPS 2026!冲!!🚀🚀 非常激动,我们关于 "Agent Security is a Systems Problem" 的工作被选中做口头报告。 🙌 感谢 @EarlenceF @christodorescu @jhasomesh 等人。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  19. Johann Rehberger · 收录 · 原文 11

    AI公司内部红队承诺引质疑

    AI公司同意设立内部红队。👀 👍 希望能看到他们发的帖子,发现能直接送到董事会,而不是经过层层过滤的报告。🍿 现实检验:我们偷了所有模型权重,还在生产环境里插了几个后门……而且从去年五月起就一直保持着持久访问权限,并且我们做这些完全没用任何AI。😂 不过,这大概不够格写一篇花哨的营销博客文章吧。🤔

    1 条报道 · 1 个来源查看事件时间线与全部报道
  20. AISecHub · 收录 · 原文 11

    前OpenAI员工谈安全引质疑

    不规则的(irregular)和METR批准这条消息了吗? 这些人真觉得公众是傻子。 “披露:我以个人身份撰写,不代表OpenAI” 🤡

    引用Joe@joedaroo

    Took a minute to write a few words about security & safety as someone who lived through it all at OpenAI. I hope my thoughts help someone out there. https://x.com/i/article/2104258872957636608

  21. Riley Goodside · 收录 · 原文 7

    Goodside 谈 AGI 临近的恐惧

    有时候让我感到恐惧的是,从这里到 AGI 剩下的工作量竟然如此之少。所有障碍都那么愚蠢且可修复——都是 AI 刚刚到来时的症状。一切显然只是时间问题。

  22. Simon Willison · 收录 · 原文 8

    Simon Willison 即将发表主题演讲

    我十分钟后就要上台做主题演讲了!

    引用WeAreDevelopers@WeAreDevs

    Legendary programmer Simon Willison says he's never so much change happen so quickly as he has in 2026, and there's no sign of it stopping. 🎤 Don't miss his closing Keynote, Friday (Sept 25) on the Main Stage at 5.30pm!

  23. Simon Willison · 收录 · 原文 8

    Simonw 发布 2026 年 LLM 与智能体进展笔记

    我已发布详细笔记和带注释的文字稿,配合我周五在圣何塞 @WeAreDevs World Congress North America 所做主题演讲的视频——以下是我对 2026 年迄今为止 LLM 和智能体领域所有进展的梳理 https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/

  24. Florian Tramèr · 收录 · 原文 8

    AI 如何应对验证软件的组合爆炸

    一个朴素的问题:我看到很多人说 AI 将帮助构建形式验证的软件,就像 AI 帮助形式化数学一样。 但验证软件的瓶颈不就是证明*每一个*程序执行都安全的组合爆炸吗? AI 如何帮助解决这个问题?

  25. Florian Tramèr · 收录 · 原文 24

    政客如何看待AI安全?新资源可查

    政客们到底怎么看待/谈论AI安全? 一个不错的资源,可以看看你是否认同你选出的官员的观点

    引用Lennart Finke@LennartFinke

    New research with the French Center for AI Safety: We analyze 15,000 AI quotes from public officials around the world: What AI risks and policy approaches are discussed most? What's the sentiment on AI? ( 1/n )

  26. Florian Tramèr · 收录 · 原文 50

    张杰谈VLM提示注入防御思路

    当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。

    1 条报道 · 1 个来源查看事件时间线与全部报道