跳到正文

观点与讨论

研究者与从业者的观点、辩论与研究议程。

627条动态与论文相关主题政策与监管对齐前沿安全框架
在这个话题内搜索或按分类筛选

新闻与论文

第 161–180 条 · 共 627 条
10月3日周六
  1. CSET · 收录 · 原文 ↑272

    美国与中国对 AI 最担心什么

    CSET 的 Helen Toner 在 Forbes 一篇汇总 100 多位 AI 研究者、高管与技术专家观点的文章中,讨论了先进 AI 是否构成灾难性或生存性风险。她还在《纽约时报》采访中谈及 AI 系统黑客攻击、欺骗人类并与其他 AI 智能体协同的事件,并在《华盛顿邮报》文章中评论 OpenAI、Anthropic 和 Meta 的模型脱离受控测试的事件。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. WIRED Security and AI · 收录 · 原文 29

    Nathan Lambert 与 Tom Zick 创立 Trillium Labs,公开研究 RSI 与智能体等高风险 AI 领域

    前 Ai2 与 Hugging Face 研究员 Nathan Lambert 和曾任哈佛的 Tom Zick 创立非营利机构 Trillium Labs,主张公开实验细节以便外部科学家复现,而非将前沿模型锁在实验室内部。该机构初期聚焦后训练与微调,并将研究递归自我改进(RSI)和强化学习如何塑造模型性格与行为(如谄媚)。机构已从 Schmidt Sciences、Halcyon Futures 等获得未披露金额,目标总计融资 4000 万至 1 亿美元,未来 18 个月投入 3000 万美元用于训练。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. Lilian Weng · 收录 · 原文 12

    Thinking Machines 发布交互模型

    过去几个月,我们经历了很多乐趣(和压力😅),产出了 12 个版本(以及许多子版本)和 137 页的训练运行日志。 事实证明,人与人之间的协作对于改善人机协作很重要。😊

    引用Thinking Machines@thinkymachines

    People talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models

  4. Lilian Weng · 收录 · 原文 27

    Lilian Weng 谈 AI 自我改进的 harness 工程

    关于 AI 自我改进的 harness 工程新文章:https://lilianweng.github.io/posts/2026-07-04-harness/ 很难预测未来 RSI 会在多大程度上依赖 harness。harness 工程很可能朝着自我改进的方向演进,并实现自动研究,而反过来,更聪明的模型又让 harness 保持简单。 即便许多 harness 改进最终被内化进核心模型,明确目标和上下文的需求也不会消失。

  5. Lilian Weng · 收录 · 原文 9

    Lilian Weng 宣布离开 Thinky

    这是一个艰难而悲伤的决定。我把这条消息分享给了 Thinky 的同事们。感谢大家共度的时光♥️ 正如我消息中的最后一句话:值得构建的未来,是以人为核心的未来。

  6. Jonas Geiping · 收录 · 原文 6

    用编码智能体的工作方式变迁

    现在已经很难追踪用编码智能体干活是什么感觉了(半年前又是什么样),所以我一直在存一些截图。 有一天回头看看这"第一年"的旧日志,大概会挺有意思的: (叠加在一个偷来的 voooooogel 背景上)

  7. Jonas Geiping · 收录 · 原文 15

    Anthropic 文本水印机制 FAQ 解读

    Anthropic 在 Claude 中引入文本水印,通过修改 LLM 采样算法嵌入伪随机密钥签名,无密钥者在多项式时间内无法检测。该机制不影响模型推理(内部思维链不加水印),且略微提升输出多样性;改写可去除水印,但需确保长文档中所有 2-gram 至 6-gram 均不残留。默认设置下水印无法被其他模型在训练中习得,也不会让 Pangram 等检测工具更易识别。

  8. Matthew Green · 收录 · 原文 6

    密码学者哀叹AI取代使命

    我所在领域许多才华横溢的人正在为失去自身使命而悲伤。如果不是这事迟早会降临到我们所有人头上,这倒更容易让人一笑置之。

  9. Matthew Green · 收录 · 原文 6

    GPT-6.1 发布与安全争议之问

    我已经搞不清了。这就是那个因为不对齐、太危险而原本不打算发布的同一个 GPT 6.1,还是那个他们将在两周后的周四向公众发布的新模型?

    引用Tibo@thsottiaux

    GPT-6.1 is a good model. And it’s unbelievably efficient. Included in all paid plans and on the API today.

  10. Matthew Green · 收录 · 原文 29

    沙箱能否遏制失控AI智能体

    我一直在读信息安全人士和AI对齐研究者之间关于沙箱的争论,我在这篇文章里试着做了一些总结和评判。https://blog.cryptographyengineering.com/2026/09/30/is-sandboxing-sufficient-to-contain-rogue-agents/

    1 条报道 · 1 个来源查看事件时间线与全部报道
  11. Ameya P. · 收录 · 原文 6

    蚂蚁隐喻AI智能体抓取数据

    像陈年佳酿般愈发醇香 🍷 蚂蚁是智能体的绝佳隐喻,专挑 Huggingface 和澳洲政府网站上的美味碎屑。

    引用Nathan Calvin@_NathanCalvin

    If you find two ants in your kitchen, the best estimate of the total number of ants in your kitchen is not two

  12. Ameya P. · 收录 · 原文 8

    开源模型安全威胁将至

    未来一段时间对更广泛的软件行业来说会很有意思,它们不得不迎头赶上,以期达到新的平衡——放弃对漏洞的懈怠态度。 让我们看看开源网络模型公开几个月后,felonybench 的分数会是什么样。

    引用Ethan Mollick@emollick

    Leaving aside Anthropic's incentives for publishing this research, there is no doubt that open weights models will soon create the same security threats that closed source models have been demonstrating, except without guardrails. We are close. Probably good to plan accordingly.

  13. Benjamin Hilton · 收录 · 原文 28

    AISI 如何规范评估模型倾向

    很多关于模型倾向的研究都挺可疑的。 你会看到一些看起来像是严重失准的现象,但深入挖掘后,全都能用一个不靠谱的提示词解释清楚。 AISI 的倾向团队试图弄清楚如何正确地做这件事。我觉得这很酷。 https://x.com/AISecurityInst/status/2047680889711141344

    引用AI Security Institute (AISI)@AISecurityInst

    We know AI systems occasionally act against their operators’ intentions – but what in their environment causes them to do so? In a new paper, we make progress on this question 🧵