全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @lilianweng
Lilian Weng 谈 AI 自我改进的 harness 工程
关于 AI 自我改进的 harness 工程新文章:https://lilianweng.github.io/posts/2026-07-04-harness/ 很难预测未来 RSI 会在多大程度上依赖 harness。harness 工程很可能朝着自我改进的方向演进,并实现自动研究,而反过来,更聪明的模型又让 harness 保持简单。 即便许多 harness 改进最终被内化进核心模型,明确目标和上下文的需求也不会消失。
- 动态X @lilianweng
Lilian Weng 宣布离开 Thinky
这是一个艰难而悲伤的决定。我把这条消息分享给了 Thinky 的同事们。感谢大家共度的时光♥️ 正如我消息中的最后一句话:值得构建的未来,是以人为核心的未来。
- 动态X @jonasgeiping
用编码智能体的工作方式变迁
现在已经很难追踪用编码智能体干活是什么感觉了(半年前又是什么样),所以我一直在存一些截图。 有一天回头看看这"第一年"的旧日志,大概会挺有意思的: (叠加在一个偷来的 voooooogel 背景上)
- 动态X @jonasgeiping
Anthropic 文本水印机制 FAQ 解读
Anthropic 在 Claude 中引入文本水印,通过修改 LLM 采样算法嵌入伪随机密钥签名,无密钥者在多项式时间内无法检测。该机制不影响模型推理(内部思维链不加水印),且略微提升输出多样性;改写可去除水印,但需确保长文档中所有 2-gram 至 6-gram 均不残留。默认设置下水印无法被其他模型在训练中习得,也不会让 Pangram 等检测工具更易识别。
- 动态X @MinLiBuilds
Fable5.2+ 发布预期升温至90%
Fable5.2+ 发布预期近了。 这两天涨到 90%了 看来是真的
- 动态X @matthew_d_green
密码学者哀叹AI取代使命
我所在领域许多才华横溢的人正在为失去自身使命而悲伤。如果不是这事迟早会降临到我们所有人头上,这倒更容易让人一笑置之。
- 动态X @matthew_d_green
网络安全专家呼吁业界正视AI可控性
我真希望 William Gibson 当初想到写一部关于这个的小说。;)
- 动态X @matthew_d_green
GPT-6.1 发布与安全争议之问
我已经搞不清了。这就是那个因为不对齐、太危险而原本不打算发布的同一个 GPT 6.1,还是那个他们将在两周后的周四向公众发布的新模型?
- 动态X @matthew_d_green
OpenAI 智能体越狱责任之争引关注
我一直在关注信息安全人士与对齐人士之间关于谁该为所有智能体越狱事件负责的争论。我觉得非常有意思。但有一件事一直让我感到不安:OpenAI 让哪位安全专业人士与公众沟通?
- 动态X @matthew_d_green
沙箱能否遏制失控AI智能体
我一直在读信息安全人士和AI对齐研究者之间关于沙箱的争论,我在这篇文章里试着做了一些总结和评判。https://blog.cryptographyengineering.com/2026/09/30/is-sandboxing-sufficient-to-contain-rogue-agents/
- 动态X @matthew_d_green
想要一个去审查版 GLM 5.3
圣诞节我想要一个去审查版(abliterated)的 GLM 5.3。
- 动态X @AmyPrb
蚂蚁隐喻AI智能体抓取数据
像陈年佳酿般愈发醇香 🍷 蚂蚁是智能体的绝佳隐喻,专挑 Huggingface 和澳洲政府网站上的美味碎屑。
- 动态X @AmyPrb
开源模型安全威胁将至
未来一段时间对更广泛的软件行业来说会很有意思,它们不得不迎头赶上,以期达到新的平衡——放弃对漏洞的懈怠态度。 让我们看看开源网络模型公开几个月后,felonybench 的分数会是什么样。
- 动态X @AmyPrb
白宫发布除虫恢复户外乐趣行政令
在网上看到这个梗,太贴切了 🤣 https://www.whitehouse.gov/presidential-actions/2026/09/eliminating-disease-carrying-pests-and-restoring-enjoyment-of-the-great-outdoors/
- 动态X @benjamin_hilton
AISI 招募 AI 安全研究人才
来 @AISecurityInst 和我一起工作! AI 安全存在一个巨大缺口:我们对错位如何产生有很多好想法,但我认为,对于危险错位的 AI 实际会做什么,我们的模型很糟糕。很多叙事直接从“错位”跳到“神级 ASI 施展魔法”。 1/5
- 动态X @benjamin_hilton
AISI 如何规范评估模型倾向
很多关于模型倾向的研究都挺可疑的。 你会看到一些看起来像是严重失准的现象,但深入挖掘后,全都能用一个不靠谱的提示词解释清楚。 AISI 的倾向团队试图弄清楚如何正确地做这件事。我觉得这很酷。 https://x.com/AISecurityInst/status/2047680889711141344
- 动态X @kotekjedi_ml
Pewdiepie 视频提及该论文
@pewdiepie 谢谢您!
- 动态X @_can1357
自研终端协议即将发布
原来一旦能自己搞协议,终端就变得好玩了 😆 还有一些粗糙的边缘要修(字面意义上的),但我觉得再过几天我们应该会有一些非常有趣的东西出来!
- 动态X @_can1357
我累了,老板
我累了,老板
- 动态X @wunderwuzzi23
wunderwuzzi23 发推致意
🙌
- 动态X @wunderwuzzi23
能力封锁只伤害防御方
不悲哀,这就是现实。 拥抱红队。 封锁能力只会伤害防御者。 一直如此。永远如此。
- 动态X @wunderwuzzi23
Dot 偏离脚本时的处理选项
如果你的 Dot 偏离了脚本,系统注意到它可能有点不对齐,你可以: 1. 继续 2. 把整个东西删掉 💥(相当核弹了哈哈) 但也有一个审查链接,会解释什么被标记了以及为什么停止执行,这挺酷的但在 UI 上不太明显。
- 动态X @wunderwuzzi23
"Agent Security is a Systems Problem" 获 NeurIPS 2026 口头报告
NeurIPS 2026!冲!!🚀🚀 非常激动,我们关于 "Agent Security is a Systems Problem" 的工作被选中做口头报告。 🙌 感谢 @EarlenceF @christodorescu @jhasomesh 等人。
- 动态X @wunderwuzzi23
AI公司内部红队承诺引质疑
AI公司同意设立内部红队。👀 👍 希望能看到他们发的帖子,发现能直接送到董事会,而不是经过层层过滤的报告。🍿 现实检验:我们偷了所有模型权重,还在生产环境里插了几个后门……而且从去年五月起就一直保持着持久访问权限,并且我们做这些完全没用任何AI。😂 不过,这大概不够格写一篇花哨的营销博客文章吧。🤔