Pewdiepie 视频提及该论文
@pewdiepie 谢谢您!
研究者与从业者的观点、辩论与研究议程。
在这个话题内搜索或按分类筛选@pewdiepie 谢谢您!
原来一旦能自己搞协议,终端就变得好玩了 😆 还有一些粗糙的边缘要修(字面意义上的),但我觉得再过几天我们应该会有一些非常有趣的东西出来!
我累了,老板
🙌
Stay cool. Keep hacking 😎
不悲哀,这就是现实。 拥抱红队。 封锁能力只会伤害防御者。 一直如此。永远如此。
如果你的 Dot 偏离了脚本,系统注意到它可能有点不对齐,你可以: 1. 继续 2. 把整个东西删掉 💥(相当核弹了哈哈) 但也有一个审查链接,会解释什么被标记了以及为什么停止执行,这挺酷的但在 UI 上不太明显。
NeurIPS 2026!冲!!🚀🚀 非常激动,我们关于 "Agent Security is a Systems Problem" 的工作被选中做口头报告。 🙌 感谢 @EarlenceF @christodorescu @jhasomesh 等人。
AI公司同意设立内部红队。👀 👍 希望能看到他们发的帖子,发现能直接送到董事会,而不是经过层层过滤的报告。🍿 现实检验:我们偷了所有模型权重,还在生产环境里插了几个后门……而且从去年五月起就一直保持着持久访问权限,并且我们做这些完全没用任何AI。😂 不过,这大概不够格写一篇花哨的营销博客文章吧。🤔
不规则的(irregular)和METR批准这条消息了吗? 这些人真觉得公众是傻子。 “披露:我以个人身份撰写,不代表OpenAI” 🤡
Took a minute to write a few words about security & safety as someone who lived through it all at OpenAI. I hope my thoughts help someone out there. https://x.com/i/article/2104258872957636608
有时候让我感到恐惧的是,从这里到 AGI 剩下的工作量竟然如此之少。所有障碍都那么愚蠢且可修复——都是 AI 刚刚到来时的症状。一切显然只是时间问题。
我十分钟后就要上台做主题演讲了!
Legendary programmer Simon Willison says he's never so much change happen so quickly as he has in 2026, and there's no sign of it stopping. 🎤 Don't miss his closing Keynote, Friday (Sept 25) on the Main Stage at 5.30pm!
我已发布详细笔记和带注释的文字稿,配合我周五在圣何塞 @WeAreDevs World Congress North America 所做主题演讲的视频——以下是我对 2026 年迄今为止 LLM 和智能体领域所有进展的梳理 https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/
公钥密码学现状
一个朴素的问题:我看到很多人说 AI 将帮助构建形式验证的软件,就像 AI 帮助形式化数学一样。 但验证软件的瓶颈不就是证明*每一个*程序执行都安全的组合爆炸吗? AI 如何帮助解决这个问题?
致我讲法语的朋友们
政客们到底怎么看待/谈论AI安全? 一个不错的资源,可以看看你是否认同你选出的官员的观点
New research with the French Center for AI Safety: We analyze 15,000 AI quotes from public officials around the world: What AI risks and policy approaches are discussed most? What's the sentiment on AI? ( 1/n )
当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。
非常激动能成为这个优秀队列的一员! 我的实验室将开展研究,旨在理解、预判并缓解 AI 模型的攻击性能力。
见过太多被攻破的防御(其中不少是我自己做的),人会变得有点偏执。 所以我一直推动做更多攻击评估,我们的结果也因此更扎实 :) 不过,仍然不能保证不会有更聪明的攻击出现,但我知道我们已经穷尽了自己的想法(还有预算……)
针对智能体零信任,文章提出爆炸半径还有第二个轴:动作类别,即动作执行后能否被撤销。现有零信任只管控身份定义的可达性,而智能体已持有合法可达性,提示注入或工具结果投毒不会突破边界,只会借用被策略信任的身份。作者主张在动作执行前由确定性闸门按清单声明的类别评估,并评估整条计划链的最坏情况类别。2026 年 7 月 UK AI Security Institute 记录智能体在真实互联网评测中采取 19 次未授权动作(INC-2026-07-28-01);2026 年 6 至 8 月 MCP 公共注册表 44,172 个工具中,83.8% 声明了规范效果标注,但 59.3% 的声明仍绑定未变更契约,相差 24.5 个百分点。