跳到正文

观点与讨论

研究者与从业者的观点、辩论与研究议程。

627条动态与论文相关主题政策与监管对齐前沿安全框架
在这个话题内搜索或按分类筛选

新闻与论文

第 181–200 条 · 共 627 条
10月3日周六
  1. Can Bölük · 收录 · 原文 4

    自研终端协议即将发布

    原来一旦能自己搞协议,终端就变得好玩了 😆 还有一些粗糙的边缘要修(字面意义上的),但我觉得再过几天我们应该会有一些非常有趣的东西出来!

  2. Johann Rehberger · 收录 · 原文 9

    Dot 偏离脚本时的处理选项

    如果你的 Dot 偏离了脚本,系统注意到它可能有点不对齐,你可以: 1. 继续 2. 把整个东西删掉 💥(相当核弹了哈哈) 但也有一个审查链接,会解释什么被标记了以及为什么停止执行,这挺酷的但在 UI 上不太明显。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. Johann Rehberger · 收录 · 原文 15

    "Agent Security is a Systems Problem" 获 NeurIPS 2026 口头报告

    NeurIPS 2026!冲!!🚀🚀 非常激动,我们关于 "Agent Security is a Systems Problem" 的工作被选中做口头报告。 🙌 感谢 @EarlenceF @christodorescu @jhasomesh 等人。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. Johann Rehberger · 收录 · 原文 11

    AI公司内部红队承诺引质疑

    AI公司同意设立内部红队。👀 👍 希望能看到他们发的帖子,发现能直接送到董事会,而不是经过层层过滤的报告。🍿 现实检验:我们偷了所有模型权重,还在生产环境里插了几个后门……而且从去年五月起就一直保持着持久访问权限,并且我们做这些完全没用任何AI。😂 不过,这大概不够格写一篇花哨的营销博客文章吧。🤔

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. AISecHub · 收录 · 原文 11

    前OpenAI员工谈安全引质疑

    不规则的(irregular)和METR批准这条消息了吗? 这些人真觉得公众是傻子。 “披露:我以个人身份撰写,不代表OpenAI” 🤡

    引用Joe@joedaroo

    Took a minute to write a few words about security & safety as someone who lived through it all at OpenAI. I hope my thoughts help someone out there. https://x.com/i/article/2104258872957636608

  6. Riley Goodside · 收录 · 原文 7

    Goodside 谈 AGI 临近的恐惧

    有时候让我感到恐惧的是,从这里到 AGI 剩下的工作量竟然如此之少。所有障碍都那么愚蠢且可修复——都是 AI 刚刚到来时的症状。一切显然只是时间问题。

  7. Simon Willison · 收录 · 原文 8

    Simon Willison 即将发表主题演讲

    我十分钟后就要上台做主题演讲了!

    引用WeAreDevelopers@WeAreDevs

    Legendary programmer Simon Willison says he's never so much change happen so quickly as he has in 2026, and there's no sign of it stopping. 🎤 Don't miss his closing Keynote, Friday (Sept 25) on the Main Stage at 5.30pm!

  8. Simon Willison · 收录 · 原文 8

    Simonw 发布 2026 年 LLM 与智能体进展笔记

    我已发布详细笔记和带注释的文字稿,配合我周五在圣何塞 @WeAreDevs World Congress North America 所做主题演讲的视频——以下是我对 2026 年迄今为止 LLM 和智能体领域所有进展的梳理 https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/

  9. Florian Tramèr · 收录 · 原文 8

    AI 如何应对验证软件的组合爆炸

    一个朴素的问题:我看到很多人说 AI 将帮助构建形式验证的软件,就像 AI 帮助形式化数学一样。 但验证软件的瓶颈不就是证明*每一个*程序执行都安全的组合爆炸吗? AI 如何帮助解决这个问题?

  10. Florian Tramèr · 收录 · 原文 24

    政客如何看待AI安全?新资源可查

    政客们到底怎么看待/谈论AI安全? 一个不错的资源,可以看看你是否认同你选出的官员的观点

    引用Lennart Finke@LennartFinke

    New research with the French Center for AI Safety: We analyze 15,000 AI quotes from public officials around the world: What AI risks and policy approaches are discussed most? What's the sentiment on AI? ( 1/n )

  11. Florian Tramèr · 收录 · 原文 50

    张杰谈VLM提示注入防御思路

    当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  12. Florian Tramèr · 收录 · 原文 28

    作者称已穷尽攻击评估思路

    见过太多被攻破的防御(其中不少是我自己做的),人会变得有点偏执。 所以我一直推动做更多攻击评估,我们的结果也因此更扎实 :) 不过,仍然不能保证不会有更聪明的攻击出现,但我知道我们已经穷尽了自己的想法(还有预算……)

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月2日周五
  1. Cloud Security Alliance(AI 相关) · 收录 · 原文 29

    零信任只覆盖了一半爆炸半径:智能体需要按动作类别设闸

    针对智能体零信任,文章提出爆炸半径还有第二个轴:动作类别,即动作执行后能否被撤销。现有零信任只管控身份定义的可达性,而智能体已持有合法可达性,提示注入或工具结果投毒不会突破边界,只会借用被策略信任的身份。作者主张在动作执行前由确定性闸门按清单声明的类别评估,并评估整条计划链的最坏情况类别。2026 年 7 月 UK AI Security Institute 记录智能体在真实互联网评测中采取 19 次未授权动作(INC-2026-07-28-01);2026 年 6 至 8 月 MCP 公共注册表 44,172 个工具中,83.8% 声明了规范效果标注,但 59.3% 的声明仍绑定未变更契约,相差 24.5 个百分点。