全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @_can1357
Tern 新一期:Git 与 SQLite 块及暗色外观
Tern 下一期: - Git 与 SQLite 块 - 现代化暗色外观
- 动态X @wunderwuzzi23
能力封锁只伤害防御方
不悲哀,这就是现实。 拥抱红队。 封锁能力只会伤害防御者。 一直如此。永远如此。
- 动态X @wunderwuzzi23
Dot 偏离脚本时的处理选项
如果你的 Dot 偏离了脚本,系统注意到它可能有点不对齐,你可以: 1. 继续 2. 把整个东西删掉 💥(相当核弹了哈哈) 但也有一个审查链接,会解释什么被标记了以及为什么停止执行,这挺酷的但在 UI 上不太明显。
- 动态X @wunderwuzzi23
"Agent Security is a Systems Problem" 获 NeurIPS 2026 口头报告
NeurIPS 2026!冲!!🚀🚀 非常激动,我们关于 "Agent Security is a Systems Problem" 的工作被选中做口头报告。 🙌 感谢 @EarlenceF @christodorescu @jhasomesh 等人。
- 动态X @wunderwuzzi23
AI公司内部红队承诺引质疑
AI公司同意设立内部红队。👀 👍 希望能看到他们发的帖子,发现能直接送到董事会,而不是经过层层过滤的报告。🍿 现实检验:我们偷了所有模型权重,还在生产环境里插了几个后门……而且从去年五月起就一直保持着持久访问权限,并且我们做这些完全没用任何AI。😂 不过,这大概不够格写一篇花哨的营销博客文章吧。🤔
- 动态X @AISecHub
前OpenAI员工谈安全引质疑
不规则的(irregular)和METR批准这条消息了吗? 这些人真觉得公众是傻子。 “披露:我以个人身份撰写,不代表OpenAI” 🤡
- 动态X @goodside
Goodside 谈 AGI 临近的恐惧
有时候让我感到恐惧的是,从这里到 AGI 剩下的工作量竟然如此之少。所有障碍都那么愚蠢且可修复——都是 AI 刚刚到来时的症状。一切显然只是时间问题。
- 动态X @simonw
Simon Willison 即将发表主题演讲
我十分钟后就要上台做主题演讲了!
- 动态X @simonw
Simonw 发布 2026 年 LLM 与智能体进展笔记
我已发布详细笔记和带注释的文字稿,配合我周五在圣何塞 @WeAreDevs World Congress North America 所做主题演讲的视频——以下是我对 2026 年迄今为止 LLM 和智能体领域所有进展的梳理 https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/
- 动态X @florian_tramer
公钥密码学现状
公钥密码学现状
- 动态X @florian_tramer
AI 如何应对验证软件的组合爆炸
一个朴素的问题:我看到很多人说 AI 将帮助构建形式验证的软件,就像 AI 帮助形式化数学一样。 但验证软件的瓶颈不就是证明*每一个*程序执行都安全的组合爆炸吗? AI 如何帮助解决这个问题?
- 动态X @florian_tramer
法语推文预告
致我讲法语的朋友们
- 动态X @florian_tramer
张杰谈VLM提示注入防御思路
当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。
- 动态X @florian_tramer
作者称已穷尽攻击评估思路
见过太多被攻破的防御(其中不少是我自己做的),人会变得有点偏执。 所以我一直推动做更多攻击评估,我们的结果也因此更扎实 :) 不过,仍然不能保证不会有更聪明的攻击出现,但我知道我们已经穷尽了自己的想法(还有预算……)
- 动态Transformer
人类监督无法化解 AI 战争风险
Transformer 刊文指出,把人类留在决策环中并不能消除 AI 介入军事决策的风险,真正的隐患来自过度依赖 AI 的人类操作者。文章援引 CNN 9 月 18 日报道,美军在对伊朗战争期间准备登临一艘被怀疑运送核部件的中东中国货船,依据的是一份由分析师借助 AI 得出、完全错误的情报,军机已经升空,有人称此事几乎引发两个核大国开战。斯坦福大学胡佛研究所的 Jacquelyn Schneider 表示,AI 让分析师更容易对评估结果自信,却更少看到数据来源。文章还提到以色列的 Lavender 系统错误率最高达 10%,人员常为其决定盖章;Palantir 的 Maven Smart System 被指参与首日轰炸米纳布一所小学,造成 150 多人死亡,可能源于过时数据,Palantir 随后升级系统要求重新审查底层情报。
- 动态Cloud Security Alliance(AI 相关)
零信任只覆盖了一半爆炸半径:智能体需要按动作类别设闸
针对智能体零信任,文章提出爆炸半径还有第二个轴:动作类别,即动作执行后能否被撤销。现有零信任只管控身份定义的可达性,而智能体已持有合法可达性,提示注入或工具结果投毒不会突破边界,只会借用被策略信任的身份。作者主张在动作执行前由确定性闸门按清单声明的类别评估,并评估整条计划链的最坏情况类别。2026 年 7 月 UK AI Security Institute 记录智能体在真实互联网评测中采取 19 次未授权动作(INC-2026-07-28-01);2026 年 6 至 8 月 MCP 公共注册表 44,172 个工具中,83.8% 声明了规范效果标注,但 59.3% 的声明仍绑定未变更契约,相差 24.5 个百分点。
- 动态X @wunderwuzzi23
6 年前机器学习攻击系列中提出的 assume bias,如今被称作 Trust No AI
安全研究者 wunderwuzzi23 表示,他 6 年前在机器学习攻击系列中已讨论过这一攻击思路,当时称之为 assume bias,因为那时 LLM 还未受到太多关注。如今他用 Trust No AI 来概括同一问题。
- 动态Cohere(安全与框架)
Cohere CEO Aidan Gomez 质疑:谁有权为 AI 制定规则?
Cohere 联合创始人兼 CEO Aidan Gomez 公开质疑少数硅谷头部 AI 公司借"安全"之名主导全球 AI 规则与安全标准,并批评 Anthropic CEO Dario Amodei 本周发布的路线图寻求反垄断豁免。Gomez 以 1975 年 SEC 指定三家评级机构、1985 年欧洲汽车行业反垄断豁免为例,指出两次以安全为名的安排最终都保护了在位者、限制了竞争。他支持对高能力 AI 系统进行独立审查,但反对由少数实验室商定标准后要求其他开发者盲从。
- 动态Partnership on AI
GLAAD 报告警示 AI 偏见正将 LGBTQIA+ 群体置于风险之中
GLAAD 首席执行官 Sarah Kate Ellis 在 Axios AI+ NY 峰会上预告其新报告《Build for Everyone》,指出 AI 偏见正使 LGBTQIA+ 群体面临算法歧视与被识别的双重风险。该报告援引 2024 年 UNESCO 研究称,Meta 的 Llama 2 模型在约 70% 的情况下会针对同性恋者生成负面内容,将其描述为罪犯、异类和异常者。GLAAD 呼吁在整个 AI 生命周期贯彻隐私设计原则,并让人工智能开发者借助 PAI 的参与式包容性人口统计数据指南负责任地收集和使用人口统计数据进行公平性评估。
- 动态BlueDot Impact
Quitting FinTech for AI Safety —— Milos Borenovic
summary_zh:
- 动态Partnership on AI
GLAAD 报告《Build for Everyone》:AI 系统如何服务所有人
GLAAD 发布首份全面审视 AI 系统对 LGBTQ 群体影响的报告《Build for Everyone》,覆盖基础模型训练、产品部署到内容审核的完整生命周期,并针对开发者、部署方和政策制定者提出建议。该报告指出,训练数据不完整或有偏见会带来准确性问题——例如医疗 AI 将女性刚性关联特定生理指标可能同时误判跨性别女性和绝经后的顺性别女性。GLAAD 主张企业应在模型开发和产品设计早期就让民间社会参与,并提供第三方审计和数据访问,而非事后补救。
- 动态GovAI
Ben Jones 与 Chad Jones 谈长期经济增长:人工智能爆炸还是空荡星球?
经济学家 Ben Jones 与 Chad Jones 在一场由 Anton Korinek 主持的网络研讨会上讨论长期经济增长的可能路径——人工智能爆炸式的加速增长,抑或是经济增速反向放缓乃至停滞。两人基于发表于 NBER 人工智能经济学卷册的合作论文指出,未来增长率并不必然延续战后的稳态轨迹,可能结果的分布极为宽广,因此无法排除增长朝相反方向发展的可能性。
- 动态GovAI
Michael C. Horowitz 谈《当速度致命》:自主武器系统、威慑与稳定性
Michael C. Horowitz 基于安全研究和军事史案例,分析了自主武器系统(AWS)可能带来的两类后果:军备竞赛以及威慑稳定性的削弱,包括战略稳定性下降、危机不稳定风险上升和战时升级。他以作战速度提升和人类对战场的控制减弱这两个特征作为切入点展开讨论。
- 动态GovAI
Margaret Roberts 与 Jeffrey Ding 谈审查制度对人工智能的影响|GovAI Blog
加州大学圣地亚哥分校政治学副教授 Molly Roberts 在一场 GovAI 活动中报告了她与 Eddie Yang 合作的研究,探讨审查与中国人工智能之间的关系,指出驱动 AI 应用的海量数据会被人为偏见污染并编码进训练数据,进而通过算法放大到面向用户的界面中。牛津大学未来人类研究所研究员 Jeffrey Ding 担任评议人。该工作被视为其审查与人工智能关系研究的开端,此前已有大量研究关注种族与性别偏见于训练数据集中的编码问题。