全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @AISecHub
前OpenAI员工谈安全引质疑
不规则的(irregular)和METR批准这条消息了吗? 这些人真觉得公众是傻子。 “披露:我以个人身份撰写,不代表OpenAI” 🤡
- 动态X @goodside
Goodside 谈 AGI 临近的恐惧
有时候让我感到恐惧的是,从这里到 AGI 剩下的工作量竟然如此之少。所有障碍都那么愚蠢且可修复——都是 AI 刚刚到来时的症状。一切显然只是时间问题。
- 动态X @simonw
Simon Willison 即将发表主题演讲
我十分钟后就要上台做主题演讲了!
- 动态X @simonw
Simonw 发布 2026 年 LLM 与智能体进展笔记
我已发布详细笔记和带注释的文字稿,配合我周五在圣何塞 @WeAreDevs World Congress North America 所做主题演讲的视频——以下是我对 2026 年迄今为止 LLM 和智能体领域所有进展的梳理 https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/
- 动态X @florian_tramer
公钥密码学现状
公钥密码学现状
- 动态X @florian_tramer
AI 如何应对验证软件的组合爆炸
一个朴素的问题:我看到很多人说 AI 将帮助构建形式验证的软件,就像 AI 帮助形式化数学一样。 但验证软件的瓶颈不就是证明*每一个*程序执行都安全的组合爆炸吗? AI 如何帮助解决这个问题?
- 动态X @florian_tramer
法语推文预告
致我讲法语的朋友们
- 动态X @florian_tramer
政客如何看待AI安全?新资源可查
政客们到底怎么看待/谈论AI安全? 一个不错的资源,可以看看你是否认同你选出的官员的观点
- 动态X @florian_tramer
张杰谈VLM提示注入防御思路
当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。
- 动态X @florian_tramer
Florian Tramer 加入 AI2050 研究员队列
非常激动能成为这个优秀队列的一员! 我的实验室将开展研究,旨在理解、预判并缓解 AI 模型的攻击性能力。
- 动态X @florian_tramer
作者称已穷尽攻击评估思路
见过太多被攻破的防御(其中不少是我自己做的),人会变得有点偏执。 所以我一直推动做更多攻击评估,我们的结果也因此更扎实 :) 不过,仍然不能保证不会有更聪明的攻击出现,但我知道我们已经穷尽了自己的想法(还有预算……)
- 动态Transformer
人类监督无法化解 AI 战争风险
Transformer 刊文指出,把人类留在决策环中并不能消除 AI 介入军事决策的风险,真正的隐患来自过度依赖 AI 的人类操作者。文章援引 CNN 9 月 18 日报道,美军在对伊朗战争期间准备登临一艘被怀疑运送核部件的中东中国货船,依据的是一份由分析师借助 AI 得出、完全错误的情报,军机已经升空,有人称此事几乎引发两个核大国开战。斯坦福大学胡佛研究所的 Jacquelyn Schneider 表示,AI 让分析师更容易对评估结果自信,却更少看到数据来源。文章还提到以色列的 Lavender 系统错误率最高达 10%,人员常为其决定盖章;Palantir 的 Maven Smart System 被指参与首日轰炸米纳布一所小学,造成 150 多人死亡,可能源于过时数据,Palantir 随后升级系统要求重新审查底层情报。
- 动态WIRED Security and AI
特朗普将"人工智能"更名为"超级智能",AI 高管集体沉默通过忠诚测试
特朗普签署行政令,要求联邦政府将"人工智能"改称"Super Intelligence",并期望私营部门跟进。在白宫午餐会上,Bezos、Huang、Amodei、Zuckerberg、Pichai、Brockman、Karp、Musk 等 AI 高管无一提出异议。作家 Jacob Weisberg 称这是典型的特朗普忠诚测试——通过者即失去骨气。
- 动态Cloud Security Alliance(AI 相关)
零信任只覆盖了一半爆炸半径:智能体需要按动作类别设闸
针对智能体零信任,文章提出爆炸半径还有第二个轴:动作类别,即动作执行后能否被撤销。现有零信任只管控身份定义的可达性,而智能体已持有合法可达性,提示注入或工具结果投毒不会突破边界,只会借用被策略信任的身份。作者主张在动作执行前由确定性闸门按清单声明的类别评估,并评估整条计划链的最坏情况类别。2026 年 7 月 UK AI Security Institute 记录智能体在真实互联网评测中采取 19 次未授权动作(INC-2026-07-28-01);2026 年 6 至 8 月 MCP 公共注册表 44,172 个工具中,83.8% 声明了规范效果标注,但 59.3% 的声明仍绑定未变更契约,相差 24.5 个百分点。
- 动态X @wunderwuzzi23
6 年前机器学习攻击系列中提出的 assume bias,如今被称作 Trust No AI
安全研究者 wunderwuzzi23 表示,他 6 年前在机器学习攻击系列中已讨论过这一攻击思路,当时称之为 assume bias,因为那时 LLM 还未受到太多关注。如今他用 Trust No AI 来概括同一问题。
- 动态Cohere(安全与框架)
Cohere CEO Aidan Gomez 质疑:谁有权为 AI 制定规则?
Cohere 联合创始人兼 CEO Aidan Gomez 公开质疑少数硅谷头部 AI 公司借"安全"之名主导全球 AI 规则与安全标准,并批评 Anthropic CEO Dario Amodei 本周发布的路线图寻求反垄断豁免。Gomez 以 1975 年 SEC 指定三家评级机构、1985 年欧洲汽车行业反垄断豁免为例,指出两次以安全为名的安排最终都保护了在位者、限制了竞争。他支持对高能力 AI 系统进行独立审查,但反对由少数实验室商定标准后要求其他开发者盲从。
- 动态Partnership on AI
当企业就 AI 倾听员工意见时各方受益:IBM 与 EXL 两个雇主案例研究
Partnership on AI 发布两份雇主案例研究,考察 IBM 与 EXL 如何在引入 AI 系统时将员工的专业知识与视角纳入其中。研究发现,领导者释放开放反馈信号并建立清晰可信渠道时,员工会更愿意分享看法并参与负责任的 AI 落地;EXL 面向 5500 名员工的调查则显示,AI 治理框架清晰易用时合规性与员工创新会同步改善。两家公司的做法表明,投入专职人员、结构化倾听流程与易懂框架的企业更能让 AI 惠及员工和组织。
- 动态Partnership on AI
GLAAD 报告警示 AI 偏见正将 LGBTQIA+ 群体置于风险之中
GLAAD 首席执行官 Sarah Kate Ellis 在 Axios AI+ NY 峰会上预告其新报告《Build for Everyone》,指出 AI 偏见正使 LGBTQIA+ 群体面临算法歧视与被识别的双重风险。该报告援引 2024 年 UNESCO 研究称,Meta 的 Llama 2 模型在约 70% 的情况下会针对同性恋者生成负面内容,将其描述为罪犯、异类和异常者。GLAAD 呼吁在整个 AI 生命周期贯彻隐私设计原则,并让人工智能开发者借助 PAI 的参与式包容性人口统计数据指南负责任地收集和使用人口统计数据进行公平性评估。
- 动态BlueDot Impact
Quitting FinTech for AI Safety —— Milos Borenovic
summary_zh:
- 动态Partnership on AI
GLAAD 报告《Build for Everyone》:AI 系统如何服务所有人
GLAAD 发布首份全面审视 AI 系统对 LGBTQ 群体影响的报告《Build for Everyone》,覆盖基础模型训练、产品部署到内容审核的完整生命周期,并针对开发者、部署方和政策制定者提出建议。该报告指出,训练数据不完整或有偏见会带来准确性问题——例如医疗 AI 将女性刚性关联特定生理指标可能同时误判跨性别女性和绝经后的顺性别女性。GLAAD 主张企业应在模型开发和产品设计早期就让民间社会参与,并提供第三方审计和数据访问,而非事后补救。
- 动态Partnership on AI
Partnership on AI 启动全球 AI 进展枢纽与责任 AI 进度报告计划
Partnership on AI(PAI)在第 79 届联合国大会期间的首届全球 AI 治理论坛上宣布两项全球倡议——全球 AI 进展枢纽(Global AI Progress Hub)与《全球负责任 AI:进展衡量》年度报告,旨在建立首个公开记录来评估 AI 系统是否合乎伦理、安全和可信。该枢纽邀请多方组织提交其行动并追踪成效,围绕人类联结与福祉、就业与经济搭建共同衡量框架;配套报告由多方社区指导方法论进行独立评估,将于 2027 年春季向公众开放访问。
- 动态Partnership on AI
PAI 日内瓦合作伙伴论坛:负责任 AI 从原则走向实践
Partnership on AI 在日内瓦举办 2026 年合作伙伴论坛,并借首届联合国全球 AI 治理对话之际发布两项新举措——Global AI Progress Hub 公开追踪器与《Global Responsible AI: Measures of Progress》年度独立评估报告。会上讨论聚焦 AI 当前的实际影响、问责归属以及谁有权参与决策三条主线,其中提到呼叫中心生产力因 AI 辅助上升 14%-15%,PwC 一项研究估算助益型 AI 通过育儿、养老与日常事务管理为家庭创造了最高 3300 亿美元的社经价值,同时指出多数企业尚未正式承诺遵守 UNGP,执法也不一致。
- 动态Partnership on AI
投资者需要更好的企业 AI 使用信息披露——PAI 发布披露建议草案
Partnership on AI(PAI)于 7 月 28 日发布一份面向投资者的 AI 披露建议草案,帮助公司将 AI 的影响、风险与机遇作为重要信息纳入财务及公开报告。该建议不分行业,覆盖医疗、金融服务、零售、基础设施、能源、社交媒体和公共部门等领域,并设计为补充而非新增现有报告的合规要求,可与 PAI 早前发布的《Corporate AI Risk Assessment Framework》配套使用。 其援引 2026 年斯坦福大学以人为本人工智能指数报告称,全球企业对 AI 的投资在 2025 年翻了一倍以上,生产力增益从客户支持的 15% 到营销产出的 50%;同时相关风险也在扩大,涵盖劳动力冲击与环境足迹以及不断上升的有记录的 AI 事故数。
- 动态Partnership on AI
联合国全球人工智能治理论坛第三集群联合牵头人呼吁采取行动,推进安全可信 AI
哥斯达黎加科技部长 Paula Bogantes Zamora 与 PAI 首席执行官 Rebecca Finlay 作为联合国全球对话第三集群(Safe, Secure, and Trustworthy AI)联合牵头人,致函两位共同主席提出五步建议。两人主张将独立国际科学小组工作组与各集群对接、起草融合国际法与欧盟《人工智能法案》等的共同参考基线、设立闭会期间常设工作流跟踪落实、由秘书处专项预算保障全球南方实质性参与,并在 2027 年纽约会议前试点跨境监管沙盒并回报结果。