OpenAI DevDay 2026 回顾:GPT-6 Astra、ChatGPT、Codex 与 API 更新
OpenAI DevDay 2026 公布 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API 以及面向开发者的安全与新工具。
OpenAI DevDay 2026 公布 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API 以及面向开发者的安全与新工具。
OpenAI 推出 GPT-6.1 Sol,面向编程、计算机操作与专业工作场景,智能水平接近 Astra。其标准 API 输入与输出 token 价格仅为 Astra 的五分之一。
OpenAI 推出名为 dots 的主动式助手,可在复杂项目与日常任务中持续推进工作。dots 让用户在任务向前推进的同时保持掌控。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,为 Gemini Enterprise 提供带口型同步、自然表情和流畅轮次的动态视觉形象。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持用自然语言提示从零创建音色、30 秒样本复刻声音,并逐句控制表演、节奏与口音。
MentalHealthBench 是一个由专家参与制定的基准,用于评估 AI 在贴近真实的心理健康对话中给出的回复是否有帮助且安全。它同时覆盖有用性与安全性两个评估方向。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型。
Perplexity 采用 GPT-6 Astra 承担通信撰写、软件修改与生产系统监控等端到端工作,对模型的检查频率较此前模型大幅降低。
Google DeepMind 推出手语到文本(SL2T)翻译模型,并首次将其落地消费级产品——Pixel 11 上的 Gboard 与 Live Transcribe,首发支持美国手语(ASL)转英语听写。该模型基于超 100,000 小时、覆盖 50 多种手语的数据训练,其中约四分之一为 ASL,联合训练使其优于单语模型,并在未见过的数据上取得 70 BLEURT 的零样本成绩。它把手语视为手势坐标序列而非摄像头画面,由端侧 MediaPipe Holistic 提取姿态地标后再送服务器翻译,跳过 gloss 中间标注,从而摆脱人工词汇表限制。
Google DeepMind 面向印度 Atal Tinkering Labs(ATL)启动 ATL Saathi 实机试点,这是一款由 Gemini 提供底层能力的网页应用,为该计划的教育工作者提供全天候备课与培训助理。该工具基于 NotebookLM 整理并维护全部 ATL 课程材料,覆盖 12 个核心模块的小结、AI 信息图、视频概览与互动测验,并为其中 10 个模块提供进阶的项目生成界面,同时支持教师与学生双向的教学模式。其最新 Gemini 3.5 Flash 模型负责即时生成符合年级与课程标准的活动创意及分步组装说明、接线图和必要的安全注意事项,首批落地全国 100 所试点学校,初期支持 8 种语言。
Google Threat Intelligence(GTIG)发文剖析亲俄影响力生态系统正从乌克兰战争工具回归全球战略资产,并日益将生成式 AI 用于行动策划、调研与内容创作。该报告称俄罗斯政府有意打造融合公开、隐蔽与独立要素的自维持环境,服务于削弱西方主导地位、维系周边地区支配力及保障国内政权稳定三类目标,美国、欧洲、北约与欧盟为主要打击对象。由于各组件相互关联,该系统能抵御有限范围的干扰,防守方需针对性应对。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,自动检测 70+ 种语言并生成保留说话人语调、节奏和音高的自然译文语音,且持续输出而非等待整句结束,仅落后说话人数秒。该模型通过 Gemini Live API 和 Google AI Studio 面向开发者公开预览,本月起在企业版 Google Meet 中私有预览,同时在全球 Google Translate App(Android/iOS)上面向所有用户推送。
Google DeepMind 推出新一代模型家族 Gemini Omni,首个成员 Gemini Omni Flash 今日面向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户在 Gemini App 及 Google Flow 开放,可从图像、音频、视频和文本的组合输入生成高质量视频并对话式剪辑。 该模型基于 Gemini 的原生多模态与世界知识进行推理,具备更强的重力、动能、流体动力学直觉,能跨轮次精修环境、角度、风格且角色一致;同时可通过 Avatar 用自己的声音创建数字分身,全部产出带不可察觉的 SynthID 水印,目前仅支持语音参考作为音频输入,图像与音频输出模态将陆续加入。
Goodfire 将可解释性方法应用于 Prima Mente 的表观遗传基础模型 Pleiades,发现 DNA 片段长度模式主导其从血液游离 DNA 检测阿尔茨海默病的决策,并由此提炼出一个人类可解释的分类器。该分类器仅用片段长度特征即在独立队列上取得 AUROC=0.78(95% CI [0.56–0.95]),加入此前文献报道的生物标志物类别后升至 AUROC=0.84(95% CI [0.66, 0.97])。研究表明片段组学可作为互补于既有预测指标的新型候选信号,但其临床应用仍需进一步验证。
NVIDIA GTC 2025 的网络技术专场聚焦网络创新如何让 AI 工厂达到吉瓦级规模并实现性能与效率突破。会议内容围绕支撑这一规模所需的网络技术展开,配图来源包括 Plask 与 Cern。