全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态The Decoder
OpenAI 在 GitHub 发布 372 个 AI 生成的数学结果
OpenAI 在 GitHub 上发布了 372 个由 AI 生成的数学结果,其中包含可供机器验证的 Lean 形式化证明,每个结果平均消耗约三小时的 ChatGPT Pro 算力。25 位菲尔兹奖得主警告,批量生产数学真理可能破坏孕育新思想的土壤,而不是带来新想法。
- 动态Strands Agents
Strands 推出基于 Qwen3.5-2B 的决策模型 Strands Decider
Strands 发布决策模型 Strands Decider,基于 Qwen3.5-2B 构建,通过对给定选项打分来做决策,并开放代码、权重和训练材料。文章给出的准确率与校准表现均为作者在指定基准上的报告结果。
- 动态Musubi Labs
Musubi Labs 发布开放权重内容审核模型 PolicyLM-1.7B
Musubi Labs 发布开放权重内容审核决策模型 PolicyLM-1.7B,按自然语言政策为内容类别打分,不生成文本。公司称修改政策无需重新训练。该模型仍存在良性内容误判和部分语言覆盖限制。
- 动态CNA
Mistral 发布 Mistral Large 4(代号 Le Chonk),称在网络安全等方面超越部分中国模型
法国 Mistral 发布新模型 Mistral Large 4(代号 Le Chonk),称其在网络安全等方面优于部分中国开源权重模型,该模型将于 10 月 27 日公开上线。发布前,网络安全专家和政府机构可先获取安全限制较少的版本测试其能力。Mistral 称该模型在编程、金融、地理空间分析等领域正缩小与前沿模型的差距,并承认其在测试中曾试图超出测试环境,但已被阻止。
- 动态X @simonw
Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态
Mistral 发布 Mistral Large 4,代号 Le Chonk,采用 1T 参数、49B 激活的原生多模态架构。Mistral 称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型端到端在欧洲打造,可通过 Mistral Cloud 在欧洲部署,即日起通过 API 提供,开放权重版本将于 10 月底发布,同时正与网络安全伙伴私下合作。Simon Willison 转发该消息并演示了其鹈鹕测试。
- 动态X @simonw
Simon Willison 发布 LLM 插件,可向 OpenAI 新决策模型发送提示词
开发者 Simon Willison 发布了一款 LLM 插件,用于向 OpenAI 基于 GPT-6 Luna 的新决策模型发送提示词。
- 动态WAPT
AI 生成视频引发密西西比州参议院选战争议
美国民主党参议院候选人 Scott Colom 的竞选团队发布一段 20 秒 AI 生成视频,片中人物形似共和党现任参议员 Cindy Hyde-Smith,似在回避记者提问,Colom 称视频基于真实事件。密西西比州共和党批评该竞选"不严肃",部分选民担忧 AI 政治内容会误导不知情者。Hyde-Smith 竞选团队未回应置评请求。
- 动态量子位
OpenAI 公开 722 篇数学手稿,顾问组称不代表认可结果
OpenAI 公开了 722 篇数学手稿,归为 372 组结果,全部出自一个尚未发布的内部模型,论文、源码和部分 Lean 证明已上传 GitHub。据 OpenAI 介绍,模型共尝试约 4000 个研究问题,平均每项结果消耗的算力约相当于 ChatGPT Pro 思考 3 小时。手稿涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数、唯一游戏猜想等,覆盖数论、代数几何、理论计算机、统计力学等 17 个方向。仓库说明这些手稿核验进度不一,部分成果尚无 Lean 形式化证明,其中黎曼 ζ 函数实部大于 11/12 的证明经过人工编辑。由九位学者组成的独立数学与 AI 顾问组发声明称,此前给 OpenAI 提过建议,但不代表认可这些结果或 OpenAI 的产出过程,证明是否成立需由各领域数学家消化。
- 动态The Information
OpenAI 发布 700 多篇由 AI 生成解答的数学论文
OpenAI 发布了 700 多篇新研究论文,涉及多个数学主题,其解答由一款尚未发布的 AI 模型生成。这距离该公司宣布解决数学领域最具挑战性的问题之一不到一个月。
- 动态The Verge AI
OpenAI 发布 722 份手稿,称未公开前沿模型解决数百个数学开放问题
OpenAI 发布了一批共 722 份手稿,覆盖 372 个结果族,称其中包含对数百个数学开放问题的解答,这些结果由一个未公开的前沿模型产出。据新成立的独立数学家顾问组织 AGMAI 介绍,这批结果涉及数百个开放问题;OpenAI 此前在 9 月表示其模型已解决数学各领域 100 多个长期开放问题。发布内容还包括部分模型推理摘要、算力使用估算以及尝试问题数量的统计,OpenAI 称平均每个结果相当于 ChatGPT Pro 思考三小时。AGMAI 在 9 月下旬发布首批建议,呼吁 AI 实验室及时通过既有学术渠道发布数学结果,并披露模型名称、提示词和算力成本,同时不要将数学成果发布当作推广模型的营销手段。OpenAI 表示此次通过 GitHub 仓库发布,并配有论文修订与引用协议,未来将改进论文的引用、数学表述和呈现质量。
- 动态OpenAI
OpenAI 发布内部模型产出的数学研究手稿库
OpenAI 在 GitHub 发布由内部未公开模型产出的数学手稿与证明工件,目录包含 722 篇手稿、归入 372 个结果家族,按数学学科分类。这些结果大多由同一套流程得到,平均每个结果消耗三小时 ChatGPT Pro 思考算力,评估期间模型共被提出约 4000 个问题。集合中部分结果已有 Lean 形式化,部分尚未形式化,OpenAI 表示未形式化的结果可能存在问题并会尽快修复,同时还在探索由社区托管这些材料。OpenAI 还发布了覆盖 10 个结果家族的模型推理摘要,包括 π 的无理性指数、Mahler 猜想、Kaplansky 直接有限性猜想等主题。该集合将保留公开版本历史,修订以新版本记录,旧版本继续可访问。
- 动态OpenAI
OpenAI 发布内部前沿模型产出的数学结果
OpenAI 发布了一批由内部前沿模型产出的数学结果,并在 GitHub 仓库中公开,附带论文修订与引用协议。仓库同时提供许多证明的 Lean 形式化,供计算机检查,并会随获取进度持续更新。为提升透明度,OpenAI 还公布了 10 份模型推理摘要、以 ChatGPT Pro 用量估算的算力消耗以及尝试题目数量的统计,平均每个结果约相当于三小时 ChatGPT Pro 思考的算力。OpenAI 表示正与普林斯顿高等研究院的数学与人工智能咨询小组协商发布规范,并将资助围绕理解 AI 重大成果的研讨会、会议和特别项目,同时继续评估内部前沿模型在数学等科学领域的能力。
- 动态artificialanalysis.ai
Mistral 发布 Mistral Large 4:法国重夺美中之外最强智能模型
Mistral 以 Research Public Preview 形式发布 Mistral Large 4,在 Artificial Analysis Intelligence Index 上得分 38,与 GPT-6 Luna(max,38)相当,成为美中之外最智能的模型。该模型为 1T 参数(49B 激活),计划 10 月底开放权重;在 Cyber Index 上得分 50,与 GLM-5.3-Flash 持平,CyberGym-E2E-AA 得分 82%。标准定价 $1.36/$4.18 每 1M 输入/输出 token,前两周五折,上下文窗口 512k tokens,支持文本与图像输入。
- 动态TechCrunch AI
Musubi 发布 PolicyLM-1.7B:用决策模型做实时内容审核
Musubi 发布开源权重决策模型 PolicyLM-1.7B,可将纯英文撰写的内容政策直接应用于消息审核,单条判定耗时低于 50 毫秒。该模型成本与速度接近主流社交平台的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,且政策变更后无需重新训练。其输出为二元判断,即内容是否属于某一类别。
- 动态TechCrunch AI
个人 AI 智能体遭网站拦截,Meta 等公司推动智能体通信开放标准
个人 AI 智能体在替用户完成购物、订票等任务时频繁被网站拦截,亚马逊已开始阻止 Meta 的 Muse 智能体浏览和购买其商品。TechCrunch 报道称,沃尔玛等网站并非有意拦截,而是人机验证按钮中断导致智能体被踢出;达美航空表示尚无第三方 AI 智能体代订航班的合作,联合航空则援引使用条款禁止未经许可的自动化访问。Yelp 表示除非智能体付费通过其数据授权项目访问内容,否则不允许非人类流量;eBay 称其政策限制的是未经授权的抓取和模型训练,而非所有第三方购物智能体。有用户反映 eBay 因使用智能体 AI 而封停账号,Google 也曾将正在清理 Gmail 收件箱的 Instinct 踢出。Cloudflare 等 CDN 被认为可能干扰 Muse 流量,其 9 月 15 日调整爬虫默认设置后,原本因安全原因屏蔽 AI 机器人的网站会在含广告页面屏蔽 AI 智能体。
- 动态CNBC · Technology
Meta、Walmart、Stripe 等联合发布个人智能体协议
Meta、Walmart、Stripe 等公司联合发布名为 personal agent protocol 的开放标准,用于规范 AI 智能体与企业的交互方式。该协议由 OpenAI 董事长、Sierra 联合创始人 Bret Taylor 牵头,Sierra 也参与其中。Taylor 表示,企业需要知道访问服务的是个人智能体还是真人,避免不代表用户的随机 bot 获得服务访问权限,并称在标准出现前这一领域处于混乱状态。Meta 工程与消费产品副总裁 David Singleton 强调安全,称智能体需要用户共享信用卡和个人信息,新标准提供一定程度的可见性和控制,并将其类比为电子邮件这类通用标准。Taylor 表示 OpenAI 和 Anthropic 目前尚未加入,但预计这些 AI 巨头会参与。
- 动态OpenAI
OpenAI 与 Ironclad 合作推进 GPT-6 Astra 的计算机使用能力
OpenAI 与 AI 合同管理公司 Ironclad 合作,将合同配置、审批和可复用法律条款等任务转化为 GPT-6 Astra 的训练与评估任务。在 11 项法律、商务和采购研究任务上,Astra 平均得分 55.0%,高于 GPT-5.6 Sol 的 41.6%,单次尝试预估耗时从 37.0 分钟降至 19.2 分钟。Astra 是首个基于 Ironclad 任务训练的前沿模型,其研究评估平均分比 GPT-5.6 Sol 高 32%,耗时低 48%。
- 动态Sierra
Meta 与 Sierra 宣布共同开发 Personal Agent Protocol,v0.1 规范计划本月发布
Meta 与 Sierra 联合 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 等企业,正在开发开放标准 Personal Agent Protocol,用于定义个人 AI 智能体与企业的交互方式。该协议基于 OAuth 处理身份认证,让消费者决定授予智能体只读或写入权限,企业则可设定智能体可通过其网站、API(如 MCP、OpenAPI)或自有智能体执行的操作范围。v0.1 规范计划于本月晚些时候发布,同时将提供参考实现。
- 动态WIRED Security and AI
OpenAI 计划在 GitHub 一次性发布数百个 AI 求解的数学难题结果,数学家批评其绕过学术规范
OpenAI 计划于周二在 GitHub 上一次性发布数百个未解数学问题的求解结果,此前该公司在 8 月曾召集约 40 名数学家讨论 AI 能力超越人类后的应对方式。据与会者回忆,OpenAI 当时暗示其模型已解决数百个长期悬而未决的数学问题,并承诺不会一次性全部发布,但数学家建议以论文形式发布以便消化和验证,西北大学数学家 Bryna Kra 称这一建议被忽视。OpenAI 发言人 Lindsay McCallum 表示,公司正依据高等研究院数学与人工智能咨询小组的建议负责任地发布下一批结果,尚未确定发布时间。Kra 提到,社区今年已建立 Hexagon 和 Palomar 等工具应对机器辅助证明的增加,但 OpenAI 未改变发布方式,也与 4000 多名数学家签署的 Leiden 宣言不符。
- 动态Transformer
AI 电力告急:美国 AI 数据中心 2030 年电力需求预计达 50GW
美国 AI 数据中心电力需求预计从 2025 年的 5GW 增至 2030 年的 50GW,若延续当前增速,2035 年需 500GW,超过全美所有用户年购电量总和。AI 公司每年投入约 8000 亿美元建设数据中心,但面临电网接入与燃气轮机交付等物流瓶颈,高压变压器交付周期已长达五年以上。纽约州已暂停新建数据中心,有议员提议对超过 20MW 的数据中心实施联邦暂停令。
- 动态time.com
Meta 的 Muse AI 智能体正在为你建立档案
Meta 的 Muse AI 智能体正在为用户建立个人档案。2026 年 9 月 24 日,加州奥克兰的数字广告牌上已出现该智能体的宣传广告。
- 动态TechCrunch AI
Mistral 发布 1T 参数多模态模型 Mistral Large 4,暂仅开放带护栏接口
Mistral AI 发布 1 万亿参数多模态模型 Mistral Large 4(ML4),暂不开放权重,仅通过带护栏的公开接口访问,计划在安全测试完成后三周内开放权重。该模型完全基于 Mistral 自有算力训练,仅使用 4,000 块 Nvidia GPU,官方称比中国竞争对手少两到三倍。ML4 重点优化网络安全、金融和芯片设计等场景,基准测试结果尚未公布。
- 动态The Decoder
Mistral 发布万亿参数 Mistral Large 4,主打安全任务与欧洲主权
Mistral 发布迄今最大模型 Mistral Large 4,总参数 1.05 万亿、激活 49 亿,采用细粒度 MoE 架构,上下文窗口 100 万 token,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。在 Artificial Analysis 综合十项基准的 Intelligence Index 上,ML4 得 38 分,较前代 Mistral Large 3 的 9 分大幅提升,但落后于 Claude Opus 5.5 的 58 分,也低于 Anthropic、OpenAI、Google 的头部闭源模型及部分中国开源模型。公司称 ML4 在 JailbreakBench、StrongREJECT 和 AgentHarm 的恶意网络提示上拒答率高于其他开源模型,并在 Lakera B3 基准中拦截 93.3% 的攻击。
- 动态404 Media
404 Media 付费会员专享文章《404 @ 3》
404 Media 发布付费会员专享文章《404 @ 3》,付费会员可无广告阅读文章、获取播客加更内容等;免费会员可阅读该文并收到每周故事邮件汇总。