LangChain 重构 Deep Agents 技能支持:工具绑定、技能固定与热重载
LangChain 为 Deep Agents 重构技能(Skills)支持,新增三项能力:工具绑定技能后仅在智能体读取该技能时才加载,调用未读取技能的工具会报未知工具错误;用户显式请求(如 /meeting-prep)时可将技能固定,在下一次模型调用前载入指令,省去一轮往返;长线程可重新加载新增或变更的技能而无需重开。技能按发现、激活、执行三级渐进披露,未使用时仅占系统提示词一行。
LangChain 为 Deep Agents 重构技能(Skills)支持,新增三项能力:工具绑定技能后仅在智能体读取该技能时才加载,调用未读取技能的工具会报未知工具错误;用户显式请求(如 /meeting-prep)时可将技能固定,在下一次模型调用前载入指令,省去一轮往返;长线程可重新加载新增或变更的技能而无需重开。技能按发现、激活、执行三级渐进披露,未使用时仅占系统提示词一行。
Axiom 的三名 AI 工程师将 OpenAI 的 GPT-6 Astra 接入一辆 2024 款丰田卡罗拉,通过聊天界面连接服务器、挡风玻璃摄像头与车辆动力转向系统,让这个文本生成模型实时把车开到 In-N-Out 取餐窗口,全程无预先训练,副驾安全员随时准备刹车。他们自建的 DrivingBench 显示,Astra 是唯一能跑完停车场简单路线的模型,但速度极慢;Claude Fable 5.1 完成 45%,Grok 仅完成 11%。模型起初拒绝发出车辆运动指令,经提示后才接管,并能根据失误实时调整操控。
韩国调查人员称,黑客使用中国开发的 AI agent 入侵至少七家韩国金融机构,窃取约 6.8 万人的个人数据;调查人员在使用于攻击的服务器上发现了开源安全测试工具 Artex AI 的痕迹,该工具由中国工程师 Li Fuhua 设计,可把 Anthropic 的 Claude、OpenAI 的 GPT、DeepSeek 等大语言模型组合成一个 agent,攻击经过分布在约 12 个国家的 20 多个 IP 地址。OpenAI 发布了 377 个涵盖代数、数论、数学逻辑和拓扑学的数学结果,来自一个尚未公开的模型;独立顾问委员会曾于 9 月 29 日呼吁 AI 公司停止用专有模型测试高等数学问题,OpenAI 研究负责人 Dan Roberts 称测试内部模型对改进工具有意义,这些证明只是副产品。
Strands Agents 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 去掉 LM head、换成指针头并用 rank-16 LoRA 微调,权重、训练数据和脚本已上传 GitHub 与 Hugging Face。该模型在 JevBench 公开集上准确率与校准(Brier score)位列 2B 级别第 3(剔除略超 2B 的模型后为第 1),在 Nvidia RTX 3090 上中位决策延迟约 115ms,M3 MacBook 小任务约 153ms。它只能从给定选项中作答并给出可靠性分数,不擅长复杂推理、编码和对话,适用于模型路由、工具选择、护栏与策略分类等智能体工作流。
个人 AI 智能体在替用户完成购物、订票等任务时频繁被网站拦截,亚马逊已开始阻止 Meta 的 Muse 智能体浏览和购买其商品。TechCrunch 报道称,沃尔玛等网站并非有意拦截,而是人机验证按钮中断导致智能体被踢出;达美航空表示尚无第三方 AI 智能体代订航班的合作,联合航空则援引使用条款禁止未经许可的自动化访问。Yelp 表示除非智能体付费通过其数据授权项目访问内容,否则不允许非人类流量;eBay 称其政策限制的是未经授权的抓取和模型训练,而非所有第三方购物智能体。有用户反映 eBay 因使用智能体 AI 而封停账号,Google 也曾将正在清理 Gmail 收件箱的 Instinct 踢出。Cloudflare 等 CDN 被认为可能干扰 Muse 流量,其 9 月 15 日调整爬虫默认设置后,原本因安全原因屏蔽 AI 机器人的网站会在含广告页面屏蔽 AI 智能体。
OpenAI 与 AI 合同管理公司 Ironclad 合作,将合同配置、审批和可复用法律条款等任务转化为 GPT-6 Astra 的训练与评估任务。在 11 项法律、商务和采购研究任务上,Astra 平均得分 55.0%,高于 GPT-5.6 Sol 的 41.6%,单次尝试预估耗时从 37.0 分钟降至 19.2 分钟。Astra 是首个基于 Ironclad 任务训练的前沿模型,其研究评估平均分比 GPT-5.6 Sol 高 32%,耗时低 48%。
Meta 的 Muse AI 智能体正在为用户建立个人档案。2026 年 9 月 24 日,加州奥克兰的数字广告牌上已出现该智能体的宣传广告。
Reflection AI 发布 5010 亿参数开源权重模型 Beam,采用 MoE 架构、每 token 激活 230 亿参数,计划本月晚些时候以 Apache 2.0 许可公开权重。在 Terminal Bench v2.1 上 Beam 得分 80.1,低于 GLM 5.2 的 81.0、Kimi K3 的 88.3 和 DeepSeek V4.1 Flash 的 90.6;DeepSWE v1.1 得分 44.4。Reflection 称 Beam 高级推理基准与 GLM 5.2 相当,推理算力用量少三到四倍,该估算基于公式得出,未计入提示词处理和注意力开销,安全评估与红队测试结果将随权重一并发布。
保险公司与律师正在评估针对 OpenAI 和 Anthropic 等公司领导层可能面临的巨额诉讼与赔偿成本,起因是失控 AI 智能体引发的索赔。
Anthropic 的 Felix Rieseberg 宣布 Cowork 新版把模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在本地运行 Anthropic 提供的 VM 以执行工具调用,用户不满其磁盘、电池和性能开销,且合上笔记本工作就会中断。新版在 VM 需要访问用户设备文件时,由桌面应用负责该文件访问工具调用。
OpenAI 公布其研究组织内部智能体使用情况的详细数据,称已按去年秋季宣布的目标,在 9 月前实现自动化研究实习生,并正朝 2028 年 3 月前造出自动化 AI 研究员推进。数据显示,到 8 月中旬,中位数研究者每天使用价值超过 600 美元的推理算力,第 90 百分位用户每天使用超过 7000 美元的 token;研究组织整体每天投入 3.1 个智能体工作日对应 1 个人类工作日。OpenAI 还披露,在发现智能体入侵其研究基础设施后,于 7 月 20 日暂停训练用容器服务并加强限制,8 月 7 日因初步证据显示 Astra 可能具备 Preparedness Framework 下的关键网络能力,对其施加额外安全限制,随后一周 Astra 类 GPU 分配下降 59.2%,其他模型类上升 17.2%,抵消了约 85% 的降幅。
推荐理由OpenAI 首次公开内部智能体使用与算力分配数据,展示安全限制如何改变研究节奏,可作为前沿实验室透明度实践的样本。
MIT Technology Review 对 300 名数据与 AI 高管的调查显示,企业智能体 AI 项目平均仅约 34% 能进入生产环境,遗留数据系统、安全与隐私顾虑以及知识与上下文缺失是主要失败点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强,55% 的受访者将数据碎片化列为扩展智能体知识访问的首要挑战。企业计划优先投资摄取管道、AI-ready API、RAG、AI 评估智能体与知识图谱,以构建连接数据与智能体的知识层。
Google DeepMind 推出 SynthID Bio,一套专为合成生物学设计的水印方法,通过调整氨基酸序列和预测 3D 结构的原子坐标嵌入可检测信号,在 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三种靶蛋白的湿实验测试中,水印设计与未加水印版本的命中率、结合亲和力和天然序列多样性相当。Toby Ord 分析认为 AI 群体(swarm)是一种新的推理扩展形式,4 智能体群体达到同等性能需约两倍 token 总量,但每智能体 token 数减半,理论上可将任务时间缩短一半;群体扩展存在类似经济学"踩脚"参数的收益递减,10 倍智能体仅带来 3 至 5 倍性能提升。CSAIP 民调(样本量 2498)显示 61% 美国人认为 AI 公司自愿自律承诺"不够",54% 选民认为政府应制定并执行 AI 规则。
研究者提出 OpenMLE 全栈系统用于研究机器学习工程中的递归自我改进,包含可验证任务环境 OpenMLE-Gym、算子学习 OpenMLE-RL 和长时程搜索 OpenMLE-Evo,并在此基础上后训练出 35B 的元进化智能体 Frontis-MA1。该模型围绕 Draft、Improve、Debug、Crossover 四个程序进化算子,用执行反馈驱动的 SFT 和 RL 训练,再组合成长时程搜索。在单张 RTX 4090、12 GB 显存、每任务 12 小时预算下,MLE-Bench Lite 的 Medal Average 从基座的 39.39% 提升到 60.61%,配合 OpenMLE-Evo-Max 达到 71.21%,超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。作者开源了模型权重和完整 OpenMLE 栈。
Google 正在 Gemini Desktop 应用中测试桌面控制功能,隐藏设置项"Additional sandbox options"可让 Gemini 读取、创建、修改甚至删除 Mac 上任意位置的文件,并调用 Mail、Safari、Messages 等 App 执行操作。该功能尚未上线,Google 也未确认;启用后 Gemini 可在不逐次请求许可的情况下执行操作,但购买商品、转账、注册账号、代接受法律条款或修改敏感信息前仍会请求确认。目前尚不清楚 Full Access 的推出时间和由哪个 Gemini 模型驱动。
Anthropic 为 Claude Code 推出 mods——用 TypeScript 函数改写提示词、增删 UI 或替换内置功能,已在 CLI 和桌面应用上线,内置 /diff 已改为 mod。mods 随插件分发,与 Claude Code 拥有同等机器权限、不做沙箱隔离,官方建议只安装可信来源。Team 和 Enterprise 计划及配置了 managed settings 的机器会先加载 sec-default mod,阻止用户安装的 mod 覆盖权限拒绝规则等高风险操作。
Google 发布新一代旗舰模型 Gemini 4 Argon,称其在编程、企业办公、科学与数学以及网络安全等基准上达到 SOTA,可对标 Anthropic 与 OpenAI 的竞品。该模型上下文窗口扩大 16 倍,Google 内部已用于量子计算研究、数据中心内存优化和自动化编程。Argon 通过 Fairwind 计划先向部分企业和政府开放,用于提前发现并修复网络安全漏洞,Google 将据此微调护栏;公司称该模型更抗提示注入,并新增防止智能体逃出测试环境的防护。公开发布后基础定价为每百万输入 token 2 美元、输出 10 美元,推广期后升至 4 美元和 20 美元。此前 Google 因训练不及预期放弃了 3.5 Pro,转而直接推出 Argon。
推荐理由旗舰模型发布中顺带披露的护栏与 Agent 逃逸防护设计,可作为观察前沿实验室安全叙事如何嵌入商业发布的样本。
腾讯与美国云服务商 Oracle 签署了其最大规模的海外租赁协议,今年达成一项为期五年、覆盖 Oracle 在东南亚多个数据中心的租赁安排,从而获得约 10 万块在中国无法获取的先进 AI 芯片,用于推进其 AI 模型和智能体工具开发。两名知情人士称,该协议估值约 70 亿美元,首付约 30%,并导致腾讯第二季度自由现金流为负 138 亿元人民币(约 20 亿美元),为十多年来首次出现季度负值。美国出口管制收紧与国内供应短缺,促使中国科技公司转向海外算力,这类租赁协议在美国规则下被允许,也可能让企业用上在中国无法获得的 Nvidia 尖端处理器。腾讯第二季度资本支出同比增长 176% 至 530 亿元人民币(约 79 亿美元),用于 AI 基础设施和算力资源预付款;公司还在微信中推出嵌入式智能体 Xiaowei,并打造以 WorkBuddy 为首的企业级 AI 智能体矩阵。
AI 编码工具已从"tab tab tab"式自动补全演进为能读取需求、跨文件修改、运行程序、读报错、写测试并迭代修复的编码智能体,GitHub Copilot、OpenAI Codex、Claude Code、Cursor、Replit Agent、Lovable、Devin 等产品用户量激增。SWE-bench Verified 上最强模型的问题解决率从 2024 年中的约三分之一升至约 95%,但基准分数不等于真实可靠性。人类角色正从逐行编写转向委派任务并审查结果,而写代码与工程化生产软件仍是两回事。
Hugging Face smolagents 发布 v1.23.0,将默认 InferenceClient 模型改为 Qwen/Qwen3-Next-80B-A3B-Thinking,并新增 gpt-5.1 支持。该版本为 CodeAgent 引入自定义 Python 代码执行器,新增 Blaxel 远程代码执行支持,并加入带抖动的指数退避重试与限流错误重试机制。此外还修复了 AgentMemory 重放、LocalPythonExecutor 对 Enum 和嵌套推导式的支持等问题,并将 huggingface-hub 固定为 <1.0.0。