跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 19 条 · 共 19 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体6来源:TechCrunch AITechCrunch AI1 条材料来源:CNBC · TechnologyCNBC ·Technology1 条材料来源:OpenAIOpenAI1 条材料来源:SierraSierra1 条材料来源:time.comtime.com1 条材料来源:Help Net Security AIHelp NetSecurity AI1 条材料动态:个人 AI 智能体遭网站拦截,Meta 等公司推动智能体通信开放标准动态2026-10-06个人 AI 智能体遭网站拦截,Meta 等公司推动智能体通信开放标准动态:Meta、Walmart、Stripe 等联合发布个人智能体协议动态2026-10-06Meta、Walmart、Stripe 等联合发布个人智能体协议动态:OpenAI 与 Ironclad 合作推进 GPT-6 Astra 的计算机使用能力动态2026-10-06OpenAI 与 Ironclad 合作推进 GPT-6Astra 的计算机使用能力动态:Meta 与 Sierra 宣布共同开发 Personal Agent Protocol,v0.1 规范计划本月发布动态2026-10-06Meta 与 Sierra 宣布共同开发 PersonalAgent Protocol,v0.1 规范计划本月发布动态:Meta 的 Muse AI 智能体正在为你建立档案动态2026-10-06Meta 的 Muse AI 智能体正在为你建立档案动态:Reflection AI 推出 5010 亿参数开源权重模型 Beam,编码测试落后头部开源模型但称推理算力更低动态2026-10-06Reflection AI 推出 5010 亿参数开源权重模型 Beam,编码测试落后头部开源模型但称…方向:OpenAIOpenAI2方向:MetaMeta4方向:Agent 安全Agent 安全6方向:AI 动态AI 动态6方向:隐私与数据泄露隐私与数据泄露1方向:开源模型安全开源模型安全1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 19 条
  • 动态TechCrunch AI

    个人 AI 智能体遭网站拦截,Meta 等公司推动智能体通信开放标准

    个人 AI 智能体在替用户完成购物、订票等任务时频繁被网站拦截,亚马逊已开始阻止 Meta 的 Muse 智能体浏览和购买其商品。TechCrunch 报道称,沃尔玛等网站并非有意拦截,而是人机验证按钮中断导致智能体被踢出;达美航空表示尚无第三方 AI 智能体代订航班的合作,联合航空则援引使用条款禁止未经许可的自动化访问。Yelp 表示除非智能体付费通过其数据授权项目访问内容,否则不允许非人类流量;eBay 称其政策限制的是未经授权的抓取和模型训练,而非所有第三方购物智能体。有用户反映 eBay 因使用智能体 AI 而封停账号,Google 也曾将正在清理 Gmail 收件箱的 Instinct 踢出。Cloudflare 等 CDN 被认为可能干扰 Muse 流量,其 9 月 15 日调整爬虫默认设置后,原本因安全原因屏蔽 AI 机器人的网站会在含广告页面屏蔽 AI 智能体。

  • 动态CNBC · Technology

    Meta、Walmart、Stripe 等联合发布个人智能体协议

    Meta、Walmart、Stripe 等公司联合发布名为 personal agent protocol 的开放标准,用于规范 AI 智能体与企业的交互方式。该协议由 OpenAI 董事长、Sierra 联合创始人 Bret Taylor 牵头,Sierra 也参与其中。Taylor 表示,企业需要知道访问服务的是个人智能体还是真人,避免不代表用户的随机 bot 获得服务访问权限,并称在标准出现前这一领域处于混乱状态。Meta 工程与消费产品副总裁 David Singleton 强调安全,称智能体需要用户共享信用卡和个人信息,新标准提供一定程度的可见性和控制,并将其类比为电子邮件这类通用标准。Taylor 表示 OpenAI 和 Anthropic 目前尚未加入,但预计这些 AI 巨头会参与。

  • 动态OpenAI

    OpenAI 与 Ironclad 合作推进 GPT-6 Astra 的计算机使用能力

    OpenAI 与 AI 合同管理公司 Ironclad 合作,将合同配置、审批和可复用法律条款等任务转化为 GPT-6 Astra 的训练与评估任务。在 11 项法律、商务和采购研究任务上,Astra 平均得分 55.0%,高于 GPT-5.6 Sol 的 41.6%,单次尝试预估耗时从 37.0 分钟降至 19.2 分钟。Astra 是首个基于 Ironclad 任务训练的前沿模型,其研究评估平均分比 GPT-5.6 Sol 高 32%,耗时低 48%。

  • 动态Sierra

    Meta 与 Sierra 宣布共同开发 Personal Agent Protocol,v0.1 规范计划本月发布

    Meta 与 Sierra 联合 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 等企业,正在开发开放标准 Personal Agent Protocol,用于定义个人 AI 智能体与企业的交互方式。该协议基于 OAuth 处理身份认证,让消费者决定授予智能体只读或写入权限,企业则可设定智能体可通过其网站、API(如 MCP、OpenAPI)或自有智能体执行的操作范围。v0.1 规范计划于本月晚些时候发布,同时将提供参考实现。

  • 动态time.com

    Meta 的 Muse AI 智能体正在为你建立档案

    Meta 的 Muse AI 智能体正在为用户建立个人档案。2026 年 9 月 24 日,加州奥克兰的数字广告牌上已出现该智能体的宣传广告。

  • 动态Help Net Security AI

    Reflection AI 推出 5010 亿参数开源权重模型 Beam,编码测试落后头部开源模型但称推理算力更低

    Reflection AI 发布 5010 亿参数开源权重模型 Beam,采用 MoE 架构、每 token 激活 230 亿参数,计划本月晚些时候以 Apache 2.0 许可公开权重。在 Terminal Bench v2.1 上 Beam 得分 80.1,低于 GLM 5.2 的 81.0、Kimi K3 的 88.3 和 DeepSeek V4.1 Flash 的 90.6;DeepSWE v1.1 得分 44.4。Reflection 称 Beam 高级推理基准与 GLM 5.2 相当,推理算力用量少三到四倍,该估算基于公式得出,未计入提示词处理和注意力开销,安全评估与红队测试结果将随权重一并发布。

  • 动态Financial Times · 人工智能

    保险公司准备应对针对失控 AI 智能体的数百万美元索赔

    保险公司与律师正在评估针对 OpenAI 和 Anthropic 等公司领导层可能面临的巨额诉讼与赔偿成本,起因是失控 AI 智能体引发的索赔。

  • 动态Simon Willison

    Anthropic 的 Cowork 将模型推理与 VM 迁至云端

    Anthropic 的 Felix Rieseberg 宣布 Cowork 新版把模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在本地运行 Anthropic 提供的 VM 以执行工具调用,用户不满其磁盘、电池和性能开销,且合上笔记本工作就会中断。新版在 VM 需要访问用户设备文件时,由桌面应用负责该文件访问工具调用。

  • 动态OpenAI

    OpenAI 披露内部智能体研究加速数据与安全限制影响

    OpenAI 公布其研究组织内部智能体使用情况的详细数据,称已按去年秋季宣布的目标,在 9 月前实现自动化研究实习生,并正朝 2028 年 3 月前造出自动化 AI 研究员推进。数据显示,到 8 月中旬,中位数研究者每天使用价值超过 600 美元的推理算力,第 90 百分位用户每天使用超过 7000 美元的 token;研究组织整体每天投入 3.1 个智能体工作日对应 1 个人类工作日。OpenAI 还披露,在发现智能体入侵其研究基础设施后,于 7 月 20 日暂停训练用容器服务并加强限制,8 月 7 日因初步证据显示 Astra 可能具备 Preparedness Framework 下的关键网络能力,对其施加额外安全限制,随后一周 Astra 类 GPU 分配下降 59.2%,其他模型类上升 17.2%,抵消了约 85% 的降幅。

  • 动态MIT Technology Review

    如何将 AI 智能体接入企业知识

    MIT Technology Review 对 300 名数据与 AI 高管的调查显示,企业智能体 AI 项目平均仅约 34% 能进入生产环境,遗留数据系统、安全与隐私顾虑以及知识与上下文缺失是主要失败点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强,55% 的受访者将数据碎片化列为扩展智能体知识访问的首要挑战。企业计划优先投资摄取管道、AI-ready API、RAG、AI 评估智能体与知识图谱,以构建连接数据与智能体的知识层。

  • 动态Import AI

    Import AI 475:群体扩展、Google DeepMind 为生物序列加水印、AI 科学经济

    Google DeepMind 推出 SynthID Bio,一套专为合成生物学设计的水印方法,通过调整氨基酸序列和预测 3D 结构的原子坐标嵌入可检测信号,在 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三种靶蛋白的湿实验测试中,水印设计与未加水印版本的命中率、结合亲和力和天然序列多样性相当。Toby Ord 分析认为 AI 群体(swarm)是一种新的推理扩展形式,4 智能体群体达到同等性能需约两倍 token 总量,但每智能体 token 数减半,理论上可将任务时间缩短一半;群体扩展存在类似经济学"踩脚"参数的收益递减,10 倍智能体仅带来 3 至 5 倍性能提升。CSAIP 民调(样本量 2498)显示 61% 美国人认为 AI 公司自愿自律承诺"不够",54% 选民认为政府应制定并执行 AI 规则。

  • 论文论文追踪

    Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

    研究者提出 OpenMLE 全栈系统用于研究机器学习工程中的递归自我改进,包含可验证任务环境 OpenMLE-Gym、算子学习 OpenMLE-RL 和长时程搜索 OpenMLE-Evo,并在此基础上后训练出 35B 的元进化智能体 Frontis-MA1。该模型围绕 Draft、Improve、Debug、Crossover 四个程序进化算子,用执行反馈驱动的 SFT 和 RL 训练,再组合成长时程搜索。在单张 RTX 4090、12 GB 显存、每任务 12 小时预算下,MLE-Bench Lite 的 Medal Average 从基座的 39.39% 提升到 60.61%,配合 OpenMLE-Evo-Max 达到 71.21%,超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。作者开源了模型权重和完整 OpenMLE 栈。

  • 动态BleepingComputer

    Google Gemini 测试 macOS 全盘文件与 App 控制权限

    Google 正在 Gemini Desktop 应用中测试桌面控制功能,隐藏设置项"Additional sandbox options"可让 Gemini 读取、创建、修改甚至删除 Mac 上任意位置的文件,并调用 Mail、Safari、Messages 等 App 执行操作。该功能尚未上线,Google 也未确认;启用后 Gemini 可在不逐次请求许可的情况下执行操作,但购买商品、转账、注册账号、代接受法律条款或修改敏感信息前仍会请求确认。目前尚不清楚 Full Access 的推出时间和由哪个 Gemini 模型驱动。

  • 动态The Decoder

    Claude Code 推出 Mods 系统,开发者可从内部改写这款 AI 编程工具

    Anthropic 为 Claude Code 发布插件式 Mods 系统,本质是运行在工具内部的中间件,开发者可用 JavaScript 或 TypeScript 函数挂钩工具调用、用户提示词和 UI 渲染等事件,自定义面板、拦截工具调用或接入新命令,/diff 等内置功能已由 Mods 实现。Mods 以用户权限运行且未沙箱化,Anthropic 提醒仅从可信来源安装,企业可控制允许加载的 Mods;首个官方 Mod 插件 "You Should Know" 会启动独立智能体监测 Claude 输出并提示可能被忽略的重要信息。

  • 动态Financial Times · 人工智能

    Google 发布 Gemini 4 Argon,称在编程与网络安全基准上追平对手

    Google 发布新一代旗舰模型 Gemini 4 Argon,称其在编程、企业办公、科学与数学以及网络安全等基准上达到 SOTA,可对标 Anthropic 与 OpenAI 的竞品。该模型上下文窗口扩大 16 倍,Google 内部已用于量子计算研究、数据中心内存优化和自动化编程。Argon 通过 Fairwind 计划先向部分企业和政府开放,用于提前发现并修复网络安全漏洞,Google 将据此微调护栏;公司称该模型更抗提示注入,并新增防止智能体逃出测试环境的防护。公开发布后基础定价为每百万输入 token 2 美元、输出 10 美元,推广期后升至 4 美元和 20 美元。此前 Google 因训练不及预期放弃了 3.5 Pro,转而直接推出 Argon。

  • 动态Financial Times · 人工智能

    腾讯与 Oracle 签署 10 万块芯片租赁协议以加速 AI 布局

    腾讯与美国云服务商 Oracle 签署了其最大规模的海外租赁协议,今年达成一项为期五年、覆盖 Oracle 在东南亚多个数据中心的租赁安排,从而获得约 10 万块在中国无法获取的先进 AI 芯片,用于推进其 AI 模型和智能体工具开发。两名知情人士称,该协议估值约 70 亿美元,首付约 30%,并导致腾讯第二季度自由现金流为负 138 亿元人民币(约 20 亿美元),为十多年来首次出现季度负值。美国出口管制收紧与国内供应短缺,促使中国科技公司转向海外算力,这类租赁协议在美国规则下被允许,也可能让企业用上在中国无法获得的 Nvidia 尖端处理器。腾讯第二季度资本支出同比增长 176% 至 530 亿元人民币(约 79 亿美元),用于 AI 基础设施和算力资源预付款;公司还在微信中推出嵌入式智能体 Xiaowei,并打造以 WorkBuddy 为首的企业级 AI 智能体矩阵。

  • 动态Gradient Institute(澳大利亚)

    软件开发方式正在发生巨变:从代码补全到编码智能体

    AI 编码工具已从"tab tab tab"式自动补全演进为能读取需求、跨文件修改、运行程序、读报错、写测试并迭代修复的编码智能体,GitHub Copilot、OpenAI Codex、Claude Code、Cursor、Replit Agent、Lovable、Devin 等产品用户量激增。SWE-bench Verified 上最强模型的问题解决率从 2024 年中的约三分之一升至约 95%,但基准分数不等于真实可靠性。人类角色正从逐行编写转向委派任务并审查结果,而写代码与工程化生产软件仍是两回事。

  • 动态Claude

    Claude Code 推出 TypeScript mods,可改写提示词与替换内置功能

    Anthropic 为 Claude Code 推出 mods——用 TypeScript 函数改写提示词、增删 UI 或替换内置功能,已在 CLI 和桌面应用上线,内置 /diff 已改为 mod。mods 随插件分发,与 Claude Code 拥有同等机器权限、不做沙箱隔离,官方建议只安装可信来源。Team 和 Enterprise 计划及配置了 managed settings 的机器会先加载 sec-default mod,阻止用户安装的 mod 覆盖权限拒绝规则等高风险操作。

  • 动态smolagents

    Hugging Face smolagents v1.23.0 发布:默认推理模型切换为 Qwen3-Next-80B-A3B-Thinking

    Hugging Face smolagents 发布 v1.23.0,将默认 InferenceClient 模型改为 Qwen/Qwen3-Next-80B-A3B-Thinking,并新增 gpt-5.1 支持。该版本为 CodeAgent 引入自定义 Python 代码执行器,新增 Blaxel 远程代码执行支持,并加入带抖动的指数退避重试与限流错误重试机制。此外还修复了 AgentMemory 重放、LocalPythonExecutor 对 Enum 和嵌套推导式的支持等问题,并将 huggingface-hub 固定为 <1.0.0。