跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 322 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究603细分与主体7来源:Google DeepMindGoogle DeepMind3 条材料来源:Embrace The RedEmbrace The Red2 条材料来源:Transformer CircuitsTransformerCircuits1 条材料动态:Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash动态2026-06-30Google DeepMind 发布 Nano Banana 2Lite 图像模型与 Gemini Omni Flash动态:Google DeepMind 发布 Gemini Robotics 2,带来机器人全身智能动态2026-07-28Google DeepMind 发布 GeminiRobotics 2,带来机器人全身智能动态:Google DeepMind 发布 Gemini Robotics ER 2,升级视频理解、任务编排与多机器人协作动态2026-07-30Google DeepMind 发布 GeminiRobotics ER 2,升级视频理解、任务编排…动态:用 MCP Server 托管 COM 服务器实现 Windows 与 Office 自动化动态2025-06-09用 MCP Server 托管 COM 服务器实现Windows 与 Office 自动化动态:Embrace The Red 宣布 2025 年 AI 漏洞月,将披露 20 余篇编码 Agent 漏洞动态2025-07-28Embrace The Red 宣布 2025 年 AI 漏洞月,将披露 20 余篇编码 Agent 漏洞动态:Anthropic 的可解释性基础设施 Garçon动态2021-12-22Anthropic 的可解释性基础设施 Garçon方向:Google DeepMindGoogleDeepMind4方向:工具与开源工具与开源5方向:Agent 安全Agent 安全4方向:MicrosoftMicrosoft2方向:红队红队2方向:AnthropicAnthropic3方向:其他方向其他方向2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。4 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Google DeepMind

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash

    Google DeepMind 面向开发者推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。前者主打速度与成本,文本生图延迟 4 秒、$0.034/1K 分辨率图像,建议替代 gemini-2.5-flash-image;后者原生支持文本、图像、视频输入的对话式视频编辑,两者均已在 Google AI Studio、Gemini API 提供,Omni Flash 处于公开预览阶段并同步登陆 Gemini App 与 Google Flow。

  • 动态Google DeepMind

    Google DeepMind 发布 Gemini Robotics 2,带来机器人全身智能

    Google DeepMind 推出 Gemini Robotics 2,作为新一代机器人的智能层,实现全身控制、高级灵巧操作和多机协作。该系列含三款模型:视觉-语言-行动模型 Gemini Robotics 2 可控制从脚到指尖的人形及双臂机器人,具身推理模型 Gemini Robotics ER 2 负责规划数分钟的多步任务并让人机沟通,端侧模型 Gemini Robotics On-Device 2 可在设备本地运行并在几小时内适应全新机体。其中 ER 2 已在 Google AI Studio 开放,并于 Gemini Enterprise Agent Platform 私人预览,另两款面向早期访问伙伴。

  • 动态Google DeepMind

    Google DeepMind 发布 Gemini Robotics ER 2,升级视频理解、任务编排与多机器人协作

    Google DeepMind 发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑负责对话、物理世界理解和多步任务规划,并将电机执行交给底层 VLA 模型。相比 ER 1.6,它在实时 VLA、仿真 VLA 和人类遥操作三种模式下均提升了工具编排表现,进度分类准确率达 57.4%,并新增连续视频流下的进度追踪和多机器人协作。该模型通过 Gemini API、Google AI Studio 公开提供给开发者,并在 Gemini Enterprise Agent Platform 私有预览,集成 Gemini Live API 的双向流式端点以减少延迟停顿。

  • 动态Embrace The Red

    用 MCP Server 托管 COM 服务器实现 Windows 与 Office 自动化

    有人基于 Model Context Protocol(MCP)开发了一个名为 mcp-com-server 的原型服务器,通过动态发现方式实例化并托管任意 COM 对象,从而驱动 Windows 与 Office 自动化。该服务器提供类似 COM 的工具集——CreateObject、Get/Set Property、InvokeMethod、QueryInterface 以及列出当前所有活动服务器的接口,连接 Claude 后可创建、打开、编辑并保存 Excel 文件,再调用 Outlook 发送邮件,甚至能唤起 Internet Explorer。

  • 动态Embrace The Red

    Embrace The Red 宣布 2025 年 AI 漏洞月,将披露 20 余篇编码 Agent 漏洞

    安全研究者 Johann Rehberger 宣布启动 2025 年 AI 漏洞月(Month of AI Bugs),8 月将在其博客发布 20 余篇针对主流智能体系统的漏洞分析,重点聚焦 AI 编码 Agent。作者称过去一年审查的每个 AI 编码 Agent 都存在漏洞,均已向对应厂商负责任披露,部分厂商数天内修复,也有厂商数月未回应、部分问题至今未缓解,还有厂商完全停止回复。

  • 动态Transformer Circuits

    Anthropic 的可解释性基础设施 Garçon

    Anthropic 为其机制可解释性研究搭建了一套名为 Garçon 的基础设施,可在跨节点的大规模 Transformer 模型上进行激活读取、组件消融与梯度回传实验。它通过启动服务器并连接远程模型的接口运行前向传播,暴露一组 probe points,允许挂载探针函数访问或修改内部张量,并以云 pickle 传输任意 Python 对象到服务端执行。

  • 动态Transformer Circuits

    Anthropic 发布 PySvelte:连接 Python 深度学习与 Svelte 可视化的库

    Anthropic 发布 PySvelte,一个用于将基于 Svelte 和 Web 标准的自定义可视化接入 Python 深度学习工作流的库。它让 src/ 目录下的 Svelte 组件自动以 pysvelte.Hello() 形式在 Python 中可用,支持 NumPy 数组传入、组件相加成页面,并可通过 .publish() 发布到 GCS/S3/AZ 等存储分享。该库声明完全不提供支持,许多功能需用户自行编写 config.py 才能使用。

  • 动态Transformer Circuits

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates,梳理机制可解释性当前面临的五个主要障碍:缺失特征、跨层叠加、注意力叠加、干扰权重与宏观理解。团队认为叠加问题已有显著进展,但可能只能提取到一小部分特征,大量稀有特征或成为神经网络中的暗物质。文章还重新界定线性表示,区分特征是否一维与特征是否在数学上线性,并讨论多维特征的几何约束。在注意力透视表方面,团队复现了单层 Transformer 的 skip-trigram 结果,报告约 25–75% 可解释条目,并建议对低于约 10% 的表格保持怀疑。

  • 动态Failure-First

    NavIsaacLab:面向人类感知导航基准的高保真人群仿真框架

    NavIsaacLab 通过并行机器人学习生成逼真人群,为人机共存环境中的“人类感知”导航提供高保真基准。该框架基于 NVIDIA Isaac Lab 实现 GPU 并行仿真,将行人建模为由 SMPL 驱动的关节级物理智能体,并用轨迹扩散模型加 AMP 替代手写规则。它针对现有模拟器低物理保真度、简化行人建模和缺乏并行化三大缺陷设计,配套标准化基准从亲密度和社会规范维度评估策略。

  • 动态Failure-First

    ActiveVital:面向家庭医疗机器人的几何感知嵌入式生命体征监测

    ActiveVital 将毫米波雷达的生命体征监测从被动信号恢复重构为主动闭环几何调节问题,通过视觉引导定位胸部并调整传感器位姿来缓解角度失配导致的 cosθ 衰减。该系统基于 ViTPose 提取肩髋四个躯干关键点插值计算胸感测锚点,并用带容差阈值的二值控制律抑制机器人振荡。在 Galaxea R1 Lite 机器人与 60 GHz FMCW 雷达上的实验显示心率 MAE 由仅接近式传感的 5.26 bpm 降至 2.22 bpm,但仍不及协作静态传感的 1.66 bpm,且未报告显著性检验。

  • 动态Failure-First

    Failure-First AI 安全日报:Google DeepMind 三天内连发两款机器人模型

    Google DeepMind 于 7 月 28 日和 30 日先后发布 Gemini Robotics 2 与 Gemini Robotics ER 2,前者主打全身智能,后者新增视频理解、任务编排和多机协作,均为厂商公告且无公开对抗评估。同期 OpenAI 发布了涉及自身模型的第三方网络能力评估说明。两篇待关注预印本分别提出自动提示注入红队的智能体系统与恶意微调的梯度免疫防护。

  • 动态Failure-First

    ASPIRE:面向机器人学的智能体技能自主发现框架

    ASPIRE(Agentic Skill Programming through Iterative Robot Exploration)通过逐图元的执行轨迹诊断实现机器人故障定位与自动修补,基于开源 CaP-X 框架和 MuJoCo Playground 仿真器运行。该方法将每次失败转化为持久化技能库中的可复用策略,并配合进化搜索避免陷入局部修复循环。在 LIBERO-Pro 扰动鲁棒性测试中成功率达 72%,较基线 CaP-Agent0 的 18% 高出最高 77 个百分点,并在 Robosuite 双手交接任务取得 92%、BEHAVIOR-1K 长程操作取得 88%。

  • 动态Failure-First

    LeCropFollow:面向非结构化农田导航的潜在空间规划

    Tommaselli 等人提出视觉导航框架 LeCropFollow,绕过传统几何管线将高维视觉压缩为单像素行参照的做法,改为在学习到的潜在流形中做规划并原生保留热力图离散度作为不确定性度量。该框架由自监督语义热图提取器 RowFollowNet(ResNet-18,输出 56x80x3 的张量表示消失点、左行、右行)与基于 TD-MPC2 的 MBRL 规划器组成,通过 MPPI 采样 N=256 条候选动作序列并在潜在空间中用世界模型和价值函数评估。

  • 动态Failure-First

    分布式多机器人月球货物运输:基于相位分解强化学习的研究

    针对共享负载导致闭运动学链耦合的多机器人月球货运难题,研究者提出相位分解强化学习框架,将任务拆分为举升、运输、放置三个独立的马尔可夫决策过程分别优化策略,并用离散模式变量做指示函数门控切换阶段。单一集中式基线策略在 7.5×10⁴ 时间步的训练中始终无法收敛,平均奖励剧烈震荡且机器人在前进的同时执行举放动作导致货物掉落。该方法还引入确定性关节同步层作为物理安全钳制,把底层指令约束在以实时状态为中心的可行域内以避免内部应力。

  • 动态Failure-First

    Localized LoRA-MoE:块级低秩专家与自适应路由

    Barazandeh 等人提出 Localized LoRA-MoE,将空间分块与动态上下文条件路由融合,缓解标准 LoRA 在多任务流下的梯度冲突问题。该框架通过局部化更新和动态门控建立 Gradient Firewall,避免适配器权重坍缩为非特化的平均值。Cell-Wise 变体在高维仿真中较全局路由方案取得 +11.48% 的 R² 绝对提升,仅增加 96 个参数;California Housing 表格基准上 Block-Wise(99.65%)与 Cell-Wise(99.51%)达到近乎持平的表现,分别仅有 260 和 272 个可训练参数。

  • 动态Failure-First

    ABot-C0 四足机器人行为基础模型技术报告

    ABot-C0 是为四足机器人设计的"行为基础模型"(BFM),通过合成 3508 小时运动数据的"数据金字塔"引擎筛选出 16,074 段物理可行运动片段共 22.43 小时,并发现了首个四足运动跟踪的数据缩放定律——随训练数据增加持续降低 seen-unseen gap。 该流程将视频转为三维轨迹:先用 DINOv2 特征的身份一致性损失微调 Wan2.2 保证刚体外观稳定,再经语义(CLIP)、几何(重投影误差)、物理可行性三道过滤门槛剔除失败动作,其中超过 7000 段来自 Video-to-Motion 生成的杂技类行为。

  • 动态Failure-First

    Harness VLA:将冻结的 VLA 通过记忆引导智能体改造为可靠操作基元

    Harness VLA 提出三层架构,把认知编排从底层执行中隔离出来,缓解端到端 VLA 模型在长程组合与环境扰动下的级联失败。该框架由高层规划智能体、固定基元库和两个记忆模块组成,其中 VLA_ACT 调用冻结的 VLA 处理接触密集行为,确定性解析基元负责移动与姿态调整。在 LIBERO-Pro 上取得 82.4% 成功率,较 RATS 基线提升 38.6 个百分点;RoboCasa365 上比 RLDX-1 高 25.4 个百分点;RoboTwin C2R 零样本迁移成功率为 58.4%。

  • 动态Failure-First

    机器人系统集成端侧语音识别模型的调查:从云端 API 转向本地化

    针对现代人机交互中云端 ASR API 带来的延迟、隐私与可靠性风险,Li 等人的 2026 年综述梳理了将语音识别迁移到机器人的端侧方案,并以“失败优先”视角指出上游误识别会沿感知管线传播并引发下游具身行动失效。文中对比了 OpenAI Whisper(68 万小时数据)、CMU OWSM v3.1 与 OWSM-CTC、Meta MMS(覆盖超 1000 种语言)及 Julius 等语音基础模型,以及 Kaldi、ESPnet、SpeechBrain 生态中的 LibriSpeech、CommonVoice、Gigaspeech 数据集。

  • 动态Failure-First

    ATACOM-DC:面向高效探索的安全强化学习方向约束

    Magliano 等人提出 ATACOM-DC,通过只在动作朝违反约束方向发展时才施加投影的方向性约束,缓解现有安全过滤器的策略停滞问题。该方法依据约束导数符号筛选活跃集,仅对有负向风险的动作做缩放,放行远离边界的动作。在 KUKA iiwa 气垫球、平面机械臂和气动四旋翼三个仿真环境中取得帕累托占优表现,同时维持安全性。

  • 动态Failure-First

    MAMMOTH:面向越野移动、容忍缺失模态的多模态端到端策略

    Kotian 等人提出 MAMMOTH——一套融合 RGB、热成像 LWIR、3D LiDAR 与自车速度的统一端到端导航策略,通过稀疏 MoE 骨干加 Laplace 门控动态加权各模态,并用随机丢弃传感器 token 的 Modality Dropout 训练强制学习跨模态表征,从而在单一通道失效时不致整体崩溃。该策略还引入基于 IMU Z 轴加速度功率谱密度的内在可通过性启发式,配合条件 DDPM 生成的候选轨迹做安全性重排序。

  • 动态Failure-First

    StratMamba:面向路径高效 LiDAR 避障的战略—反应双流状态划分

    Wu 等人提出 StratMamba,通过将基于 Mamba 模型的隐藏状态拆分为快衰减的近距流与慢衰减的目标流来避免高频 LiDAR 噪声污染长期目标记忆,并在仿真中取得最低超时率 0.4%、最高路径效率 0.915,同时比 LSTM 和 Transformer 基线收敛快 1.5x。该架构的门控与融合权重矩阵采用零初始化,使训练初期行为等同于原生 Mamba,再逐步学习纠正信号而不破坏初始策略。速度平滑度 SPARC −3.550、加速度平滑度 LDLJ −8.180 均优于对照,且优势覆盖序列长度 L=3 到 L=12。

  • 动态Failure-First

    EgoRecovery:通过人类恢复示范获取机器人失败恢复能力的协同训练框架

    Ge 等人提出 EgoRecovery 协同训练框架,用自我中心视角的人类视频教机器人从失败中恢复,而非模仿完美轨迹。该方法共享的是经空间范数处理后的 DCT 低频基向量(K=4)所表示的粗粒度"纠正意图",方向无关,由机器人自行学习执行方向与控制指令,从而绕开人机具身差异。基于头戴与腕戴相机采集的数据收集速度比遥操作快 10.5x。真机上仅用 50 条机器人与 300 条人类数据的四类任务平均恢复成功率达 85%,纯机器人基线为 52.5%;去掉 Stop Gradient 会使初始成功率从 80% 降至 70%。

  • 动态Failure-First

    ReferTrack:具身视觉跟踪中先用显式指向再解码路径

    针对当前 Vision-Language-Action(VLA)模型的抽象空间隐变量难以监督、失败原因无法归因的问题,研究者提出 ReferTrack,将具身视觉跟踪拆解为先从候选目录中用单个 Refer-CoT token 选出目标索引、再由 TVBI token 维持目标的显式流程。该框架基于 Qwen3-4B,搭配 YOLO11 加 ByteTrack 检测器和 SigLIP/DINOv2 双编码器,仅用单目前视摄像头就在 EVT-Bench 取得 SOTA:Single-Target Tracking 成功率 89.4%、Distracted Tracking 73.3%。

  • 动态Failure-First

    RL-MACRO:部分可观测下颅骨切开机器人自主磨骨的多模态自适应控制

    Zhang 等人提出 RL-MACRO,一套基于离线强化学习的闭环控制框架,通过融合力与声音信号重建无法直测的工具—组织界面状态,实现颅骨切开术中安全的自主磨骨。该系统用因果 1D-CNN 加 LSTM 从 6-DOF 测力计与麦克风估计温升 ΔT,并用隐式 Q-learning(IQL)驱动切割深度与进给转速的双头策略,避免在线试错风险。在未见样本上温度预测的决定系数 R² 达 0.939,平均绝对误差 1.717°C,牛肋铣削实验进一步模拟皮质骨与松质骨的层间过渡。