跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 490 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究603细分与主体7来源:Failure-FirstFailure-First6 条材料动态:ABot-C0 四足机器人行为基础模型技术报告动态2026-08-23ABot-C0 四足机器人行为基础模型技术报告动态:LulzBench 实测:MiniMax-M3 拒绝五分之一良性底线对照请求动态2026-08-25LulzBench 实测:MiniMax-M3 拒绝五分之一良性底线对照请求动态:Harness VLA:将冻结的 VLA 通过记忆引导智能体改造为可靠操作基元动态2026-08-26Harness VLA:将冻结的 VLA 通过记忆引导智能体改造为可靠操作基元动态:机器人系统集成端侧语音识别模型的调查:从云端 API 转向本地化动态2026-08-31机器人系统集成端侧语音识别模型的调查:从云端 API 转向本地化动态:ATACOM-DC:面向高效探索的安全强化学习方向约束动态2026-09-02ATACOM-DC:面向高效探索的安全强化学习方向约束动态:MAMMOTH:面向越野移动、容忍缺失模态的多模态端到端策略动态2026-09-03MAMMOTH:面向越野移动、容忍缺失模态的多模态端到端策略方向:防御与护栏防御与护栏1方向:安全评测安全评测1方向:其他方向其他方向2方向:工具与开源工具与开源6方向:Agent 安全Agent 安全2方向:MetaMeta1方向:对齐对齐1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。3 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Failure-First

    ABot-C0 四足机器人行为基础模型技术报告

    ABot-C0 是为四足机器人设计的"行为基础模型"(BFM),通过合成 3508 小时运动数据的"数据金字塔"引擎筛选出 16,074 段物理可行运动片段共 22.43 小时,并发现了首个四足运动跟踪的数据缩放定律——随训练数据增加持续降低 seen-unseen gap。 该流程将视频转为三维轨迹:先用 DINOv2 特征的身份一致性损失微调 Wan2.2 保证刚体外观稳定,再经语义(CLIP)、几何(重投影误差)、物理可行性三道过滤门槛剔除失败动作,其中超过 7000 段来自 Video-to-Motion 生成的杂技类行为。

  • 动态Failure-First

    LulzBench 实测:MiniMax-M3 拒绝五分之一良性底线对照请求

    Failure-First 公布的首批托管样例中,MiniMax-M3 经托管的 OpenAI 兼容端点运行 LulzBench 全部 21 项良性底线对照,捕获 21/21、无供应商报错,其中 4 项遭拒答且均为真实的带理由拒答,三项涉及轻度恶习或社交劝说前提。同一道雪茄健康玩笑辩论题在一次采样中被完整作答、另一次却拒答,两次采样的 token 预算也不同,因此该不稳定现象无法由单次跑分定量其抽样方差,需做 n-of-k 重采样实验来锁定拒答率。

  • 动态Failure-First

    Harness VLA:将冻结的 VLA 通过记忆引导智能体改造为可靠操作基元

    Harness VLA 提出三层架构,把认知编排从底层执行中隔离出来,缓解端到端 VLA 模型在长程组合与环境扰动下的级联失败。该框架由高层规划智能体、固定基元库和两个记忆模块组成,其中 VLA_ACT 调用冻结的 VLA 处理接触密集行为,确定性解析基元负责移动与姿态调整。在 LIBERO-Pro 上取得 82.4% 成功率,较 RATS 基线提升 38.6 个百分点;RoboCasa365 上比 RLDX-1 高 25.4 个百分点;RoboTwin C2R 零样本迁移成功率为 58.4%。

  • 动态Failure-First

    机器人系统集成端侧语音识别模型的调查:从云端 API 转向本地化

    针对现代人机交互中云端 ASR API 带来的延迟、隐私与可靠性风险,Li 等人的 2026 年综述梳理了将语音识别迁移到机器人的端侧方案,并以“失败优先”视角指出上游误识别会沿感知管线传播并引发下游具身行动失效。文中对比了 OpenAI Whisper(68 万小时数据)、CMU OWSM v3.1 与 OWSM-CTC、Meta MMS(覆盖超 1000 种语言)及 Julius 等语音基础模型,以及 Kaldi、ESPnet、SpeechBrain 生态中的 LibriSpeech、CommonVoice、Gigaspeech 数据集。

  • 动态Failure-First

    ATACOM-DC:面向高效探索的安全强化学习方向约束

    Magliano 等人提出 ATACOM-DC,通过只在动作朝违反约束方向发展时才施加投影的方向性约束,缓解现有安全过滤器的策略停滞问题。该方法依据约束导数符号筛选活跃集,仅对有负向风险的动作做缩放,放行远离边界的动作。在 KUKA iiwa 气垫球、平面机械臂和气动四旋翼三个仿真环境中取得帕累托占优表现,同时维持安全性。

  • 动态Failure-First

    MAMMOTH:面向越野移动、容忍缺失模态的多模态端到端策略

    Kotian 等人提出 MAMMOTH——一套融合 RGB、热成像 LWIR、3D LiDAR 与自车速度的统一端到端导航策略,通过稀疏 MoE 骨干加 Laplace 门控动态加权各模态,并用随机丢弃传感器 token 的 Modality Dropout 训练强制学习跨模态表征,从而在单一通道失效时不致整体崩溃。该策略还引入基于 IMU Z 轴加速度功率谱密度的内在可通过性启发式,配合条件 DDPM 生成的候选轨迹做安全性重排序。

  • 动态Failure-First

    EgoRecovery:通过人类恢复示范获取机器人失败恢复能力的协同训练框架

    Ge 等人提出 EgoRecovery 协同训练框架,用自我中心视角的人类视频教机器人从失败中恢复,而非模仿完美轨迹。该方法共享的是经空间范数处理后的 DCT 低频基向量(K=4)所表示的粗粒度"纠正意图",方向无关,由机器人自行学习执行方向与控制指令,从而绕开人机具身差异。基于头戴与腕戴相机采集的数据收集速度比遥操作快 10.5x。真机上仅用 50 条机器人与 300 条人类数据的四类任务平均恢复成功率达 85%,纯机器人基线为 52.5%;去掉 Stop Gradient 会使初始成功率从 80% 降至 70%。

  • 动态Failure-First

    ReferTrack:具身视觉跟踪中先用显式指向再解码路径

    针对当前 Vision-Language-Action(VLA)模型的抽象空间隐变量难以监督、失败原因无法归因的问题,研究者提出 ReferTrack,将具身视觉跟踪拆解为先从候选目录中用单个 Refer-CoT token 选出目标索引、再由 TVBI token 维持目标的显式流程。该框架基于 Qwen3-4B,搭配 YOLO11 加 ByteTrack 检测器和 SigLIP/DINOv2 双编码器,仅用单目前视摄像头就在 EVT-Bench 取得 SOTA:Single-Target Tracking 成功率 89.4%、Distracted Tracking 73.3%。

  • 动态Failure-First

    RL-MACRO:部分可观测下颅骨切开机器人自主磨骨的多模态自适应控制

    Zhang 等人提出 RL-MACRO,一套基于离线强化学习的闭环控制框架,通过融合力与声音信号重建无法直测的工具—组织界面状态,实现颅骨切开术中安全的自主磨骨。该系统用因果 1D-CNN 加 LSTM 从 6-DOF 测力计与麦克风估计温升 ΔT,并用隐式 Q-learning(IQL)驱动切割深度与进给转速的双头策略,避免在线试错风险。在未见样本上温度预测的决定系数 R² 达 0.939,平均绝对误差 1.717°C,牛肋铣削实验进一步模拟皮质骨与松质骨的层间过渡。

  • 动态CAIS

    CAIS 与 Scale AI 发布 Remote Labor Index,衡量 AI 对真实工作的自动化程度

    Center for AI Safety(CAIS)与 Scale AI 发布 Remote Labor Index(RLI),用于测试 AI 能否自动化真实经济中的各类计算机工作项目,覆盖建筑、产品设计、电子游戏开发等职业。RLI 是首个从真实经济中收集计算机工作项目的基准,此前的基准多衡量孤立专门任务上的能力,无法反映 AI 对经济的影响。结果显示当前 AI 智能体只能完全自动化极少数工作项目,最强智能体在 RLI 上的自动化率仅为 2.5%,但呈稳步提升趋势。

  • 动态CAIS

    AI Safety Newsletter #66:评估前沿模型、Gemini 3 Pro 与 Claude Opus 4.5 登场、联邦抢占州级 AI 立法卷土重来

    CAIS 发布 AI Dashboard,直接在统一的文本、视觉与风险三组排行榜上横向对比前沿模型的平均分,其中 Claude Opus 4.5 在最安全的六项高风险行为测试中取得最低均分 33.6(0–100,越低越安全)。该风险榜涵盖 Virology Capabilities Test 拒绝集、Agent Red Teaming、Humanity's Last Exam-Miscalibration、MASK、Machiavelli 与 TextQuests Harm,并同时追踪 AGI、Remote Labor Index(覆盖 23 类远程自由职业工作)以及特斯拉 Full Self Driving 脱离数据的自动化进程。

  • 动态NVIDIA garak 版本发布

    NVIDIA garak v0.13.0 发布:新增 Leet 编码攻击插件与对话支持

    NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。

  • 动态NVIDIA garak 版本发布

    NVIDIA garak v0.13.1 发布:新增多种探针插件并改进检测器配置

    NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。

  • 动态DeepMind Safety Research

    Google DeepMind 推出 AGI 安全短期课程

    Google DeepMind 发布了面向学生、研究人员和相关从业者的 AGI 安全短期课程,总时长 75 分钟,由录制讲座和练习组成,并配有幻灯片和练习手册。课程涵盖 AI 对齐问题及技术与治理层面的应对思路,内容包括刻意规划带来的风险、规格博弈与目标错误泛化两种错位目标来源、知情监督原则以及危险能力评估等前沿安全实践。若想进一步参与该方向工作,研究科学家与研究工程师岗位申请开放至 2 月 28 日。

  • 动态MITRE ATLAS 数据发布

    MITRE ATLAS 发布 v5.4.0,新增 AI Agent 攻击技术与案例研究

    MITRE ATLAS 发布 v5.4.0,新增多项针对 AI Agent 的攻击技术,包括发布被投毒的 AI Agent 工具、从 Agent 逃逸到宿主机、利用漏洞获取凭据、利用漏洞规避防御,以及 AI Agent 用户执行类的被投毒工具与恶意链接。该版本还更新了修改 AI Agent 配置这一既有技术。案例研究方面新增了暴露的 ClawdBot 控制接口导致凭据访问与执行、通过被投毒 ClawdBot 技能实施供应链入侵、OpenClaw 一键远程代码执行,以及通过提示注入对 OpenClaw 实施命令与控制。

  • 动态MITRE ATLAS 数据发布

    MITRE ATLAS 发布 v5.5.0,新增 AI Agent 工具投毒与供应链攻击技术

    MITRE ATLAS 发布 v5.5.0 版本,新增多项攻击技术与案例研究。新增技术包括 AI Agent Tool Poisoning、AI Supply Chain Rug Pull。

  • 动态Google Threat Intelligence

    Google Cloud Run 无认证公开函数的安全风险与加固指南

    Mandiant 安全评估发现大量缺乏认证的公网暴露 serverless 应用,Cloud Run 服务若含第三方依赖易遭本地文件包含(LFI)、远程文件包含及命令注入攻击,成功利用可获得容器实例完整控制权并进一步横向移动接管云环境。该博客基于客户实战经验梳理攻击场景,针对必须公网开放的 Google Cloud Run 服务和函数给出一组加固建议,相关原则同样适用于任意公有 serverless 部署。

  • 动态Google Security

    Google 推出 OSS Rebuild:重建上游制品以加固开源软件供应链

    Google 开源安全团队(GOSST)发布 OSS Rebuild,通过重新执行并比对上游构建来增强开源软件包的信任度。该项目自动推导 PyPI、npm 和 Crates.io 现有软件包的声明式构建定义,并为其中数以千计的流行包签发满足 SLSA Build Level 3 要求的溯源证明,无需维护者介入。它还能检测源码缺失、构建环境遭入侵以及隐蔽后门三类供应链风险,并提供基础设施定义供企业自行运行实例。

  • 动态Google Security

    Google 联合 Airbus 在 DEF CON 33 举办 GenSec CTF,加速 AI 网络安全应用

    Google 隐私、安全与安保团队联合 Airbus 在 DEF CON 33 举办了聚焦人机协作的 GenSec Capture the Flag(CTF)。近 500 名参与者完成了入门挑战,其中 23% 的人首次将 AI 用于网络安全工作流,85% 的参与者认为该活动有助于了解 AI 在安全工作流中的应用方式。活动中还提供实验性的网络安全 AI——Sec-Gemini 作为可选助手,77% 的受访者表示它对自己解决挑战“很有帮助”或“极有帮助”。

  • 动态AWS Security

    AWS 用 Strands Agents SDK 把 Bedrock Guardrails 扩展到工具交互

    AWS 发布实践指南,用 Strands Agents SDK 的生命周期钩子把 Amazon Bedrock Guardrails 从模型边界扩展到工具边界,在三个信任边界设置校验检查点。Checkpoint 1 用 BeforeInvocationEvent 在模型推理或工具执行前校验用户输入、其他 Agent 数据、MCP 工具服务器和 RAG 管道内容;Checkpoint 2 用 BeforeToolCallEvent 在工具执行前检查模型即将传入的参数,这是模型级护栏覆盖不到的缺口;Checkpoint 3 用 AfterToolCallEvent 在结果返回用户或下游系统前校验工具输出,尤其针对抓取外部网页的搜索工具。

  • 动态Help Net Security AI

    2026 年 9 月最热门的开源网络安全工具

    2026 年 9 月值得关注的开源安全工具包括:Sift 可在本地磁盘、Windows 文件共享、Active Directory、SharePoint、OneDrive、Teams、Slack、Jira 和 Confluence 中扫描密码与 API key;ToolHive 以 Apache 2.0 许可在容器内运行 MCP server;腾讯朱雀实验室的 AI-Infra-Guard 可识别 Ollama、vLLM、ComfyUI 等服务,比对 1,600 多个已知 CVE,并检查 MCP server 与 agent 技能、对目标模型做越狱评估。

  • 动态Help Net Security AI

    GitHub 的 AI 智能体在 Android 应用中发现 24 个漏洞

    GitHub Security Lab 研究员 Kevin Stubbings 在实验室开源 Taskflow Agent 之上构建了面向移动应用的 AI 审计工作流 taskflows,用其发现并报告了 Android 应用中的 20 多个漏洞。

  • 动态Trail of Bits

    Trail of Bits 发布 gosentry,为 Go 原生 fuzz 接口引入 LibAFL 级模糊测试

    Trail of Bits 发布 gosentry,一个面向模糊测试的 Go 工具链分支,保留标准 testing.F 工作流,底层默认改用 LibAFL 引擎。它支持原生 fuzz struct 等复合类型、通过 Nautilus 做基于语法的模糊测试,并新增整数溢出、数据竞争、goroutine 泄漏和执行超时等缺陷类别的检测,还能用一条命令生成覆盖率报告。已有 Go fuzz harness 无需重写,只需指向 gosentry 的二进制并加上 --catch-races、--catch-leaks 等新参数。

  • 动态Trail of Bits

    Trail of Bits 为 zizmor 补全 YAML 锚点支持

    Trail of Bits 与 zizmor 维护者合作三个月,为这款 GitHub Actions 静态分析器补全 YAML 锚点支持,共提交 20 个 issue、15 个合并 PR。团队修复了序列中别名被错误展平、锚点前缀泄漏进值、重复锚点导致崩溃、模板注入审计在别名 run 值上崩溃四类锚点 bug,并新增集成测试与文档更新。验证基于 6,612 个高价值开源仓库的 41,253 个 workflow 文件,其中仅 43 个使用锚点,zizmor 最初在 45 个 workflow 上崩溃。