跳到正文
10月10日 · 周六

全部论文

找到 60 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.09683

    System Switch 研究:快速决策模型何时应交由推理模型思考

    提出 System Switch,让快决策模型仅在门控打开时询问推理模型

    发表
    场景
    AI Agent
    被测模型
    Laya, typed-decisions、Laya, base、Kev 9B 等 12 个
    摘要作者称快模型应按敏感度选。

    System Switch在不暂停的 Doom 里,让快的 typed-decision 模型做每一次决策,只在门控打开时把控制交给视觉推理模型。

    深度解读完整解读
  2. 其他arXiv 2610.08917

    CARE:为视觉-语言-动作模型推理加速提供认证式选择

    提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选

    发表
    被测模型
    OpenVLA-OFT、π0.5、π0 等 5 个
    摘要CARE 以配对回合认证加速诱发失败,在预算内选最快候选,不足则保留参考。

    CARE 在部署前从加速配置中选出最快、且加速诱发失败风险能被有限样本认证为低于用户预算的候选。证据不足就保留全计算参考策略。

    深度解读完整解读
  3. 其他arXiv 2610.08364

    Transect:为长程 LLM Agent 评测保留可观测性的开源工具

    提出 Transect,将长程 Agent 评测转录对齐到可回查的共享时间线

    发表
    场景
    AI Agent
    被测模型
    Claude-Opus-4.7
    摘要Transect 把长转录收成可回查报告,案例中文稿与自审占主要 token。

    Transect 是基于 Inspect Scout 的转录分析包,用来在长程智能体评估里保住可回查的过程账户。

    深度解读完整解读
  4. 其他arXiv 2610.07386

    NetAgent:面向多任务网络流量分析的智能体框架

    提出 NetAgent,编排工具完成多任务网络流量分析

    发表
    场景
    AI Agent
    摘要NetAgent 编排工具做多任务流量分析。

    NetAgent 是一个多任务网络流量分析智能体框架。作者要让分析员用自然语言把分类、隧道检测和主机研判串成可重规划的工作流,而不为每个任务单独训练一个模型。

    深度解读完整解读
  5. 其他arXiv 2610.06563

    HERA 提出 harness 与环境协同演化

    提出 HERA,协同演化 harness 与环境以提升 Agent 拒答准确性

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6-Luna、GPT-5.6-Terra、GPT-5.6-Sol 等 20 个
    摘要HERA 用失败协同演化 harness 与环境,并在迁移评测中提高 Abstain。

    HERA 在模型权重固定时,让 harness 与可执行环境按失败协同演化,以改进 agentic abstention。

    深度解读完整解读
  6. 其他arXiv 2610.05689

    研究者提出用可逆神经网络为 AI 控制系统寻找可证明的前向不变集

    提出用可逆网络为给定 AI 控制器寻找可证明前向不变集

    发表
    被测模型
    Pendulum AI-controller、Cart pole AI-controller、PVTOL AI-controller
    摘要用潜空间超矩形加解析验证,为事先给定的 AI 控制器寻找 FIS。

    本文处理的是认证场景:AI 控制器事先给定,不能为了构造 Lyapunov 函数去改控制器,却仍要给出可解析核验的安全依据。

    深度解读完整解读
  7. 其他arXiv 2610.02662

    论文发现语言驱动机器人安全监控的细化缺口:安全高层计划可能产生不安全执行

    审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决

    发表
    摘要表面轨迹可漏掉图诱导的禁区进入。

    作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。

    深度解读完整解读
  8. 其他arXiv 2610.01195

    Federated Agent Optimization:面向隐私约束下分布式智能体协同优化的联邦智能体优化框架

    提出 FAO 框架,形式化隐私约束下的分布式智能体协同优化

    发表
    场景
    AI Agent
    摘要FAO 把智能体协作写成效用、隐私和通信的多目标问题,并给出组件分类与迁移框架。

    Federated Agent Optimization(FAO) 是一篇框架论文:多个处在私有环境中的 LLM 智能体,如何在原始数据、完整轨迹和本地知识不离开客户端的前提下协作改进。

    深度解读完整解读
  9. 其他arXiv 2610.01045

    论文提出空承诺概念,衡量智能体承诺超出运行时能力的问题

    定义空承诺并给出单回合测量协议,按配置判定智能体承诺可否执行

    发表
    场景
    AI Agent
    摘要空承诺由配置决定、说话当下可判。

    作者定义空承诺:智能体承诺回合结束后的行动,但在其工具与运行时下没有任何执行路径。空洞只由配置决定,不依赖后续轨迹。

    深度解读完整解读
  10. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并筛选终端智能体的候选动作

    发表
    被测模型
    TMAX-9B、TMAX-4B、TMAX-27B 等 6 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  11. 其他arXiv 2609.38807

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    提出 PatchHolmes,用混合检索和列表式智能体选出 CVE 修复提交

    发表
    被测模型
    Qwen3-235B、Qwen3-Coder-30B、gpt-oss-120B 等 4 个
    摘要PatchHolmes 用混合检索和列表式四工具智能体做补丁检索,增益主要来自联合阅读候选而非更换骨干。

    PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。

    深度解读完整解读