跳到正文
10月10日 · 周六

全部论文

找到 90 篇

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.12235

    论文提出用语言模型充当 AI 研究世界模型,预测实验结果

    提出研究世界模型,用语言模型预测干预增益

    发表
    被测模型
    Claude Opus 5、Grok-4.6、GPT-6 Astra 等 13 个
    摘要作者称实验记录可在环境内外复用,并改善固定预算下的实验选择。

    作者把语言模型用作研究世界模型,在执行前预测干预增益的中位数,用来在有限预算下比较候选实验。要处理的缺口是研究智能体提案快于执行。同一类改动在不同参考模型、配方和预算下效果可以不同,因此需要能离开原环境继续使用的实验知识。

    深度解读完整解读
  2. 其他arXiv 2610.09683

    System Switch 研究:快速决策模型何时应交由推理模型思考

    提出 System Switch,让快决策模型仅在门控打开时询问推理模型

    发表
    场景
    AI Agent
    被测模型
    Laya, typed-decisions、Laya, base、Kev 9B 等 12 个
    摘要作者称快模型应按敏感度选。

    System Switch在不暂停的 Doom 里,让快的 typed-decision 模型做每一次决策,只在门控打开时把控制交给视觉推理模型。

    深度解读完整解读
  3. 其他arXiv 2610.08917

    CARE:为视觉-语言-动作模型推理加速提供认证式选择

    提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选

    发表
    被测模型
    OpenVLA-OFT、π0.5、π0 等 5 个
    摘要CARE 以配对回合认证加速诱发失败,在预算内选最快候选,不足则保留参考。

    CARE 在部署前从加速配置中选出最快、且加速诱发失败风险能被有限样本认证为低于用户预算的候选。证据不足就保留全计算参考策略。

    深度解读完整解读
  4. 其他arXiv 2610.08364

    Transect:为长程 LLM Agent 评测保留可观测性的开源工具

    提出 Transect,将长程 Agent 评测转录对齐到可回查的共享时间线

    发表
    场景
    AI Agent
    被测模型
    Claude-Opus-4.7
    摘要Transect 把长转录收成可回查报告,案例中文稿与自审占主要 token。

    Transect 是基于 Inspect Scout 的转录分析包,用来在长程智能体评估里保住可回查的过程账户。

    深度解读完整解读
  5. 其他arXiv 2610.07386

    NetAgent:面向多任务网络流量分析的智能体框架

    提出 NetAgent,编排工具完成多任务网络流量分析

    发表
    场景
    AI Agent
    摘要NetAgent 编排工具做多任务流量分析。

    NetAgent 是一个多任务网络流量分析智能体框架。作者要让分析员用自然语言把分类、隧道检测和主机研判串成可重规划的工作流,而不为每个任务单独训练一个模型。

    深度解读完整解读
  6. 其他arXiv 2610.06563

    HERA 提出 harness 与环境协同演化

    提出 HERA,协同演化 harness 与环境以提升 Agent 拒答准确性

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6-Luna、GPT-5.6-Terra、GPT-5.6-Sol 等 20 个
    摘要HERA 用失败协同演化 harness 与环境,并在迁移评测中提高 Abstain。

    HERA 在模型权重固定时,让 harness 与可执行环境按失败协同演化,以改进 agentic abstention。

    深度解读完整解读
  7. 其他arXiv 2610.06452

    研究者提出多模态安全评测应衡量可控性而非仅做分类

    主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像

    发表
    被测模型
    LlavaGuard-v1.2-7B-OV、Qwen3.5-9B
    摘要四轴画像把读出与选择性控制分开。

    作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。

    深度解读完整解读
  8. 其他arXiv 2610.06317

    论文提出可审计的文本水印合规方案以落实欧盟 AI 法案第 50 条

    把文本水印证据写成带错误率的三态可审计结论

    发表
    摘要把水印合规从普遍检测改成带范围的证据曲线、三态报告和再校准,模拟支持平方修正。

    指定配置下的文本水印被做成可审计测量:记录证据如何衰减,并把检测收成三态,而不是判定人类作者身份。

    深度解读完整解读
  9. 其他arXiv 2610.05689

    研究者提出用可逆神经网络为 AI 控制系统寻找可证明的前向不变集

    提出用可逆网络为给定 AI 控制器寻找可证明前向不变集

    发表
    被测模型
    Pendulum AI-controller、Cart pole AI-controller、PVTOL AI-controller
    摘要用潜空间超矩形加解析验证,为事先给定的 AI 控制器寻找 FIS。

    本文处理的是认证场景:AI 控制器事先给定,不能为了构造 Lyapunov 函数去改控制器,却仍要给出可解析核验的安全依据。

    深度解读完整解读
  10. 其他arXiv 2610.04792

    多模态一定更好吗?缺失模态鲁棒性的几何视角与 Geodesic Unlearning 方法

    提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性

    发表
    被测模型
    RoBERTa、ResNet50、Qwen2.5-3B 等 6 个
    摘要GU 用测地线子空间编辑应对部署时缺模态下降,并尽量保住全模态精度。

    这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。

    深度解读完整解读
  11. 其他arXiv 2610.06950

    低秩激活引导实现参数高效决策算子:330K 参数匹配 1.33M 强化学习算子

    提出 DecSteer,用共享低秩残差算子把审议收成直接决策

    发表
    被测模型
    Qwen3.5-4B、Llama-3.2-3B-Instruct、Qwen3.5-0.8B
    摘要DecSteer 用小参数 BC 算子把长推理收成短决策,增益随基座余量变化并可组合。

    DecSteer 是加在冻结语言模型残差流上的 System-1 决策算子,用行为克隆代替强化学习来调用模型里已有的技能。

    深度解读完整解读