跳到正文
10月9日 · 周五

全部论文

找到 12 篇

另有 532 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2609.35266

    面向软件交付决策门禁的智能体安全审计器持续保障机制

    提出 TAIP,把策略与证据分离,在配置或策略变化后重算仓库审计门禁裁决

    发表
    测试
    gpt-4o-mini、gpt-4.1
    摘要TAIP 把策略、证据和执行分开,在保留的 RepoAudit 证据上于 5s 预算内重算合并门姿态。

    TAIP 是放在未修改 RepoAudit 之外的保证层,用来在软件交付门上重算智能体安全控制的当前姿态。

    深度解读完整解读
  2. 其他arXiv 2609.10144

    AIOS 的内核管理共享内存:面向系统级个性化的新抽象

    AI 导读研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。

    发表
    测试
    GPT-4o、Llama-3.1:8B、Qwen-2.5:7B
    摘要作者称内核集中管理记忆,能拿到无约束上下文的大部分个性化收益,并降低延迟。

    kernel-managed shared memory 把多智能体的检索、隐私和注入收进 agent-system kernel,并在 AIOS 上与三种替代方案比较。

    深度解读完整解读
  3. 其他arXiv 2609.19399

    RWPS:面向网络安全博弈的高效纳什均衡计算

    提出 RWPS,在固定仿真预算下估计安全博弈收益并求均衡

    发表
    摘要RWPS 用历史代理和均衡加权采样估计安全博弈收益,并给出按支撑加权的遗憾界。

    Lanier、Farmer 与 Vorobeychik 研究仿真型网络安全博弈中,如何在远小于全矩阵的仿真预算下计算可利用性较低的均衡。。收益没有闭式,PSRO 扩大攻防策略池时必须估计每一对的收益,仿真次数随池二次增长。

    深度解读完整解读
  4. 其他arXiv 2609.12039

    现实才是最终验证者:智能体软件工程的两大关键缺口

    提出双缺口框架统一智能体软件工程的奖励投机与幻觉

    发表
    摘要双缺口解释内环为何会放行部署后不可接受的实现,外环用现实证据持续修订 R、M 与 E。

    Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。

    深度解读完整解读
  5. 其他arXiv 2609.26457

    Weco AI 提出 AIDE2:AI 研究智能体递归自我改进 8 天获七次提升

    提出双层自改进系统 AIDE2,让外层智能体重写内层 Harness 代码

    发表
    测试
    claude opus 4.7、gemini 3 flash、gemini 3.1 pro 等 6 个

    摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。

    深度解读完整解读
  6. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作

    发表
    测试
    TMAX-9B、TMAX-4B、TMAX-27B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  7. 其他arXiv 2609.38807

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    提出列表式智能体补丁检索系统,在仓库中定位 CVE 修复提交

    发表
    测试
    Qwen3-235B、Qwen3-Coder-30B、gpt-oss-120B 等 6 个
    摘要PatchHolmes 用混合检索和列表式四工具智能体做补丁检索,增益主要来自联合阅读候选而非更换骨干。

    PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。

    深度解读完整解读
  8. 其他arXiv 2609.38143

    为测试时 AI4AI 的智能体执行环境设计学习元技能

    提出固定权重下学习 meta-skill 以为未见任务搭建智能体 harness 的方法

    发表
    测试
    GPT-5.6-Sol、Gemini-3.6-Flash、Qwen3.8-Flash 等 5 个
    摘要冻结的 meta-skill 库指导 Builder 为未见任务搭建 harness,权重保持固定。

    作者研究 test-time AI4AI:Builder 与 Target 权重都固定时,Builder 学习如何为 Target 构造更好的执行环境。

    深度解读完整解读
  9. 其他arXiv 2609.23954

    Djinnlang:用 LLM 编译器实现无歧义规格的高级编程

    提出 Djinnlang,以无歧义规格约束 LLM 的实现并由 Dafny 核验

    发表
    测试
    Claude Fable 5.1 (Claude Code)、GPT 6 Astra (Codex)
    摘要无歧义规格加验证器,使 LLM 成为可丢弃代码的编译阶段。

    Djinnlang 让程序员只写规格,把 LLM 放进编译器,并用 Dafny 验证器加上无歧义约束钉住语义。

    深度解读完整解读
已经到底了