跳到正文
10月10日 · 周六

全部论文

找到 40 篇

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.05586

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别

    发表
    场景
    web agent
    被测模型
    GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个

    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    深度解读完整解读
  2. 评测与基准arXiv 2610.05140

    AutoSciBench:自动生成科学智能体评测基准的框架

    提出 AutoSciBench,循环生成科学智能体评测任务

    发表
    被测模型
    Claude Opus 5、Claude Opus 4.8、Claude Opus 4.7 等 10 个
    摘要AutoSciBench 用概念、配方和求解反馈自动构造并加难科学智能体基准。

    AutoSciBench 研究科学智能体基准能否自动构造,并随 solver 行为迭代改编。

    深度解读完整解读
  3. 评测与基准arXiv 2610.04366

    CrashSim 用真实事故先验生成碰撞场景并构建 nuCrash 数据集

    提出 CrashSim 用真实事故先验引导扩散仿真并构建 nuCrash 评测自动驾驶规划器

    发表
    被测模型
    Lane-graph planner、PDM-closed planner、IL planner 等 5 个
    摘要CrashSim 迁入真实事故先验生成场景。

    CrashSim 用检索到的真实事故先验引导扩散式多车仿真,为自动驾驶安全评测生成碰撞与近碰撞场景。。

    深度解读完整解读
  4. 评测与基准arXiv 2610.04184

    EvalResearchBench:AI 智能体自主设计评测基准

    提出 EvalResearchBench,评测智能体自建评测对目标基准的排序一致性

    发表
    被测模型
    GPT-6 Astra、GPT-5.6 Sol、GLM-5.3 等 9 个
    摘要ERB 比较有预算的评测设计,分数复现与排序并不由同一设计同时领先。

    ERB 用来测一件事:智能体在固定预算内做出的可执行评测,能否复现既有基准对候选模型的分数和排序。

    深度解读完整解读
  5. 评测与基准arXiv 2610.02874

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性

    发表
    被测模型
    Frozen L0、L0-T、L1 等 5 个
    摘要SceneFactory-3D 固定场景只改路况。

    SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。

    深度解读完整解读
  6. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读