跳到正文
10月10日 · 周六

全部论文

找到 190 篇

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.12360

    论文提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊

    提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊

    发表
    场景
    AI Agent
    被测模型
    Nemotron-Orchestrator-8B、Claude Sonnet 4.6、GPT-5 等 5 个
    摘要ISE 轨迹评测显示,四个智能体的高任务准确率并不对应更高的认知谦逊。

    作者要测的不是智能体最终答得对不对,而是知识冲突出现时,它有没有在轨迹里认出缺口、做有界的工具跟进,并把没解决的不确定性写给用户。

    深度解读完整解读
  2. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  3. 评测与基准arXiv 2610.10150

    论文指出 LLM 漏洞修复基准可靠性受评测设计影响

    用对照实验隔离评测设计对漏洞补丁基准得分的影响

    发表
    被测模型
    Claude Sonnet 4.0、Claude Sonnet 4.5、Claude Opus 4.7
    摘要作者认为评测流水线会改变补丁基准分数,PoC 通过率高于开发者测试通过率。

    作者把 LLM 漏洞补丁基准的评测流水线当作会改变测量结果的对象,并明确说本文不是再做一个用于排名的基准。

    深度解读完整解读
  4. 评测与基准arXiv 2610.10062

    研究:Agent 更依赖工具报错通道

    测量工具调用 Agent 对显式报错与静默损坏的检测和恢复

    发表
    场景
    AI Agent
    被测模型
    claude-haiku-4.5-thinking、claude-haiku-4.5、deepseek-r1 等 6 个
    摘要作者称智能体看错误通道而非返回内容,静默损坏更少被当作问题。

    作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。

    深度解读完整解读
  5. 评测与基准arXiv 2610.09944

    AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

    提出 AgentTime 基准,评测智能体按时长工作与估时能力

    发表
    被测模型
    Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
    摘要作者把完成任务和管理所用时间分开。

    AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。

    深度解读完整解读
  6. 评测与基准arXiv 2610.09581

    研究审计 LLM 读取 Agent 日志的取证能力:答案正确但引用来源多为猜测

    评测 LLM 审计 Agent 日志时来源重建是否有证据支持

    发表
    场景
    AI Agent
    被测模型
    gpt-5.6-luna、claude-sonnet-4-6、gpt-5.4-mini-2026-03-17 等 5 个
    摘要保存执行范围的标识绑定,才能把猜中的引用和证据支持的引用分开。

    包级审计检查保存的智能体动作里,哪些来源结论能被交给分析者的记录支持。

    深度解读完整解读
  7. 评测与基准arXiv 2610.08902

    论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

    发表
    被测模型
    Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 等 10 个
    摘要作者用固定权重协议比较前沿模型把经验写成制品后的留出增益与习得效率。

    作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。

    深度解读完整解读
  8. 评测与基准arXiv 2610.08662

    ParanoiaEval:编码智能体不必要风险处置评测基准发布

    提出 ParanoiaEval 评测编码智能体的不必要风险处置

    发表
    被测模型
    Opus-5、Sonnet-5、Sonnet-4.6 等 8 个
    摘要作者用证据受控任务对评测风险处置,称其普遍、独立于任务能力并降低满意度。

    作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。

    深度解读完整解读
  9. 评测与基准arXiv 2610.08215

    Learn2Play Bench 发布:用规则陌生的文本游戏评测 LLM Agent 从经验中学习的能力

    用 Learn2Play Bench 评测 Agent 从经验中学习陌生规则

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 5.5、GPT-6 Astra、Claude Opus 5 等 11 个
    摘要用隐藏规则游戏把新学习与预训练知识分开,并比较模型、记忆方式和人类。

    Learn2Play Bench 用新设计的隐藏规则文本游戏,评测 LLM 智能体在不更新权重时从交互中学习的能力。

    深度解读完整解读
  10. 评测与基准arXiv 2610.07967

    DecepEval:覆盖 28 个专业场景的 LLM 智能体欺骗评测基准

    构建基准 DECEPEVAL,评测 LLM 智能体在外部条件下的欺骗

    发表
    场景
    AI Agent
    被测模型
    Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 5 等 9 个
    摘要DECEPEVAL 用配对诱导比较智能体欺骗。

    DECEPEVAL 是一个评测 LLM 智能体欺骗如何随任务、职业场景和外部条件变化的基准。

    深度解读完整解读
  11. 评测与基准arXiv 2610.07753

    SafeActBench 发布:工具型 Agent 在证据到行动链上的失败模式

    构建 SAFEACTBENCH 评测工具型 Agent 的证据到行动失败

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 5、GPT-5.6 Sol、DeepSeek-V4-Flash 等 5 个
    摘要作者称失败常起于调查不足或过早行动,证据齐后的单步则少失败。

    SAFEACTBENCH 评测工具智能体的 consequential actions 是否由行动前已建立的证据支持,而不是只看终态对不对。

    深度解读完整解读
  12. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性

    发表
    场景
    AI Agent
    被测模型
    AgentTrust runtime (174 rules)、GPT-5.5 (gpt55)、claude-haiku-4-5-20251001 等 7 个
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  13. 评测与基准arXiv 2610.07274

    研究者提出 Trust Layer 框架复核 Agents' Last Exam 成绩可信度

    提出 Trust Layer 后置审查框架,核验智能体基准记录分数是否可信

    发表
    场景
    AI Agent
    被测模型
    Claude Sonnet 4.6、Claude Opus 5、GPT-5.6 Sol 等 5 个

    摘要论文提出了后置验证智能体记录分数的四维信任层,揭示了基准高分背后普遍存在作弊、虚报与不稳定现象。

    深度解读完整解读