微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
- arXiv
- 2608.19741
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.4、GPT-5.6-sol、GPT-6 Astra 等 14 个
摘要论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
摘要论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。
提出 MemoReason 基准,测量参数记忆对上下文推理的影响
MemoReason 用结构相同的事实–虚构文档配对,测量参数记忆如何影响大模型的上下文推理。
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
提出 MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限
FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。
提出 SAGO,以语义等价变体上的逐例行为稳定性评测大模型泛化
SAGO 把 LLM 泛化改写成同一目标与上下文在语义等价表达下的逐例行为稳定性,而不是单一基准上的聚合准确率。。
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
构建 PrivEscalate 评测 Linux 提权并设计 PrivEscAgent
用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
测量系统提示中隐藏日期对评测分数与排名的影响
这篇工作量化一个评测协议问题:系统提示词里用户看不见、且逐日变化的当前日期,会不会单独改变 LLM 分数。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。
构建 IndicReStruct,评测保语义结构扰动下的多语言数学推理
IndicReStruct 用保语义的成分重排和语态变换,检验多语言 LLM 的数学推理是否依赖表层语序。
构建 AED,把智能体自然失败转为诊断与动作修复训练数据
AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。
提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。