BioSecBench-Surveillance:面向病原体基因组监测 AI 智能体的可验证基准
BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
AI 导读
研究者发布 BioSecBench-Surveillance,一个包含 100 项评估的可验证基准,测试 AI 智能体能否从原始测序数据和监测背景中推断出正确的分析流程。每项评估只给智能体与人类分析师相同的数据和背景,再对其结构化答案做确定性评分,任务覆盖从分类学鉴定到基因工程检测等七个类别,涉及多种样本类型和测序技术。在来自十六组模型与工具链组合的 3962 次可评分尝试中,最强配置仅通过约一半:Opus 4.8 搭配 PI 以 50.2% 领先(83 项评估,95% 置信区间 40.1 至 60.3),与 GPT-5.5 搭配 Codex 的 50.2%(95% 置信区间 40.8 至 59.6)持平,其后是 Opus 4.7 搭配 PI 的 49.6% 和 Sonnet 4.6 搭配 PI 的 48.6%。该基准为衡量智能体在下一次疫情暴发时能否被信任执行基因组监测提供了标准。