跳到正文
原文
SecureBio· Andrew Liu·原文 · 入选 精选关注度82

SecureBio 发布 ABC-Bench:前沿模型在病毒 DNA 组装任务上表现如何

How Frontier AI Models Perform on Viral DNA Assembly Tasks

AI 导读

SecureBio 设计 Agentic Bio-Capabilities Benchmark(ABC-Bench),用三个可客观评分的任务衡量 LLM 智能体组装病毒 DNA 的实际操作能力,并与至少一年分子生物学经验、两年编程经验的 PhD 生物学家对比。所有受测模型在三个任务上都超过人类专家中位数:Claude Sonnet 4.6 和 Gemini 3.1 Pro Preview 在液体处理机器人任务上全部运行满分,Claude Opus 4.6 在片段设计任务上全部运行满分。模型在合成筛选规避任务上表现较差,该任务没有公开协议、需要真正的生物学创造力。作者指出,任务都涉及 Python 编程,编程是人类专家被拉开差距的主要环节。研究还用 GPT-o4-mini-high 在真实实验室的工业标准机器人上做了三次独立实验,均由全质粒测序确认组装成功。

推荐理由

SecureBio 用 ABC-Bench 对比前沿模型与博士级生物学家在病毒 DNA 组装任务上的表现,并给出真实实验室验证结果。

阅读原文securebio.substack.com