评测与基准arXiv 2610.06824·10月6日TasteVal 基准:用算力效率衡量 AI 的实验研究品味提出 TasteVal 基准,衡量模型设计实验并解释结果的研究品味arXiv2610.06824发表10月6日层应用层场景science agent被测模型Opus 5.5、Fable 5.1、GPT-6 Astra 等 20 个风险危险能力深度解读完整解读