评测与基准arXiv 2610.01497·10月2日OpenMTB-Audit:LLM 分子肿瘤委员会安全评测暴露过度拒答构建分子肿瘤委员会审计基准,测量临床过度拒答arXiv2610.01497发表10月2日层模型层场景模型与 API、LLM 应用测试GPT-4o (gpt-4o-2024-08-06)、GPT-4o-mini (gpt-4o-mini-2024-07-18)深度解读完整解读