评测与基准arXiv 2610.01497
OpenMTB-Audit:LLM 分子肿瘤委员会安全评测暴露过度拒答
构建分子肿瘤委员会审计基准,测量临床过度拒答
- arXiv
- 2610.01497
- 发表
- 层
- 模型层
- 测试
- GPT-4o (gpt-4o-2024-08-06)、GPT-4o-mini (gpt-4o-mini-2024-07-18)
构建分子肿瘤委员会审计基准,测量临床过度拒答
提出 Sentinel-RL,将拓扑推理卸载到图策略并约束遏制动作
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。
提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全
SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。