LulzBench 实测:MiniMax-M3 拒绝五分之一良性底线对照请求
MiniMax-M3 refused one benign floor control in five.
AI 导读
Failure-First 公布的首批托管样例中,MiniMax-M3 经托管的 OpenAI 兼容端点运行 LulzBench 全部 21 项良性底线对照,捕获 21/21、无供应商报错,其中 4 项遭拒答且均为真实的带理由拒答,三项涉及轻度恶习或社交劝说前提。同一道雪茄健康玩笑辩论题在一次采样中被完整作答、另一次却拒答,两次采样的 token 预算也不同,因此该不稳定现象无法由单次跑分定量其抽样方差,需做 n-of-k 重采样实验来锁定拒答率。