HakemBench:土耳其语类型化决策基准发布
发布 HakemBench,评测土耳其语定型决策的质量、校准与选择性自动化
- arXiv
- 2610.02293
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- open-jev (DeBERTa-v3-large)、Gemini 3.8 Flash、GPT-5.6 Sol 等 11 个
摘要HakemBench 评测土耳其语定型决策。
HakemBench v1.0 是土耳其语定型决策的开放基准,看模型在固定选项上给出的概率是否可用,以及不确定时能否把案例交给人。