评测与基准arXiv 2609.03511
多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析
构建 IndicReStruct,评测保语义结构扰动下的多语言数学推理
- arXiv
- 2609.03511
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-2-9B-it、Gemma-2-27B-it、GPT-OSS-20B 等 7 个
摘要保语义的重排和语态变化会降低印地语与马拉雅拉姆语数学推理准确率,轻量微调未能补上。
IndicReStruct 用保语义的成分重排和语态变换,检验多语言 LLM 的数学推理是否依赖表层语序。