跳到正文
原文
论文追踪· arXiv:2511.08225· Yishan Du, Conrad Borchers, Mutlu Cukurova·本站收录 · 原文发表

研究者用 600 篇作文对六款大模型的教育反馈性别偏差做基准测试

Benchmarking Educational LLMs with Analytics: A Case Study on Gender Bias in Feedback

AI 导读

研究者提出一个基于嵌入向量的基准测试框架,用于检测大语言模型在形成性反馈中的性别偏差,相关方法使用了 AES 2.0 语料库中的 600 篇真实学生作文。研究沿两个维度构造受控反事实:通过基于词表的性别词汇替换制造隐性线索,以及通过提示词中的作者性别背景制造显性线索。测试覆盖六款代表性模型:GPT-5 mini、GPT-4o mini、DeepSeek-R1、DeepSeek-R1-Qwen、Gemini 2.5 Pro 和 Llama-3-8B。研究先用余弦距离和欧氏距离在句嵌入上量化回答差异,再通过置换检验评估显著性,最后用降维可视化结构。结果显示,在所有模型中,男性到女性的隐性反事实操作稳定引发比女性到男性更大的语义偏移;只有 GPT 和 Llama 系列模型对显性性别线索表现出敏感性。

阅读原文arxiv.org