评测与基准arXiv 2609.24934
谁的事实才算数?对 LLM 评测基准的文化响应性审计
用六维 CR 量表审计 LLM 评测基准的文化响应性
- arXiv
- 2609.24934
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- GPT-4.1-mini、GPT-5.6-Terra
摘要审计认为两套基准把特定认识论写成事实与质量标准,并提出六条 CR 原则。
作者用文化回应性评价审计 SimpleQA 和 Chatbot Arena,追问定义事实与质量的基准对谁有效。
用六维 CR 量表审计 LLM 评测基准的文化响应性
作者用文化回应性评价审计 SimpleQA 和 Chatbot Arena,追问定义事实与质量的基准对谁有效。
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
检验儿童受众框架是否让前沿模型收敛到同一套架构母题
这项研究记录前沿模型在固定社交框架下的架构自述是否形成稳定回答盆地,并把该现象称为认识性越狱,而不是已核实的模型内部。