评测与基准arXiv 2610.02303
PowerBench 评测 24 个模型在权力转移请求上的偏见
提出 PowerBench,测量模型对权力转移请求的拒答偏见
- arXiv
- 2610.02303
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- grok-4.3、haiku-4.5、nova-2-lite 等 18 个
- 风险偏见与歧视
摘要作者报告拒答随 SE/DE/PG 变化,并存在针对美国失权、智能体和语言的差。
提出 PowerBench,测量模型对权力转移请求的拒答偏见
摘要作者报告拒答随 SE/DE/PG 变化,并存在针对美国失权、智能体和语言的差。
提出 Rank Graduation Fairness 指标,检验群体间预测误差负担是否可比
用预测误差的排序分布、置换检验和特征移除,评估信贷模型在受保护群体间的公平。。
测量剪枝对语音 LLM 群体转写公平性的影响
摘要剪枝后的 Speech-LLM 不能只看总体 WER:Fair-Speech 上族群差扩大,作者建议看最差组。
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
构建 AdaCultureSafe 配对评测文化知识与文化安全
AdaCultureSafe 把同一条地区文化做成“是否知道”和“是否尊重”两套查询,用来看安全有没有用上知识,并用偏好训练把回答往“尊重且用上知识”拉。
评测多语言下模型的道德回答与安全拒答一致性