跳到正文
事件观察中

Aleph Alpha 评测中国模型敏感议题表现

1 篇报道1 个报道来源3 天前更新

先了解这件事

AI 综述

2026年10月4日,Aleph Alpha 发布研究,用自建基准测试阿里千问、DeepSeek 与月之暗面 Kimi 等中国模型,覆盖天安门、台湾、新疆等 967 个敏感议题。其自研评分系统判定仅 17% 至 41% 的回答算平衡,其余为复述官方立场、回避或拒答。其中 DeepSeek V4 Pro 拒答三分之二问题;作为对照,Claude Sonnet 5 与 Mistral Small 的平衡回答率分别为 70% 和 92%。

AI 根据报道生成 · 3 天前更新

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月4日
  1. The Decoder
    Aleph Alpha 研究:千问、DeepSeek、Kimi 等中国模型在敏感议题上多复述官方立场或拒答

    Aleph Alpha 用自建基准测试了阿里千问(Qwen)、DeepSeek 与月之暗面(Kimi)等中国模型,覆盖天安门、台湾、新疆等 967 个敏感议题,其自研评分系统判定仅 17% 至 41% 的回答算平衡,其余为复述官方立场、回避或拒答。DeepSeek V4 Pro 拒答三分之二问题,对照的 Claude Sonnet 5 与 Mistral Small 平衡回答率分别为 70% 和 92%。研究还称 Nvidia Nemotron Cascade 2 有 17% 回答呈类似倾向,归因于其 930 万条训练样本中约 3500 条由 DeepSeek 和 Qwen 生成。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。72 小时的讨论链接数还含 1 篇报道,见后续时间线。

共 1 条

关注度走势

内容价值与传播共同决定关注度;传播减弱时回落到内容价值。

每天新增来源

5 天共 2 个·最多 1(10月3日)·今天 0

  • 10月3日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月4日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月5日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月6日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月7日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

还没有足够的连续观测数据,暂不绘制趋势。