跳到正文
事件观察中

Hirundo 测试并调整 Qwen 政治对齐倾向

2 篇报道2 个报道来源1 天前更新

先了解这件事

AI 综述

Hirundo 的研究主张 Alibaba 的 Qwen AI 存在审查与政治对齐问题,相关结论来自厂商测试。Hirundo 随后发布 Westernized Qwen,通过行为遗忘直接编辑权重,把 Qwen3.6-35B-A3B 在 CCPC-500 上的审查、宣传框架或偏见比例从 89.8% 降至 2.8%,DECCP 拒答率从 65.26% 降至 3.16%,ChinaBench 不合规率从 96.67% 降至 6.67%。其方法分三步:先用政治提示词诱导基座模型产生目标行为,再用行为遗忘目标训练 LoRA 适配器并以保留集锚定其他能力,最后把适配器合并回权重。

AI 根据报道生成 · 1 小时前更新

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月6日
  1. Hirundo
    Hirundo 用行为遗忘将 Qwen3.6 的政治对齐率从 89.8% 降至 2.8%

    Hirundo 发布 Westernized Qwen,通过行为遗忘直接编辑权重,把 Qwen3.6-35B-A3B 在 CCPC-500 上的审查、宣传框架或偏见比例从 89.8% 降到 2.8%,DECCP 拒答率从 65.26% 降到 3.16%,ChinaBench 不合规率从 96.67% 降到 6.67%。方法分三步:先用政治提示词诱导基座模型产生目标行为,再用行为遗忘目标训练 LoRA 适配器并以保留集锚定其他能力,最后把适配器合并进基座权重。作为对照,Thomson Reuters 与帝国理工 FAIR Lab 的 Snowdon1.1-Small 只去除了 59% 至 69% 的行为。同一方法也用于 Qwen3.5-4B,在 2 张 GPU 上约 3.1 小时完成,Thinking OFF 下 CCPC-500 从 89.2% 降到 1.2%。

  2. Diya TV
    研究人员指 Qwen AI 存在审查与政治对齐问题

    Hirundo 的研究主张 Alibaba 的 Qwen AI 存在审查与政治对齐问题。相关结论来自厂商测试,报道时间早于博客元数据所列时间,具体首次发布时刻尚未厘清。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。72 小时的讨论链接数还含 2 篇报道,见后续时间线。

本站还没有收集到这件事的讨论链接。

关注度走势

内容价值与传播共同决定关注度;传播减弱时回落到内容价值。

每天新增来源

2 天共 2 个·最多 2(10月6日)·今天 0

  • 10月6日 新增 2 个来源(2 家媒体、0 个账号)
  • 10月7日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

还没有足够的连续观测数据,暂不绘制趋势。