Hirundo 用行为遗忘将 Qwen3.6 的政治对齐率从 89.8% 降至 2.8%
Westernizing Qwen: Measuring and Mitigating Geopolitical Alignment in Chinese Open-Weight LLMs
AI 导读
Hirundo 发布 Westernized Qwen,通过行为遗忘直接编辑权重,把 Qwen3.6-35B-A3B 在 CCPC-500 上的审查、宣传框架或偏见比例从 89.8% 降到 2.8%,DECCP 拒答率从 65.26% 降到 3.16%,ChinaBench 不合规率从 96.67% 降到 6.67%。方法分三步:先用政治提示词诱导基座模型产生目标行为,再用行为遗忘目标训练 LoRA 适配器并以保留集锚定其他能力,最后把适配器合并进基座权重。作为对照,Thomson Reuters 与帝国理工 FAIR Lab 的 Snowdon1.1-Small 只去除了 59% 至 69% 的行为。同一方法也用于 Qwen3.5-4B,在 2 张 GPU 上约 3.1 小时完成,Thinking OFF 下 CCPC-500 从 89.2% 降到 1.2%。
阅读原文