Musubi Labs 开源 PolicyLM-1.7B 内容审核决策模型
Introducing PolicyLM-1.7B
AI 导读
Musubi Labs 发布 PolicyLM-1.7B,一个面向信任与安全团队的内容审核决策模型,以 Apache 2.0 开源权重发布。它读取平台自定义策略与消息,一次前向返回每个类别的 0-1 分数,不生成文本,在 24 GB L4 上短聊天消息中位延迟 35 ms、整体低于 100 ms,支持多标签与自定义标签,策略修改即时生效且无需重训。模型基于 Qwen3-1.7B-Base 衍生的 BidirLM-1.7B-Embedding,用 NVIDIA Nemotron Safety Guard Dataset v3、阿里 XGuard-Train-Open-200K 和 PolyGuardMix 等公开数据训练,在 19 种语言上评估,英语最强、泰米尔语最弱。作者称其在自建策略基准上优于所有 20B 参数以下的对比模型,并已有一个微调版本运行在日处理超百万条消息的平台上。
阅读原文