跳到正文
原文
Mistral AI News·原文 · 入选 精选关注度62

Mistral 发布 Shieldstral:3B 开源多模态安全分类器

Introducing Shieldstral.

AI 导读

Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言政策而无需重新训练。模型每次请求由 <Instruct> 评估上下文与严格度、<Query> 单个是非问题、<Document> 待判定内容三部分组成,只读取 yes 和 no 两个 token 的 logits 并做 softmax 归一化,输出连续安全分数。Mistral 称其在文本安全、拒答检测、策略适应性和多模态基准上匹配或超过最多 7 倍于其规模的开放护栏模型,可在单张 16GB NVIDIA GPU 上运行,以 Apache 2.0 许可开放权重。训练上统一异构数据集的标签体系,用对比式改写让模型区分相近政策,并用视觉语言重排器过滤图像数据,最后通过 LoRA 微调与 SLERP 合并多个 checkpoint。

推荐理由

Mistral 把内容审核改写成推理时用自然语言提问的问答任务,一个 3B 权重即可适配新政策而无需重训。

阅读原文mistral.ai