跳到正文
原文
arXiv· arXiv:2407.21783· Aaron Grattafiori·· 2024-08-01

Llama 3 模型群:405B 稠密 Transformer 与 Llama Guard 3 安全模型

The Llama 3 Herd of Models

AI 导读

Meta 发布 Llama 3 模型群,最大模型为 405B 参数的稠密 Transformer,上下文窗口最高 128K tokens,原生支持多语言、编程、推理与工具使用。评测显示其在大量任务上质量与 GPT-4 相当,并公开释出 405B 的预训练与后训练版本及输入输出安全模型 Llama Guard 3。论文还通过组合式方法将图像、视频和语音能力接入 Llama 3,在识别任务上表现与 SOTA 相当,但这些多模态模型仍在开发中,尚未广泛发布。

阅读原文arxiv.org