工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

marin-community/marin

1,970今日 +214Python

Marin是一个把训练大语言模型全过程公开出来的开源研究平台

Marin把构建大语言模型所需的数据整理、训练、评测等全流程都以代码和实验记录的形式公开出来。失败的实验也被当作过程知识的一部分保留下来,而不仅仅展示成功结果。Stanford CRFM和Open Athena是其核心协作方。

它做什么

  1. 目前的重点是从零开始预训练并进行后续训练(posttraining,在预训练之后针对特定目标继续训练模型)一个规模达到5e24 model-FLOPs、总参数超过5000亿的大型混合专家(mixture-of-experts,只调用部分专家子模型而非整个大模型进行计算的结构)模型,目标是服务于科研人员关心的任务。
  2. 发布了名为Delphi的开放扩展规模套件,覆盖3e18到1e23 FLOPs的算力预算,包含把算力预算映射到模型配置的训练配方、按该配方在Google TPU Research Cloud上训练出的一系列模型,以及用小模型结果预测大模型表现的扩展规律(scaling law)。
  3. 配套公开了可复现Nemotron-CC、StarCoderData、ProofPile 2数据混合方式的训练管线代码、可复用的训练配方代码、记录开发方法的文档,以及Hugging Face上带有来源链接的绘图用原始数据。
  4. 此前用Marin训练出的一个80亿参数模型,在其自建的基础模型评测集上表现超过了Llama 3.1 8B,团队还训练过一个320亿参数的Marin 32B模型。
  5. 实验被组织成一系列有依赖关系、按顺序执行的步骤(step),类似Makefile的工作方式,例如训练步骤可以依赖分词(tokenization)步骤,只有分词完成后才会开始训练。

为什么重要

训练大语言模型所需的数据处理、基础设施和实验管理经验通常都不公开,而Marin把整套流程和记录开放出来,让其他研究者可以直接复现或参考。它的分步骤框架也被当作库用在音频文本、DNA、蛋白质建模等语言模型之外的领域,这对想搭建类似训练流水线的人有实际参考价值。

本仓库术语

  • foundation model · 在大量数据上预训练、可用于多种下游任务的大型AI模型
  • mixture-of-experts · 每次只调用部分专家子网络而非整个大网络进行计算的模型结构
  • model-FLOPs · 衡量训练模型所用浮点运算总量的单位,用来表示计算规模
  • scaling law · 描述模型或数据规模与最终性能之间关系的数学规律
  • posttraining · 在预训练完成后,为特定目标继续训练模型的阶段
  • tokenization · 把文本切分成模型能处理的小单元(token)的过程

仓库简介(英文)

Open-source framework for the research and development of foundation models.

在 GitHub 打开

热门仓库

全部仓库 →

METAL LAB 最新报道