marin-community/marin
Marin是一个把训练大语言模型全过程公开出来的开源研究平台
Marin把构建大语言模型所需的数据整理、训练、评测等全流程都以代码和实验记录的形式公开出来。失败的实验也被当作过程知识的一部分保留下来,而不仅仅展示成功结果。Stanford CRFM和Open Athena是其核心协作方。
它做什么
- 目前的重点是从零开始预训练并进行后续训练(posttraining,在预训练之后针对特定目标继续训练模型)一个规模达到5e24 model-FLOPs、总参数超过5000亿的大型混合专家(mixture-of-experts,只调用部分专家子模型而非整个大模型进行计算的结构)模型,目标是服务于科研人员关心的任务。
- 发布了名为Delphi的开放扩展规模套件,覆盖3e18到1e23 FLOPs的算力预算,包含把算力预算映射到模型配置的训练配方、按该配方在Google TPU Research Cloud上训练出的一系列模型,以及用小模型结果预测大模型表现的扩展规律(scaling law)。
- 配套公开了可复现Nemotron-CC、StarCoderData、ProofPile 2数据混合方式的训练管线代码、可复用的训练配方代码、记录开发方法的文档,以及Hugging Face上带有来源链接的绘图用原始数据。
- 此前用Marin训练出的一个80亿参数模型,在其自建的基础模型评测集上表现超过了Llama 3.1 8B,团队还训练过一个320亿参数的Marin 32B模型。
- 实验被组织成一系列有依赖关系、按顺序执行的步骤(step),类似Makefile的工作方式,例如训练步骤可以依赖分词(tokenization)步骤,只有分词完成后才会开始训练。
为什么重要
训练大语言模型所需的数据处理、基础设施和实验管理经验通常都不公开,而Marin把整套流程和记录开放出来,让其他研究者可以直接复现或参考。它的分步骤框架也被当作库用在音频文本、DNA、蛋白质建模等语言模型之外的领域,这对想搭建类似训练流水线的人有实际参考价值。
本仓库术语
- foundation model · 在大量数据上预训练、可用于多种下游任务的大型AI模型
- mixture-of-experts · 每次只调用部分专家子网络而非整个大网络进行计算的模型结构
- model-FLOPs · 衡量训练模型所用浮点运算总量的单位,用来表示计算规模
- scaling law · 描述模型或数据规模与最终性能之间关系的数学规律
- posttraining · 在预训练完成后,为特定目标继续训练模型的阶段
- tokenization · 把文本切分成模型能处理的小单元(token)的过程
仓库简介(英文)
Open-source framework for the research and development of foundation models.
在 GitHub 打开热门仓库
- DietrichGebert/ponytail一套让AI编程助手先想清楚再动手写代码的规则
- liustack/modlens给DeepSeek这类只能读文字的AI装上一双眼睛:粘贴图片就能把内容变成结构化文字数据
- TauricResearch/TradingAgents多个LLM智能体分别扮演分析师、研究员、交易员和风控经理,通过辩论共同决定股票交易
- Shubhamsaboo/awesome-llm-apps一个免费开源、收录100多个可直接运行的AI智能体和RAG应用示例的代码库
- asciimoo/hister把你看过的网页和文件全文索引起来的私人搜索引擎
- anthropics/claude-plugins-officialAnthropic官方整理的Claude Code插件目录,方便一键装上新功能
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- MadsLorentzen/ai-job-search一个用Claude Code自动完成整个求职流程的开源框架,作者本人就是靠它找到了工作