每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

yanght27/GPU-Perf-Playground

28PythonApache-2.0

从手写第一个CUDA算子到跑通vLLM推理、多卡并行训练的自学式GPU性能项目

GPU-Perf-Playground是作者在自己的笔记本(RTX 4070 Laptop)上边做边学搭建的GPU性能与AI Infra学习项目,拆成29个循序渐进的最小任务(Ticket)。内容涵盖用CUDA C++、Triton、PyTorch等五种方式实现同一个算子并对比,用NCU/NSYS做性能取证,再上手vLLM、SGLang、TensorRT-LLM、ms-swift等推理框架,以及PyTorch、DeepSpeed、ms-swift LoRA等训练流程,最后对比DP/TP/PP等并行架构。每个任务都配有一键复现脚本和对应讲义。

它做什么

  1. 从T00到T28共29个循序渐进的任务,覆盖从环境搭建到AI Infra全链路的学习路径
  2. 用PyTorch、CUDA C++、Triton、cuTile、CuTe DSL五种方式实现同一算子(如向量加法、GEMM矩阵乘法、Attention)并横向对比
  3. 用NCU、NSYS做性能测量取证,再实战vLLM、SGLang、TensorRT-LLM、ms-swift等推理框架,以及PyTorch、DeepSpeed(ZeRO)、ms-swift LoRA微调等训练流程
  4. 最后对比DP、DDP、ZeRO、FSDP、TP、PP、SP、CP等多种并行训练架构
  5. 每个任务都有一键复现脚本和对应写成文档的讲义(docs/lectures)

为什么重要

对想从零自学GPU性能优化或AI基础设施的人来说,相关资料通常散落在论文和文档里缺乏系统顺序,这个仓库提供了在消费级GPU上实测过、按顺序编排好的学习路径和可运行代码。它更适合当作自学清单或教学参考,而非生产级工具库。

本仓库术语

  • CUDA · 让开发者直接在英伟达GPU上编写并行计算代码的编程模型
  • Triton · 用类似Python的语法编写GPU算子的编译器
  • NCU/NSYS · 英伟达Nsight Compute/Systems,用于精细测量GPU代码执行情况的性能分析工具
  • vLLM/SGLang/TensorRT-LLM · 用于加速大语言模型推理(服务)的框架
  • DeepSpeed ZeRO · 把模型参数分摊到多张GPU上存储,从而支持训练更大模型的显存优化技术
  • DP/TP/PP/SP/CP · 把模型和数据切分到多张GPU上的不同并行策略(数据/张量/流水线/序列/上下文并行)

仓库简介(英文)

GPU 性能与 AI Infra 学习项目:CUDA/Triton 算子、NCU/NSYS、vLLM/SGLang/TRT-LLM/ms-swift、PyTorch/DeepSpeed/ms-swift 训练、并行架构

在 GitHub 打开

热门仓库

全部仓库 →

METAL LAB 最新报道