yanght27/GPU-Perf-Playground
从手写第一个CUDA算子到跑通vLLM推理、多卡并行训练的自学式GPU性能项目
GPU-Perf-Playground是作者在自己的笔记本(RTX 4070 Laptop)上边做边学搭建的GPU性能与AI Infra学习项目,拆成29个循序渐进的最小任务(Ticket)。内容涵盖用CUDA C++、Triton、PyTorch等五种方式实现同一个算子并对比,用NCU/NSYS做性能取证,再上手vLLM、SGLang、TensorRT-LLM、ms-swift等推理框架,以及PyTorch、DeepSpeed、ms-swift LoRA等训练流程,最后对比DP/TP/PP等并行架构。每个任务都配有一键复现脚本和对应讲义。
它做什么
- 从T00到T28共29个循序渐进的任务,覆盖从环境搭建到AI Infra全链路的学习路径
- 用PyTorch、CUDA C++、Triton、cuTile、CuTe DSL五种方式实现同一算子(如向量加法、GEMM矩阵乘法、Attention)并横向对比
- 用NCU、NSYS做性能测量取证,再实战vLLM、SGLang、TensorRT-LLM、ms-swift等推理框架,以及PyTorch、DeepSpeed(ZeRO)、ms-swift LoRA微调等训练流程
- 最后对比DP、DDP、ZeRO、FSDP、TP、PP、SP、CP等多种并行训练架构
- 每个任务都有一键复现脚本和对应写成文档的讲义(docs/lectures)
为什么重要
对想从零自学GPU性能优化或AI基础设施的人来说,相关资料通常散落在论文和文档里缺乏系统顺序,这个仓库提供了在消费级GPU上实测过、按顺序编排好的学习路径和可运行代码。它更适合当作自学清单或教学参考,而非生产级工具库。
本仓库术语
- CUDA · 让开发者直接在英伟达GPU上编写并行计算代码的编程模型
- Triton · 用类似Python的语法编写GPU算子的编译器
- NCU/NSYS · 英伟达Nsight Compute/Systems,用于精细测量GPU代码执行情况的性能分析工具
- vLLM/SGLang/TensorRT-LLM · 用于加速大语言模型推理(服务)的框架
- DeepSpeed ZeRO · 把模型参数分摊到多张GPU上存储,从而支持训练更大模型的显存优化技术
- DP/TP/PP/SP/CP · 把模型和数据切分到多张GPU上的不同并行策略(数据/张量/流水线/序列/上下文并行)
仓库简介(英文)
GPU 性能与 AI Infra 学习项目:CUDA/Triton 算子、NCU/NSYS、vLLM/SGLang/TRT-LLM/ms-swift、PyTorch/DeepSpeed/ms-swift 训练、并行架构
在 GitHub 打开热门仓库
- cathrynlavery/diagram-design让AI编程工具画出杂志排版质感图表,而不是千篇一律的圆角方框
- public-apis/public-apis一份由社区维护的免费API大全仓库
- semantica-agi/semantica一个让AI智能体的决策可追溯、可审计的开源图谱基础设施
- cactus-compute/needle一个14MB的AI模型,让手机和可穿戴设备无需联网就能调用工具
- unslothai/unsloth一款让你在自己电脑上运行和训练AI模型的桌面应用,无需写代码
- macro-inc/macro把邮件、聊天、文档、任务和CRM互相链接、共享同一份AI团队记忆的一体化办公平台
- harry0703/MoneyPrinterTurbo只需一个主题或关键词,就能自动生成配好文案、素材、字幕和音乐的完整短视频的开源工具
- basecamp/omarchyDHH打造的、开箱即用且风格统一的Linux发行版