매일 아침, 어제의 AI를 한 통으로 정리해 보내드립니다메일로 받아보기

METAL LAB

yanght27/GPU-Perf-Playground

28PythonApache-2.0

CUDA 커널 짜는 법부터 vLLM 서빙, 다중 GPU 분산 학습까지 혼자 따라 하며 익히는 GPU 성능 학습 저장소

GPU-Perf-Playground는 개인 노트북(RTX 4070 Laptop)에서 만든 GPU 성능 및 AI 인프라 학습용 프로젝트로, 29개의 작은 단계별 과제(Ticket)로 구성되어 있다. CUDA C++, Triton, PyTorch로 같은 연산을 여러 방식으로 짜보고, NCU/NSYS 같은 프로파일링 도구로 측정하며, vLLM·SGLang·TensorRT-LLM·ms-swift 같은 실제 추론 프레임워크와 PyTorch·DeepSpeed·ms-swift 학습 파이프라인까지 실습한다. 마지막에는 데이터/텐서/파이프라인 병렬 같은 분산 학습 전략을 비교하며 마무리한다.

무엇을 하는 레포인가

  1. T00부터 T28까지 29개의 점진적 과제로 GPU 환경 설정부터 AI 인프라 전 영역을 단계적으로 학습
  2. 벡터 덧셈, GEMM(행렬곱), Attention 같은 동일 연산을 PyTorch, CUDA C++, Triton, cuTile, CuTe DSL 등 다섯 가지 방식으로 구현해 비교
  3. NCU/NSYS로 성능을 측정한 뒤 vLLM, SGLang, TensorRT-LLM, ms-swift 같은 실제 추론 프레임워크와 PyTorch, DeepSpeed(ZeRO), ms-swift LoRA 학습까지 실습
  4. DP, DDP, ZeRO, FSDP, TP, PP, SP, CP 등 병렬 학습 전략을 마지막 과제에서 비교 정리
  5. 각 과제마다 한 번에 실행되는 재현 스크립트와 대화형으로 정리한 강의 노트(docs/lectures)를 함께 제공

왜 중요한가

GPU 성능 최적화나 AI 인프라를 처음부터 독학하려는 사람에게는 흩어진 논문과 문서를 순서 없이 뒤지는 게 흔한 어려움인데, 이 저장소는 개인용 GPU에서 실제로 돌려본 코드와 순서가 잡힌 커리큘럼을 제공한다. 프로덕션용 라이브러리가 아니라 학습 체크리스트나 강의 자료로 참고하기 좋다.

이 레포의 용어

  • CUDA · 엔비디아 GPU에서 병렬 연산 코드를 직접 작성할 수 있게 해주는 프로그래밍 모델
  • Triton · 파이썬과 비슷한 문법으로 GPU 커널을 작성할 수 있게 해주는 컴파일러
  • NCU/NSYS · 엔비디아의 Nsight Compute/Systems, GPU 코드 실행을 세밀하게 측정하는 프로파일링 도구
  • vLLM/SGLang/TensorRT-LLM · 대형 언어모델을 빠르게 서빙(추론)하기 위한 프레임워크들
  • DeepSpeed ZeRO · 모델 파라미터를 여러 GPU에 나눠 저장해 큰 모델도 학습 가능하게 하는 메모리 절약 기법
  • DP/TP/PP/SP/CP · 여러 GPU에 모델과 데이터를 나누는 서로 다른 병렬화 방식(데이터/텐서/파이프라인/시퀀스/컨텍스트 병렬)

레포 원문 소개 (영문)

GPU 性能与 AI Infra 学习项目:CUDA/Triton 算子、NCU/NSYS、vLLM/SGLang/TRT-LLM/ms-swift、PyTorch/DeepSpeed/ms-swift 训练、并行架构

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL LAB 최신 기사