AIInfra

September 24, 2025 · View on GitHub

文字课程内容正在一节节补充更新,尽可能抽空继续更新正在 :octocat: AIInfra,希望您多多鼓励和参与进来!!!

文字课程开源在 :hamburger: AIInfra,系列视频托管B 站 ZOMI 酱和 :yt: 油管 ZOMI6222,PPT 开源在 :octocat: AIInfra,欢迎引用!

课程背景

这个开源项目英文名字叫做 AIInfra,中文名字叫做 AI 基础设施。大模型是基于 AI 集群的全栈软硬件性能优化,通过最小的每一块 AI 芯片组成的 AI 集群,编译器使能到上层的 AI 框架,训练过程需要分布式并行、集群通信等算法支持,而且在大模型领域最近持续演进如智能体等新技术。

本开源课程主要是跟大家一起探讨和学习人工智能、深度学习的系统设计,而整个系统是围绕着 ZOMI 在工作当中所积累、梳理、构建 AI 大模型系统的基础软硬件栈,因此成为 AI 基础设施。希望跟所有关注 AI 开源课程的好朋友一起探讨研究,共同促进学习讨论。

AISystem[https://github.com/Infrasys-AI/AISystem] 项目最大的区别就是 AIInfra 项目主要针对大模型,特别是大模型在分布式集群、分布式架构、分布式训练、大模型算法等相关领域进行深度展开。

大模型系统全栈

:clapper: 课程内容大纲

课程主要包括以下模块,内容陆续更新中,欢迎贡献:

序列教程内容简介地址
00:checkered_flag: 大模型系统概述系统梳理了大模型关键技术点,涵盖 Scaling Law 的多场景应用、训练与推理全流程技术栈、AI 系统与大模型系统的差异,以及未来趋势如智能体、多模态、轻量化架构和算力升级。Slides
01:checkered_flag: AI 计算集群大模型虽然已经慢慢在端测设备开始落地,但是总体对云端的依赖仍然很重很重,AI 集群会介绍集群运维管理、集群性能、训练推理一体化拓扑流程等内容。Slides
02:checkered_flag: 通信与存储大模型训练和推理的过程中都严重依赖于网络通信,因此会重点介绍通信原理、网络拓扑、组网方案、高速互联通信的内容。存储则是会从节点内的存储到存储 POD 进行介绍。Slides
03:checkered_flag: 集群容器与云原生讲解容器与 K8S 技术原理及 AI 模型部署实践,涵盖容器基础、Docker 与 K8S 核心概念、集群搭建、AI 应用部署、任务调度、资源管理、可观测性、高可靠设计等云原生与大模型结合的关键技术点。Slides
04:checkered_flag: 分布式训练大模型训练是通过大量数据和计算资源,利用 Transformer 架构优化模型参数,使其能够理解和生成自然语言、图像等内容,广泛应用于对话系统、文本生成、图像识别等领域。Slides
05:checkered_flag: 分布式推理大模型推理核心工作是优化模型推理,实现推理加速,其中模型推理最核心的部分是 Transformer Block。本节会重点探讨大模型推理的算法、调度策略和输出采样等相关算法。Slides
06:checkered_flag: 大模型算法与数据Transformer 起源于 NLP 领域,近期统治了 CV/NLP/多模态的大模型,我们将深入地探讨 Scaling Law 背后的原理。在大模型算法背后数据和算法的评估也是核心的内容之一,如何实现 Prompt 和通过 Prompt 提升模型效果。Slides
07:checkered_flag: 大模型应用当前大模型技术已进入快速迭代期。这一时期的显著特点就是技术的更新换代速度极快,新算法、新模型层出不穷。因此本节内容将会紧跟大模型的时事内容,进行深度技术分析。Slides

课程细节

00. 大模型系统概述

系统梳理了大模型关键技术点,涵盖 Scaling Law 的多场景应用、训练与推理全流程技术栈、AI 系统与大模型系统的差异,以及未来趋势如智能体、多模态、轻量化架构和算力升级。

大纲小结链接状态
概述01. Scaling Law 整体解读Markdown, 文章:o:
概述02. Standard Scaling LawMarkdown, 文章:white_check_mark:
概述03. Inference Time Scaling LawMarkdown, 文章:o:
概述04. 大模型训练与 AI Infra 的关系分析Markdown, 文章:white_check_mark:
概述05. 大模型推理与 AI Infra 的关系分析Markdown, 文章:white_check_mark:
概述06. AI Infra 核心逻辑与行业趋势Markdown, 文章:white_check_mark:

01. AI 计算集群

AI 集群架构演进、万卡集群方案、性能建模与优化,GPU/NPU 精度差异及定位方法。

编号名称具体内容状态
1计算集群之路高性能计算集群发展与万卡 AI 集群建设及机房基础设施挑战:white_check_mark:
2L0/L1 AI 集群基建服务器节点的基础知识、散热技术的发展与实践:white_check_mark:
3万卡 AI 集群围绕万卡 AI 集群从存算网络协同、快速交付与紧张工期等挑战:white_check_mark:
4集群性能分析集群性能指标分析、建模与常见问题定位方法解析:o:

:triangular_flag_on_post: 1.4 集群性能分析

大纲小节链接状态
:sparkling_heart::star2::sparkling_heart:
性能 实践 :computer:CODE 01: 拆解 Transformer-DecoderMarkdown, Jupyter, 文章:white_check_mark:
性能 实践 :computer:CODE 02: MOE 参数量和计算量Markdown, Jupyter, 文章:white_check_mark:
性能 实践 :computer:CODE 03: MFU 模型利用率评估Markdown, Jupyter, 文章:white_check_mark:

02. 通信与存储

通信与存储篇:AI 集群组网技术、高速互联方案、集合通信原理与优化、存储系统设计及大模型挑战。

编号名称具体内容状态
1集群组网之路AI 集群组网架构设计与高速互联技术解析:white_check_mark:
2网络通信进阶网络通信技术进阶:高速互联、拓扑算法与拥塞控制解析:o:
3集合通信原理通信域、通信算法、集合通信原语:white_check_mark:
4集合通信库集合通信库技术解析:MPI、NCCL 与 HCCL 架构及算法原理:white_check_mark:
5集群存储之路数据存储、CheckPoint 梯度检查点等存储与大模型结合的相关技术:white_check_mark:

03. 集群容器与云原生

AI 集群云原生篇:容器技术、K8S 编排、AI 云平台与任务调度,提升集群资源管理与应用部署效率。

编号名称具体内容
1容器时代容器技术基础与云原生架构解析,结合分布式训练应用实践
2容器初体验Docker 与 K8S 基础原理及实战,涵盖容器技术与集群管理架构解析
3深入 K8SK8S 核心机制深度解析:编排、存储、网络、调度与监控实践
4AI 云平台AI 云平台演进与云原生架构解析,涵盖持续交付与智能化运维实践

04. 分布式训练

大模型训练全解析:并行策略、加速算法、微调与评估,覆盖训练到优化的完整流程。

编号名称具体内容
14.1 分布式并行基础分布式并行的策略分类、模型适配与硬件资源优化对比
24.2 大模型并行进阶Megatron、DeepSeed 架构解析、MoE 扩展与高效训练策略
34.3 大模型训练加速大模型训练加速在算法优化、内存管理与通算融合策略解析
44.4 后训练与强化学习后训练与强化学习算法对比、框架解析与工程实践
54.5 大模型微调 SFT大模型微调算法原理、变体优化与多模态实践
64.6 大模型验证评估大模型评估、基准测试与统一框架解析

:triangular_flag_on_post: 4.1 分布式并行基础

大纲小节链接状态
分布式并行01 分布式并行框架介绍PPT, 视频
分布式并行02 DeepSpeed 介绍PPT, 视频
并行 实践 :computer:CODE 01: 从零构建 PyTorch DDPMarkdown, Jupyter, 文章:white_check_mark:
并行 实践 :computer:CODE 02: PyTorch 实现模型并行Markdown, Jupyter, 文章:white_check_mark:

:triangular_flag_on_post: 4.2 大模型并行进阶

大纲小节链接状态
分布式并行01 优化器并行 ZeRO1/2/3 原理PPT, 视频
分布式并行02 Megatron-LM 代码概览PPT, 视频
分布式并行03 大模型并行与 GPU 集群配置PPT, 视频
分布式并行04 Megatron-LM TP 原理PPT, 视频
分布式并行05 Megatron-LM TP 代码解析PPT, 视频
分布式并行06 Megatron-LM SP 代码解析PPT, 视频
分布式并行07 Megatron-LM PP 基本原理PPT, 视频
分布式并行08 流水并行 1F1B/1F1B Interleaved 原理PPT, 视频
分布式并行09 Megatron-LM 流水并行 PP 代码解析PPT, 视频
:sparkling_heart::star2::sparkling_heart:
并行 实践 :computer:CODE 01: ZeRO 显存优化实践Markdown, Jupyter, 文章:white_check_mark:
并行 实践 :computer:CODE 02: Megatron 张量并行复现Markdown, Jupyter, 文章:white_check_mark:
并行 实践 :computer:CODE 03: Pipeline 并行实践Markdown, Jupyter, 文章:white_check_mark:
并行 实践 :computer:CODE 04: 专家并行大规模训练Markdown, Jupyter, 文章:white_check_mark:

:triangular_flag_on_post: 4.3 大模型训练加速

大纲小节链接状态
大模型训练加速PPT, 文章, 视频
:sparkling_heart::star2::sparkling_heart:
并行 实践 :computer:CODE 01: Flash Attention 实现Markdown, Jupyter, 文章:white_check_mark:
并行 实践 :computer:CODE 02: 梯度检查点内存优化Markdown, Jupyter, 文章:white_check_mark:
并行 实践 :computer:CODE 03: FP8 混合精度训练Markdown, Jupyter, 文章:white_check_mark:
并行 实践 :computer:CODE 04: Ring Attention 实践Markdown, Jupyter, 文章:white_check_mark:

:triangular_flag_on_post: 4.4 大模型后训练与强化学习

大纲小节链接状态
PPT, 文章, 视频
:sparkling_heart::star2::sparkling_heart:
RL 实践 :computer:CODE 01: 经典 InstructGPT 复现Markdown, Jupyter, 文章:white_check_mark:
RL 实践 :computer:CODE 02: DPO 与 PPO 在 LLM 对比Markdown, Jupyter, 文章:white_check_mark:
RL 实践 :computer:CODE 03: LLM + GRPO 实践Markdown, Jupyter, 文章:white_check_mark:

:triangular_flag_on_post: 4.5 大模型微调 SFT

大纲小节链接状态
PPT, 文章, 视频
:sparkling_heart::star2::sparkling_heart:
SFT 实践 :computer:CODE 01: Qwen3-4B 模型微调Markdown, Jupyter, 文章:white_check_mark:
SFT 实践 :computer:CODE 02: LoRA 微调 SDMarkdown, Jupyter, 文章:white_check_mark:

:triangular_flag_on_post: 4.6 大模型验证评估

大纲小节链接状态
PPT, 文章, 视频
:sparkling_heart::star2::sparkling_heart:
EVA 实践 :computer:CODE 01: OpenCompass 评估实践Markdown, Jupyter, 文章:white_check_mark:

05. 分布式推理

大模型推理全解析:加速技术、架构优化、长序列处理与压缩方案,覆盖推理全流程与实战实践。

编号名称具体内容
15.1 基本概念大模型推理流程、框架对比与性能指标解析
25.2 大模型推理加速大模型推理加速中 KV 缓存优化、算子改进与高效引擎解析
35.3 架构调度加速架构调度加速中缓存优化、批处理与分布式系统调度解析
45.4 长序列推理长序列推理算法优化、并行策略与高效生成方法解析
55.5 输出采样推理输出采样的基础方法、加速策略与 MOE 推理优化
65.6 大模型压缩低精度量化、知识蒸馏与高效推理优化解析

:triangular_flag_on_post: 5.1 基本概念


06. 大模型算法与数据

大模型算法与数据全览:Transformer 架构、MoE 创新、多模态模型与数据工程全流程实践。

编号名称具体内容状态
1Transformer 架构Transformer 架构原理深度介绍:white_check_mark:
2MoE 架构MoE(Mixture of Experts) 混合专家模型架构原理与细节实现:white_check_mark:
3创新架构SSM、MMABA、RWKV、Linear Transformer、JPEA 等新大模型结构:o:
4图文生成与理解多模态对齐、生成、理解及统一多模态架构解析:o:
5视频大模型视频多模态理解与生成方法演进及 Flow Matching 应用:o:
6语音大模型语音多模态识别、合成与端到端模型演进及推理应用:o:
7数据工程数据工程、Prompt Engine 等相关技术:o:

:triangular_flag_on_post: Transformer 架构详细内容

大纲小节链接状态
Transformer 架构01 Transformer 基础结构PPT, 视频, 文章:white_check_mark:
Transformer 架构02 大模型 Tokenizer 算法PPT, 视频, 文章:white_check_mark:
Transformer 架构03 大模型 Embedding 算法PPT, 视频, 文章:white_check_mark:
Transformer 架构04 Attention 注意力机制PPT, 视频, 文章:white_check_mark:
Transformer 架构05 Attention 变种算法PPT, 视频, 文章:white_check_mark:
Transformer 架构06 Transformer 长序列架构PPT, 视频, 文章:white_check_mark:
Transformer 架构07 大模型参数设置PPT, 视频, 文章:white_check_mark:
:sparkling_heart::star2::sparkling_heart:
Transformer 实践 :computer:01 搭建迷你 TransformerMarkdown, Jupyter:white_check_mark:
Transformer 实践 :computer:02 从零实现 Transformer 训练Markdown, Jupyter:white_check_mark:
Transformer 实践 :computer:03 实战 Transformer 机器翻译Markdown, Jupyter:white_check_mark:
Transformer 实践 :computer:04 手把手实现核心机制 Sinusoidal 编码Markdown, Jupyter:white_check_mark:
Transformer 实践 :computer:05 手把手实现核心机制 BPE 分词算法Markdown, Jupyter:white_check_mark:
Transformer 实践 :computer:06 手把手实现核心机制 Embedding 词嵌入Markdown, Jupyter:white_check_mark:
Transformer 实践 :computer:07 深入注意力机制 MHA、MQA、GQA、MLAMarkdown, Jupyter:white_check_mark:

:triangular_flag_on_post: MOE 架构原理详细内容

大纲小节链接状态
MOE 基本介绍01 MOE 架构剖析PPT, 视频, 文章:white_check_mark:
MOE 前世今生02 MOE 前世今生PPT, 视频, 文章:white_check_mark:
MOE 核心论文03 MOE 奠基论文PPT, 视频, 文章:white_check_mark:
MOE 核心论文04 MOE 初遇 RNNPPT, 视频, 文章:white_check_mark:
MOE 核心论文05 GSard 解读PPT, 视频, 文章:white_check_mark:
MOE 核心论文06 Switch Trans 解读PPT, 视频, 文章:white_check_mark:
MOE 核心论文07 GLaM & ST-MOE 解读PPT, 视频, 文章:white_check_mark:
MOE 核心论文08 DeepSeek MOE 解读PPT, 视频, 文章:white_check_mark:
MOE 架构原理09 MOE 模型可视化PPT, 视频, 文章:white_check_mark:
大模型遇 MOE10 MoE 参数与专家PPT, 视频, 文章:white_check_mark:
手撕 MOE 代码11 单机单卡 MoEPPT, 视频:white_check_mark:
手撕 MOE 代码12 单机多卡 MoEPPT, 视频:white_check_mark:
视觉 MoE13 视觉 MoE 模型PPT, 视频, 文章:white_check_mark:
:sparkling_heart::star2::sparkling_heart:
MOE 实践 :computer:01 基于 HF 实现 MOE 推理Markdown, Jupyter:white_check_mark:
MOE 实践 :computer:02 从零开始手撕 MoEMarkdown, Jupyter:white_check_mark:
MOE 实践 :computer:03 MoE 从原理到分布式实现Markdown, Jupyter:white_check_mark:
MOE 实践 :computer:04 MoE 分布式性能分析Markdown, Jupyter:white_check_mark:

07. 大模型应用

大模型应用篇:AI Agent 技术、RAG 检索增强生成与 GraphRAG,推动智能体与知识增强应用落地。

编号名称具体内容
00大模型热点OpenAI、WWDC、GTC 等大会技术洞察
01Agent 简单概念AI Agent 智能体的原理、架构
02Agent 核心技术深入 AI Agent 原理和核心
03检索增强生成(RAG)检索增强生成技术的介绍
04自动驾驶端到端自动驾驶技术原理解析,萝卜快跑对产业带来的变化
05具身智能关于对具身智能的技术原理、具身架构和产业思考
06生成推荐推荐领域的革命发展历程,大模型迎来了生成式推荐新的增长
07AI 安全隐私计算发展过程,隐私计算未来发展如何?
08AI 历史十年过去十年 AI 大事件回顾,2012 到 2025 从模型、算法、芯片硬件发展

知识清单

大模型系统全栈

Contributing to AIInfra

Considering contibuting to AIInfra? To get started, please take a moment to read the CONTRIBUTING.md guide.

Join Aim contributors by submitting your first pull request. Happy coding! 😊

Made with contrib.rocks.

备注

这个仓已经到达疯狂的 10G 啦(ZOMI 把所有制作过程、高清图片都原封不动提供),如果你要 git clone 会非常的慢,因此建议优先到 Releases · chenzomi12/AIInfra 来下载你需要的内容!

请大家尊重开源和 ZOMI 和贡献者的努力,引用 PPT 的内容请规范转载标明出处哦!