AI Infra
从一颗芯片到一个集群、从一次训练到一次推理服务,用数量级估算理解大模型基础设施的每一层设计。
本教程按"从物理层到系统层、从训练到服务"组织为十二章:前四章讲硬件与分布式底座(一颗芯片、一堆芯片、连接它们的网络、跑在卡上的高性能代码),中间四章讲训练主线(框架、编译、并行、训练系统),随后是量化压缩进入推理服务的主线,最后是支撑系统与性能分析收官。
第一章:硬件架构
第二章:分布式系统
第三章:网络与通信
第四章:高性能计算
第五章:框架与编译
第六章:并行策略
第七章:训练框架
第八章:量化与稀疏
第九章:推理引擎
第十章:存储与 I/O
第十一章:平台与调度
第十二章:Profiling 性能分析
与 305 题面经的对照
本教程同时覆盖 AI Infra 305 题面经的 23 个模块,对照如下:
| 题库模块(题号) | 对应章节 |
|---|---|
| PyTorch 底层(1–15) | 第五章 PyTorch 内部机制 |
| TensorFlow 与 XLA(16–20) | 第五章 AI 编译器 |
| 自定义算子开发(21–30) | 第四章 算子优化与融合 |
| 编译器优化(31–45) | 第五章 AI 编译器 |
| 数据并行(46–60) | 第六章 数据并行 |
| 模型并行与流水线(61–75) | 第六章 张量并行、流水并行 |
| 显存优化与 Offload(76–85) | 第七章 显存优化与 Offload |
| 通信优化(86–95) | 第三章 NCCL 与通信优化 |
| 推理引擎(96–115) | 第九章 推理引擎版图 及各机制篇 |
| 量化与压缩(116–130) | 第八章 量化基础、主流量化方法、蒸馏剪枝稀疏 |
| 服务化与调度(131–145) | 第十一章 推理服务设计 |
| 训练框架(146–160) | 第七章 训练框架选型、训练 Infra |
| 存储与 IO(161–170) | 第十章 存储与 I/O |
| 集群调度(171–180) | 第十一章 集群调度 |
| 性能分析工具(181–195) | 第十二章 Profiling |
| 优化技术(196–215) | 第四章 Attention Kernel、第六章并行策略、第七章显存优化 |
| 训练平台设计(216–235) | 第十一章 训练平台设计 |
| 推理平台设计(236–255) | 第十一章 推理服务设计 |
| C++/CUDA 编程(256–270) | 第四章 CUDA 编程模型 |
| Python 高级(271–280) | 第五章 PyTorch 内部机制、训练 Infra 中按需展开 |
| 算法与数据结构(281–290) | 第十一章 推理服务设计(LRU/限流)、存储与 I/O(哈希/索引)中按需展开 |
| 网络(291–300) | 第三章 RDMA 与高性能网络 |
| 存储与虚拟化(301–305) | 第十一章 集群调度 |