Skip to content

AI Infra ​

从一颗芯片到一个集群、从一次训练到一次推理服务,用数量级估算理解大模型基础设施的每一层设计。

本教程按"从物理层到系统层、从训练到服务"组织为十二章:前四章讲硬件与分布式底座(一颗芯片、一堆芯片、连接它们的网络、跑在卡上的高性能代码),中间四章讲训练主线(框架、编译、并行、训练系统),随后是量化压缩进入推理服务的主线,最后是支撑系统与性能分析收官。

第一章:硬件架构 ​

第二章:分布式系统 ​

第三章:网络与通信 ​

第四章:高性能计算 ​

第五章:框架与编译 ​

第六章:并行策略 ​

第七章:训练框架 ​

第八章:量化与稀疏 ​

第九章:推理引擎 ​

第十章:存储与 I/O ​

第十一章:平台与调度 ​

第十二章:Profiling 性能分析 ​

与 305 题面经的对照 ​

本教程同时覆盖 AI Infra 305 题面经的 23 个模块,对照如下:

题库模块(题号)对应章节
PyTorch 底层(1–15)第五章 PyTorch 内部机制
TensorFlow 与 XLA(16–20)第五章 AI 编译器
自定义算子开发(21–30)第四章 算子优化与融合
编译器优化(31–45)第五章 AI 编译器
数据并行(46–60)第六章 数据并行
模型并行与流水线(61–75)第六章 张量并行、流水并行
显存优化与 Offload(76–85)第七章 显存优化与 Offload
通信优化(86–95)第三章 NCCL 与通信优化
推理引擎(96–115)第九章 推理引擎版图 及各机制篇
量化与压缩(116–130)第八章 量化基础、主流量化方法、蒸馏剪枝稀疏
服务化与调度(131–145)第十一章 推理服务设计
训练框架(146–160)第七章 训练框架选型、训练 Infra
存储与 IO(161–170)第十章 存储与 I/O
集群调度(171–180)第十一章 集群调度
性能分析工具(181–195)第十二章 Profiling
优化技术(196–215)第四章 Attention Kernel、第六章并行策略、第七章显存优化
训练平台设计(216–235)第十一章 训练平台设计
推理平台设计(236–255)第十一章 推理服务设计
C++/CUDA 编程(256–270)第四章 CUDA 编程模型
Python 高级(271–280)第五章 PyTorch 内部机制、训练 Infra 中按需展开
算法与数据结构(281–290)第十一章 推理服务设计(LRU/限流)、存储与 I/O(哈希/索引)中按需展开
网络(291–300)第三章 RDMA 与高性能网络
存储与虚拟化(301–305)第十一章 集群调度
最近更新