框架与编译
高性能计算章讲了 kernel 怎么写,但没有人手写大模型的每一个 kernel——框架负责把用户代码变成计算图,编译器负责把计算图变成高效的 kernel 序列。本章讲这一层:框架的内部机制(理解它才能调试和扩展它),以及 torch.compile 与 AI 编译器的技术路线。
本章节内容:
- PyTorch 内部机制——autograd、dispatch、CachingAllocator、hook 与混合精度:框架的五个地基。
- torch.compile:Dynamo → Inductor → Triton——PyTorch 2.x 的编译栈如何把 Python 代码变成融合 kernel。
- AI 编译器:XLA、TVM、MLIR 与 TensorRT——四条技术路线的对比与取舍。