高性能计算
硬件架构章给了 Roofline 模型:性能上限由算力与显存带宽的较小者决定。但真实代码很少自己逼近上限——差距要靠手写与调优 kernel 来填补。本章讲 kernel 层的工程:怎么写 CUDA、怎么评估和优化一个算子、以及大模型时代最重要的一个 kernel 家族(attention)是如何被重写的。
本章节内容:
- CUDA 编程模型——线程层次、shared memory、stream/event 同步、CUDA Graph 与资源管理。
- 算子优化与融合——Triton vs CUDA、算子融合的收益评估、coalescing/bank conflict/occupancy 的权衡。
- Attention Kernel:FlashAttention 与它的后继者——IO-aware 设计如何把 attention 从显存囚笼里解放出来。
与框架与编译章的分界:本章讲 kernel 本身(换一种框架它依然成立),框架章讲图的构建与编译(Dynamo/Inductor/TVM 如何生成或调度这些 kernel)。