训练 / 微调
底座硬件与框架层都认识了,这一章回答:怎么在成百上千张卡上把一个模型的"能力"调出来。从预训练的万亿 token,到后训练的对齐与推理能力,再到资源受限下的参数高效微调与强化学习训练系统,最后是训练框架选型、显存优化与训练 Infra 三篇工程实战。
本章节内容:
- 预训练——scaling law、数据管道与训练循环。
- 后训练——SFT、RLHF 与对齐的 Infra 视角。
- 参数高效微调——LoRA 家族:不动基座,只训增量。
- 强化学习训练系统——rollout、训练与奖励的三方协作。
- 训练框架选型——Megatron、DeepSpeed、FSDP 与 Accelerate 的结构与取舍。
- 显存优化与 Offload——显存四要素估算、激活检查点、ZeRO-Offload 与 CPU/NVMe offload。
- 训练 Infra——数据管道、恢复一致性、实验管理与长上下文/多模态挑战。
并行策略(DP/TP/PP/SP/EP 的机制与数学)已独立成并行策略章。贯穿本章的分析工具是芯片架构篇建立的 Roofline 与