跳到主要内容

5 篇文档带有标签「L3」

查看所有标签

万卡集群弹性容错

从 NCCL/HCCL 集合通信底层到万卡训练的秒级故障剔除、热备卡拉起与无重启热恢复,构建长周期训练的弹性容错系统观。

主流框架与工具实践

FSDP / DeepSpeed / DDP 选型与调优、Megatron-Core 并行、BF16/FP16/FP8 混合精度策略、分布式 checkpoint 与恢复、scaling laws 与超参 sweeps——从框架原理到亲手落一份可恢复的分片 checkpoint。

分布式训练范式与 3D 并行

拆解数据并行/张量并行/流水线并行(含 1F1B 气泡控制)与序列/上下文/专家并行,从 Megatron-LM 与 DeepSpeed 源码视角理解 3D 并行的通信代价与切分策略。

显存优化与 ZeRO

拆解混合精度训练的显存账本,逐阶推导 ZeRO-1/2/3 切分 optimizer state / gradient / parameter 的显存与通信复杂度,并在 DeepSpeed 中实测三档 stage 的峰值显存与吞吐。