跳到主要内容

3 篇文档带有标签「deepspeed」

查看所有标签

主流框架与工具实践

FSDP / DeepSpeed / DDP 选型与调优、Megatron-Core 并行、BF16/FP16/FP8 混合精度策略、分布式 checkpoint 与恢复、scaling laws 与超参 sweeps——从框架原理到亲手落一份可恢复的分片 checkpoint。

分布式训练范式与 3D 并行

拆解数据并行/张量并行/流水线并行(含 1F1B 气泡控制)与序列/上下文/专家并行,从 Megatron-LM 与 DeepSpeed 源码视角理解 3D 并行的通信代价与切分策略。

显存优化与 ZeRO

拆解混合精度训练的显存账本,逐阶推导 ZeRO-1/2/3 切分 optimizer state / gradient / parameter 的显存与通信复杂度,并在 DeepSpeed 中实测三档 stage 的峰值显存与吞吐。