万卡集群弹性容错
从 NCCL/HCCL 集合通信底层到万卡训练的秒级故障剔除、热备卡拉起与无重启热恢复,构建长周期训练的弹性容错系统观。
从 NCCL/HCCL 集合通信底层到万卡训练的秒级故障剔除、热备卡拉起与无重启热恢复,构建长周期训练的弹性容错系统观。
FSDP / DeepSpeed / DDP 选型与调优、Megatron-Core 并行、BF16/FP16/FP8 混合精度策略、分布式 checkpoint 与恢复、scaling laws 与超参 sweeps——从框架原理到亲手落一份可恢复的分片 checkpoint。
拆解数据并行/张量并行/流水线并行(含 1F1B 气泡控制)与序列/上下文/专家并行,从 Megatron-LM 与 DeepSpeed 源码视角理解 3D 并行的通信代价与切分策略。
拆解混合精度训练的显存账本,逐阶推导 ZeRO-1/2/3 切分 optimizer state / gradient / parameter 的显存与通信复杂度,并在 DeepSpeed 中实测三档 stage 的峰值显存与吞吐。
手写并注册一个经典 LLVM Pass、从零自研一个完整 MLIR Dialect(Op/Verifier/Lowering),并亲手编译 LLVM 跑通 Pass 验证语义不变——打通 AI 编译器的最后一公里。