GPU Operator 与 Device Plugin 部署
从 NVIDIA GPU Operator 组件栈、device plugin 上报机制、DCGM 监控到 MIG 分区,给出生产级 GPU 节点「从裸机到可调度」的声明式部署清单与验收步骤。
从 NVIDIA GPU Operator 组件栈、device plugin 上报机制、DCGM 监控到 MIG 分区,给出生产级 GPU 节点「从裸机到可调度」的声明式部署清单与验收步骤。
从 Pod、Deployment、Service、Ingress 到 ConfigMap/Secret,建立读懂 AI 集群 YAML 与排查 Pending/CrashLoop 的 K8s 基础,为 L1.4 调度与编排章提供前置。
从 cgroups v2 资源隔离、NUMA 本地内存亲和、IRQ 与 CPU 绑核到 GPU 喂数路径,讲清单机 AI 训练/推理「系统侧」吞吐杀手与可复现调优手段。
从 Slurm 分区/GRES/sbatch 到 Ray cluster 与 ray job submit,给出与 K8s 对照的 GPU 批调度最小可运行示例,覆盖科研超算与 RLHF 流水线两类心智模型。
横评 NVIDIA Blackwell Ultra(B300)/Rubin、华为昇腾 910C+CloudMatrix、AMD MI350/MI400、Google TPU v7、AWS Trainium 的算力 / HBM / 互联与算子编程方案,建立 2026 视角下可量化的 AI 芯片选型框架。
深入 NVIDIA GPU 的 SM 内部结构与 Warp 调度、Hopper/Blackwell Tensor Core 的 FP8/FP4 硬件支持,以及华为昇腾达芬奇架构的 Cube/Vector/Scalar 三单元异步协作。
当单一物理集群受限于电力、空间与单点故障,如何用跨地域与混合云算力网络做容灾、联邦训练与多活推理,并量化 RTO/RPO。
从 GPUDirect Storage 直达显存到万节点 checkpoint 风暴的工业级解法,讲透 AI 训练存储链路的带宽墙与 I/O 优化。
从卡内 NVLink/NVSwitch 全连接到跨节点 InfiniBand/RoCE v2,拆解千卡集群的互联拓扑、RDMA 零拷贝与拥塞控制,理解 All-Reduce 为何被跨节点带宽卡住木桶。
从 K8s GPU device plugin、Gang 调度、拓扑感知亲和性到 Slurm/Ray 与 MIG/vGPU 隔离,讲透 AI 集群「把卡调对、把卡用满」的工业级编排原理与实操。