跳到主要内容

10 篇文档带有标签「L1」

查看所有标签

GPU Operator 与 Device Plugin 部署

从 NVIDIA GPU Operator 组件栈、device plugin 上报机制、DCGM 监控到 MIG 分区,给出生产级 GPU 节点「从裸机到可调度」的声明式部署清单与验收步骤。

Linux cgroups、NUMA 与 IRQ 亲和

从 cgroups v2 资源隔离、NUMA 本地内存亲和、IRQ 与 CPU 绑核到 GPU 喂数路径,讲清单机 AI 训练/推理「系统侧」吞吐杀手与可复现调优手段。

Slurm 与 Ray 作业提交基础

从 Slurm 分区/GRES/sbatch 到 Ray cluster 与 ray job submit,给出与 K8s 对照的 GPU 批调度最小可运行示例,覆盖科研超算与 RLHF 流水线两类心智模型。

主流厂商 AI 芯片对比

横评 NVIDIA Blackwell Ultra(B300)/Rubin、华为昇腾 910C+CloudMatrix、AMD MI350/MI400、Google TPU v7、AWS Trainium 的算力 / HBM / 互联与算子编程方案,建立 2026 视角下可量化的 AI 芯片选型框架。

单卡异构芯片微架构深挖

深入 NVIDIA GPU 的 SM 内部结构与 Warp 调度、Hopper/Blackwell Tensor Core 的 FP8/FP4 硬件支持,以及华为昇腾达芬奇架构的 Cube/Vector/Scalar 三单元异步协作。

多地域与混合云算力网络

当单一物理集群受限于电力、空间与单点故障,如何用跨地域与混合云算力网络做容灾、联邦训练与多活推理,并量化 RTO/RPO。

现代 AI 存储架构优化

从 GPUDirect Storage 直达显存到万节点 checkpoint 风暴的工业级解法,讲透 AI 训练存储链路的带宽墙与 I/O 优化。

节点内与跨节点互联拓扑

从卡内 NVLink/NVSwitch 全连接到跨节点 InfiniBand/RoCE v2,拆解千卡集群的互联拓扑、RDMA 零拷贝与拥塞控制,理解 All-Reduce 为何被跨节点带宽卡住木桶。

资源调度与编排

从 K8s GPU device plugin、Gang 调度、拓扑感知亲和性到 Slurm/Ray 与 MIG/vGPU 隔离,讲透 AI 集群「把卡调对、把卡用满」的工业级编排原理与实操。