AI 系统工程端到端全景
从硅晶片到 AI Agent 的完整技术栈定位,建立 AI Infra 工程师的全局系统观。
从硅晶片到 AI Agent 的完整技术栈定位,建立 AI Infra 工程师的全局系统观。
建立全站统一的实 操准入基线——Python/Docker/kind/CUDA Toolkit 工具栈、本地硬核与云端低成本两套硬件方案、按层安装原则,并用一个最小可复现 Docker 环境跑通第一个 Hello-Infra 脚本。
拆解 AI 算力背后的三堵物理墙——算力墙、显存墙、通信墙,用 Roofline 模型与真实 HBM/NVLink/InfiniBand 数字建立硬件瓶颈的第一手认知。
对齐 AI Infra 硬核路径的入场券——Modern C++、Python C-API/pybind11、计算机系统结构与编译原理三段式,并用 pybind11 把 C++ 算子挂回 Python。
从 AI Infra 视角速通线性代数/概率统计/ML 基本概念与训练循环,理解为何线代决定算子是 GEMM、训练循环如何映射到显存占用,并用纯 NumPy 手写一个两层 MLP 跑通前向与反向传播。
从磁盘到 GPU 的喂数据全链路——剖析数据加载与 Tokenization 的 I/O 阻塞、POSIX 与对象存储的吞吐差异、Ray Data/JuiceFS 缓存加速,并用 DataLoader 实测吞吐曲线。