Agent 与多步推理
从 Agent 路由与 fallback、ReAct 反思循环到 DAG vs Agentic 编排权衡,拆解「让大模型自主完成多步任务」的工程内核与失败模式。
从 Agent 路由与 fallback、ReAct 反思循环到 DAG vs Agentic 编排权衡,拆解「让大模型自主完成多步任务」的工程内核与失败模式。
覆盖 AI 系统独有故障模式(静默质量退化、embedding 版本不匹配、prompt 注入)、SEV 分级与响应时限、MTTR 五阶段、OnCall SOP 与 blameless postmortem 五件套模板,附 RAG 质量骤降 Tabletop 演练。
从硅晶片到 AI Agent 的完整技术栈定位,建立 AI Infra 工程师的全局系统观。
从 NVIDIA GPU Operator 组件栈、device plugin 上报机制、DCGM 监控到 MIG 分区,给出生产级 GPU 节点「从裸机到可调度」的声明式部署清单与验收步骤。
从 Pod、Deployment、Service、Ingress 到 ConfigMap/Secret,建立读懂 AI 集群 YAML 与排查 Pending/CrashLoop 的 K8s 基础,为 L1.4 调度与编排章提供前置。
从 cgroups v2 资源隔离、NUMA 本地内存亲和、IRQ 与 CPU 绑核到 GPU 喂数路径,讲清单机 AI 训练/推理「系统侧」吞吐杀手与可复现调优手段。
LLMOps 区别于传统 MLOps 的三件「特有武器」——Prompt 工程化与版本化、模型网关审计与安全、护栏与内容安全管线,并动手给 LLM 网关接入双向护栏拦截越权请求。
用 OpenTelemetry Span 把 RAG/Agent 的 retrieve→rerank→llm→tool 串成端到端 Trace,覆盖 context 透传、GenAI 语义约定、tail-based sampling 与可运行 Python 实验。
拆解 RAG 的 chunking→embedding→检索→rerank→LLM 全链路、向量索引与混合检索优化、以及用 RAGAS 做离线评估与在线 A/B 的工程方法论。
从 Slurm 分区/GRES/sbatch 到 Ray cluster 与 ray job submit,给出与 K8s 对照的 GPU 批调度最小可运行示例,覆盖科研超算与 RLHF 流水线两类心智模型。
从 TensorRT-LLM build 引擎、Inflight Batching 到 ONNX 导出、图手术与 ORT Execution Provider,与 vLLM 对照完成 NVIDIA 极致运行时与跨框架部署两条路径的动手闭环。
沿 Python DSL → AST → TTIR → TTGIR → LLVM IR/PTX 的多级 lowering 链路拆解 Triton 编译器,并亲手 dump 各级 IR 观察 fused softmax kernel 的编译全过程。
从 NCCL/HCCL 集合通信底层到万卡训练的秒级故障剔除、热备卡拉起与无重启热恢复,构建长周期训练的弹性容错系统观。
横评 NVIDIA Blackwell Ultra(B300)/Rubin、华为昇腾 910C+CloudMatrix、AMD MI350/MI400、Google TPU v7、AWS Trainium 的算力 / HBM / 互联与算子编程方案,建立 2026 视角下可量化的 AI 芯片选型框架。
FSDP / DeepSpeed / DDP 选型与调优、Megatron-Core 并行、BF16/FP16/FP8 混合精度策略、分布式 checkpoint 与恢复、scaling laws 与超参 sweeps——从框架原理到亲手落一份可恢复的分片 checkpoint。
拆解数据并行/张量并行/流水线并行(含 1F1B 气泡控制)与序列/上下文/专家并行,从 Megatron-LM 与 DeepSpeed 源码视角理解 3D 并行的通信代价与切分策略。
深入 NVIDIA GPU 的 SM 内部结构与 Warp 调度、Hopper/Blackwell Tensor Core 的 FP8/FP4 硬件支持,以及华为昇腾达芬奇架构的 Cube/Vector/Scalar 三单元异步协作。
当单一物理集群受限于电力、空间与单点故障,如何用跨地域与混合云算力网络做容灾、联邦训练与多活推理,并量化 RTO/RPO。
建立全站统一的实操准入基线——Python/Docker/kind/CUDA Toolkit 工具栈、本地硬核与云端低成本两套硬件方案、按层安装原则,并用一个最小可复现 Docker 环境跑通第一个 Hello-Infra 脚本。
用 MLflow Tracking 与 Model Registry 把「炼丹」变成可复现、可追溯、可晋升的工业流程,配合 W&B Sweeps 做系统化超参搜索。
把「测得准、可复现」做成工程纪律——控制变量、warmup、多次采样取中位数/p99、报告方差与环境;并给出 Engineer→Senior→Architect 的能力梯度与贯穿全栈的 Portfolio 项目设计。
从多租户隔离与配额、审计合规、零信任 AI 基础设施(MIG/vGPU/RBAC/mTLS)到架构师如何用技术 RFC 驱动系统与编译器架构演进,建立平台级治理的全局方法论。
拆解 AI 算力背后的三堵物理墙——算力墙、显存墙、通信墙,用 Roofline 模型与真实 HBM/NVLink/InfiniBand 数字建立硬件瓶颈的第一手认知。
对齐 AI Infra 硬核路径的入场券——Modern C++、Python C-API/pybind11、计算机系统结构与编译原理三段式,并用 pybind11 把 C++ 算子挂回 Python。
多模型路由、边缘-云混合推理与容量规划的成本工程,配套一套推理慢路径排障 playbook 与可在纯 CPU 跑通的双模型路由网关实验。
系统拆解 LLM 推理加速的四大机制——投机采样、Prefix Caching、量化与动态 batching,从原理到 SLA 工程落地,并动手对比 AWQ/GPTQ 量化的显存、时延与精度损失。
拆解 vLLM PagedAttention 与 Continuous Batching 的工业级 Serving 内核,对比 TensorRT-LLM / TGI / Triton 的运行时定位,并动手压测 KV Cache 占用与吞吐。
从 AI Infra 视角速通线性代数/概率统计/ML 基本概念与训练循环,理解为何线代决定算子是 GEMM、训练循环如何映射到显存占用,并用纯 NumPy 手写一个两层 MLP 跑通前向与反向传播。
从磁盘到 GPU 的喂数据全链路——剖析数据加载与 Tokenization 的 I/O 阻塞、POSIX 与对象存储的吞吐差异、Ray Data/JuiceFS 缓存加速,并用 DataLoader 实测吞吐曲线。
从批/流 ETL、数据契约与质量门禁、PII 脱敏到 DVC 数据版本化与血缘,构建可信、可复现、可治理的 AI 数据管道。
从预训练语料采样策略、分布式数据分片、epoch 与 token 预算到课程学习(Curriculum Learning),构建可复现、无重复、负载均衡的训练数据供给层。
拆解混合精度训练的显存账本,逐阶推导 ZeRO-1/2/3 切分 optimizer state / gradient / parameter 的显存与通信复杂度,并在 DeepSpeed 中实测三档 stage 的峰值显存与吞吐。
拆解 FlashAttention 家族(FA-1/2/3)的 tiling + online softmax + 重计算三板斧,量化与 MoE 内核工程,并用 Triton 手写简化 FlashAttention 与 PyTorch SDPA 对数值、对速度。
从 Kafka+Flink 流式 ETL、窗口与 exactly-once 到 Embedding 批量/增量/backfill 管道,衔接 L2.1 批处理与 L2.2 向量库/RAG 在线更新。
把模型与 Prompt 纳入 CI/CD,用金丝雀/影子/蓝绿安全发布,靠 IaC 与 GitOps 声明式治理——构建可回滚、可门禁、可审计的 AI 发布流水线。
拆解 torch.compile 三驾马车与 MLIR 多级 Dialect 下沉机制,打通「Python 模型代码 → IR → 硬件 kernel」的编译链路认知。
从 Feast 离线/在线双 store 到 HNSW/IVF/PQ 向量索引权衡,建立 AI 系统「特征与向量」存储层的工程化系统观。
从 GPUDirect Storage 直达显存到万节点 checkpoint 风暴的工业级解法,讲透 AI 训练存储链路的带宽墙与 I/O 优化。
手写并注册一个经典 LLVM Pass、从零自研一个完整 MLIR Dialect(Op/Verifier/Lowering),并亲手编译 LLVM 跑通 Pass 验证语义不变——打通 AI 编译器的最后一公里。
站在编译器与硬件抽象的视角,构想下一代 AI Infra 的终极工程形态——具 HAL 能力的统一 IR、AI-First 智能编译器与跨平台 LLM-Native 编译框架,并以一份「统一 IR 设计」技术 RFC 收束全站之旅。
从 Thread/Block/Grid 层次映射到 Shared Memory、Bank Conflict、cp.async 双缓冲与 Hopper TMA,手写 tiled GEMM 实测加速比,建立 CUDA 高性能 kernel 的硬核工程直觉。
从卡内 NVLink/NVSwitch 全连接到跨节点 InfiniBand/RoCE v2,拆解千卡集群的互联拓扑、RDMA 零拷贝与拥塞控制,理解 All-Reduce 为何被跨节点带宽卡住木桶。
从 K8s GPU device plugin、Gang 调度、拓扑感知亲和性到 Slurm/Ray 与 MIG/vGPU 隔离,讲透 AI 集群「把卡调对、把卡用满」的工业级编排原理与实操。