跳到主要内容

8 篇文档带有标签「L2」

查看所有标签

Triton 编译器源码级实战

沿 Python DSL → AST → TTIR → TTGIR → LLVM IR/PTX 的多级 lowering 链路拆解 Triton 编译器,并亲手 dump 各级 IR 观察 fused softmax kernel 的编译全过程。

数据管道与存储

从批/流 ETL、数据契约与质量门禁、PII 脱敏到 DVC 数据版本化与血缘,构建可信、可复现、可治理的 AI 数据管道。

数据集采样、分片与课程学习

从预训练语料采样策略、分布式数据分片、epoch 与 token 预算到课程学习(Curriculum Learning),构建可复现、无重复、负载均衡的训练数据供给层。

极致算子实战案例 (SOTA Kernel)

拆解 FlashAttention 家族(FA-1/2/3)的 tiling + online softmax + 重计算三板斧,量化与 MoE 内核工程,并用 Triton 手写简化 FlashAttention 与 PyTorch SDPA 对数值、对速度。

流式 ETL 与 Embedding 管道

从 Kafka+Flink 流式 ETL、窗口与 exactly-once 到 Embedding 批量/增量/backfill 管道,衔接 L2.1 批处理与 L2.2 向量库/RAG 在线更新。

特征与向量存储

从 Feast 离线/在线双 store 到 HNSW/IVF/PQ 向量索引权衡,建立 AI 系统「特征与向量」存储层的工程化系统观。

经典 CUDA 编程精要与进阶

从 Thread/Block/Grid 层次映射到 Shared Memory、Bank Conflict、cp.async 双缓冲与 Hopper TMA,手写 tiled GEMM 实测加速比,建立 CUDA 高性能 kernel 的硬核工程直觉。