经典 CUDA 编程精要与进阶
从 Thread/Block/Grid 层次映射到 Shared Memory、Bank Conflict、cp.async 双缓冲与 Hopper TMA,手写 tiled GEMM 实测加速比,建立 CUDA 高性能 kernel 的硬核工程直觉。
从 Thread/Block/Grid 层次映射到 Shared Memory、Bank Conflict、cp.async 双缓冲与 Hopper TMA,手写 tiled GEMM 实测加速比,建立 CUDA 高性能 kernel 的硬核工程直觉。