算子 Shape 泛化与性能分析
从静态 Padding 算力浪费讲到动态 Bucket/Padding-Free,再用 Roofline 模型与 PyTorch Profiler/Nsight 完成算子级 Memory-Bound vs Compute-Bound 定位与归因。
从静态 Padding 算力浪费讲到动态 Bucket/Padding-Free,再用 Roofline 模型与 PyTorch Profiler/Nsight 完成算子级 Memory-Bound vs Compute-Bound 定位与归因。