TensorRT-LLM 与 ONNX Runtime
从 TensorRT-LLM build 引擎、Inflight Batching 到 ONNX 导出、图手术与 ORT Execution Provider,与 vLLM 对照完成 NVIDIA 极致运行时与跨框架部署两条路径的动手闭环。
从 TensorRT-LLM build 引擎、Inflight Batching 到 ONNX 导出、图手术与 ORT Execution Provider,与 vLLM 对照完成 NVIDIA 极致运行时与跨框架部署两条路径的动手闭环。
拆解 vLLM PagedAttention 与 Continuous Batching 的工业级 Serving 内核,对比 TensorRT-LLM / TGI / Triton 的运行时定位,并动手压测 KV Cache 占用与吞吐。