TensorRT-LLM 与 ONNX Runtime
从 TensorRT-LLM build 引擎、Inflight Batching 到 ONNX 导出、图手术与 ORT Execution Provider,与 vLLM 对照完成 NVIDIA 极致运行时与跨框架部署两条路径的动手闭环。
从 TensorRT-LLM build 引擎、Inflight Batching 到 ONNX 导出、图手术与 ORT Execution Provider,与 vLLM 对照完成 NVIDIA 极致运行时与跨框架部署两条路径的动手闭环。
系统拆解 LLM 推理加速的四大机制——投机采样、Prefix Caching、量化与动态 batching,从原理到 SLA 工程落地,并动手对比 AWQ/GPTQ 量化的显存、时延与精度损失。