跳到主要内容

1 篇文档带有标签「speculative-decoding」

查看所有标签

推理加速机制

系统拆解 LLM 推理加速的四大机制——投机采样、Prefix Caching、量化与动态 batching,从原理到 SLA 工程落地,并动手对比 AWQ/GPTQ 量化的显存、时延与精度损失。