推理加速机制
系统拆解 LLM 推理加速的四大机制——投机采样、Prefix Caching、量化与动态 batching,从原理到 SLA 工程落地,并动手对比 AWQ/GPTQ 量化的显存、时延与精度损失。
系统拆解 LLM 推理加速的四大机制——投机采样、Prefix Caching、量化与动态 batching,从原理到 SLA 工程落地,并动手对比 AWQ/GPTQ 量化的显存、时延与精度损失。
拆解 FlashAttention 家族(FA-1/2/3)的 tiling + online softmax + 重计算三板斧,量化与 MoE 内核工程,并用 Triton 手写简化 FlashAttention 与 PyTorch SDPA 对数值、对速度。