跳到主要内容

19 模型压缩与优化洞察

  • 章节编号:19
  • 所属层:M 模型层(承接 01 负载画像;驱动 02/07 精度格式、15 量化 lowering、12 内存管理)
  • 关联 ADR:ADR-042(量化策略 PTQ/QAT)、ADR-043(混合精度与校准策略)、ADR-044(稀疏/剪枝路线)、ADR-045(蒸馏与步数压缩)
  • 上游依赖:01(模型/精度基线)、02(数值格式 INT4/FP8/NVFP4)、03(KV-cache 压力)、15(量化感知 lowering)、12(运行时内存)

学习目标

  • 前置知识:读过 01 章负载画像(知道 VLA/扩散策略的算力-内存画像)、02 章数值格式(INT4/FP8/NVFP4 的 bit 布局与块缩放概念);了解「权重 footprint = 参数量 × bit ÷ 8」这条基本换算;知道扩散/流匹配动作头是「多步迭代」而非单次前向即可。无需量化算法的推导经验。
  • 学完产出:① 能算出一个 7B VLA 在 INT4 下的权重占用(≈3.5GB),并解释为什么这是「8GB 级端侧 SoC 能不能跑 VLA」的必要条件;② 能区分 PTQ 与 QAT 的适用边界,说清「8-bit 均匀量化不是安全默认」这个具身特有的反直觉结论(OpenVLA/QVLA 反例);③ 能按子模块(视觉塔 / VLM 主干 / 动作头 / KV-cache)给出精度选型,理解「视觉塔 W8A8、LLM W4A8、动作头 FP8 权重+FP16 计算」这套非对称策略的动机;④ 能把「减步」(扩散 100→5→1-NFE)当作与「量化」同等重要的压缩轴,用 NFE(函数求值次数)算出减步对延迟的直接影响;⑤ 能把压缩流水线映射到 MLIR/IREE + DSA 硬件格式(ADR-007)的接口约束上。
  • 阅读姿势:盯住一条主线——「端侧具身压缩不是单纯压模型大小,而是同时压『权重 bit』『激活 bit』『扩散步数』三个轴,且用任务 rollout 而非离线 perplexity 验收」。无论是 QVLA 的 action-centric 混合 bit,还是 OneDP 的单步蒸馏,本质都在回答同一个问题:如何在 8–16GB、几十毫秒预算内,让 VLA 的动作输出不因压缩而失真到任务失败。

1. 范围与目标

本章定义如何把 3–7B 级 VLA/扩散策略压缩到端侧可部署形态,并给出压缩流水线、精度-能效权衡与芯片/编译器/运行时的接口约束。不含大规模训练集群(仅 QAT/蒸馏所需小规模 GPU 训练);不含 RTL。

核心问题

  1. 具身主流模型(OpenVLA/π0/GR00T)在端侧需要何种压缩组合(量化/蒸馏/减步/稀疏)?
  2. PTQ vs QAT 在 VLA/扩散动作头上的精度-延迟 trade-off 如何?
  3. INT4/INT8/FP8/NVFP4 各适用于哪些子模块(视觉编码器/VLM 主干/动作头/KV-cache)?
  4. 压缩流水线如何与 MLIR 编译器 + IREE 运行时 + DSA 硬件格式(ADR-007) 对齐?
  5. 压缩后的量化芯片诉求(内存/带宽/算力)如何量化?

2. 需求洞察(具身驱动)

2.1 具体场景/任务

  • 移动抓取/装箱(Physical Intelligence π0 公开 demo;Agility Digit 仓储 tote 搬运):VLA 策略 ~30–60ms 预算,控制 50Hz–1kHz 分层。
  • 叠衣物/精细操作(π0 RTC 论文;Figure Helix onboard):流匹配/扩散动作头需多步迭代,压缩须保单步能效而非只压权重。
  • 工厂零件搬运(Figure BMW 试点;宇树/智元量产场景):端侧全本地,无云依赖,权重须落 ≤8GB 主存(ADR-003)。

2.2 由负载反推的硬性指标

指标诉求依据
权重 footprintOpenVLA 7B INT4 ≈ 3.5GB;π0 3.3B INT4 ≈ 1.7GB01 章 + OpenVLA 论文 Table 2
控制频率INT4 OpenVLA ~3Hz@A5000 vs BF16 ~5Hz;8-bit 反而更慢(~1.2Hz)OpenVLA 论文 Fig.5/Table 2
精度容忍OpenVLA 4-bit 离线 token 精度≈BF16, rollout 性能相近;8-bit 因延迟变慢导致性能下降OpenVLA Section D.4
KV-cacheVLM 前缀 o_t 可 cache;π0 动作 token 每步重算 → 激活/中间态访存是压缩第二战场π0 论文 Appendix A-D
扩散/流匹配π0 10 步 Euler→ RTC 用 5 步;步数减半 = 等效算力需求减半π0/RTC 论文
功耗量化降 DRAM 搬运 → 直接降功耗;Thor NVFP4 1.1–2.3× 吞吐 vs INT4 AWQTensorRT Edge-LLM benchmark

2.3 端 / 边 / 中心差异

形态压缩策略典型精度
端侧本体激进 INT4/NVFP4 权重 + FP8 激活 + 步数蒸馏 + RTCW4A8/W4A4
边缘侧INT8/FP8 为主,部分层 BF16;可跑更大 VLMW8A8/W8A16
中心推理FP8/BF16 全精度或稀疏;吞吐优先W8/FP16

3. 技术现状与趋势(点名 + 来源)

3.1 具身模型的压缩实践(点名)

模型/方案压缩手段效果(公开)公司/来源
OpenVLA 7BNF4 4-bit PTQ(bitsandbytes);LoRA 微调VRAM ~6–7GB;4-bit ~3Hz vs BF16 ~5Hz@A5000;rollout 精度≈BF16Stanford, arXiv:2406.09246
OpenVLA8-bit PTQ内存减半但推理更慢,Bridge 任务性能显著下降(动态不匹配)同上
π0 / π0.5流匹配 10→5 步;KV-cache 前缀;BF16 推理RTX4090 ~73–97ms/chunk(含 5 步去噪);prefill alone 46msPI arXiv:2410.24164;RTC arXiv:2506.07339
π0 RTCReal-Time Chunking(异步 chunk + inpainting)消除 chunk 间停顿;+200ms 注入延迟仍稳定PI 2025
π0 训练时 RTC训练期 action prefix conditioning消除推理期 inpainting 开销;H100 108ms vs 135msarXiv:2512.05964
NVIDIA GR00T N1.5双系统(VLM + DiT);端侧走 Jetson Thor + TensorRT 生态VLM 软实时 + DiT 动作头;具体量化未全公开NVIDIA Isaac 2025
Figure Helix 02三系统分层;S0 10M 运动先验(极小网)认知层大模型 + 控制层小网;模型分级即压缩策略figure.ai 2025
Diffusion PolicyDDIM 减步(100→10–20);小网络(数十–百 M)端侧靠小模型+减步而非大模型量化Columbia/MIT 2023

3.2 业界压缩工具链(2025–2026)

工具/栈能力采用方优劣
NVIDIA ModelOptPTQ/QAT: FP8/INT4 AWQ/NVFP4/MXFP8;ONNX 导出Jetson/DRIVE Thor, TensorRT Edge-LLM与 Blackwell NVFP4 原生对齐;闭源绑定 NVIDIA
TensorRT Edge-LLMC++ 端侧 LLM/VLM;NVFP4/INT4 AWQ/FP8;EAGLE-3 投机解码;chunked prefillJetson Thor, DRIVE AGX Thor机器人/车端生产级;纯 C++ 无 Python 推理路径
bitsandbytes / HF quantNF4/INT8 权重量化;快速实验OpenVLA 社区易用但非芯片专用;8-bit 常更慢
GPTQ/AWQ/AutoGPTQ权重量化 PTQLLM 社区通用成熟;VLA 视觉塔需单独处理
torchao / PyTorch 2.x quantFP8/INT8 动态量化;与 Inductor 协同Meta/PyTorch 生态训练友好;DSA 后端需自接
Qualcomm AI Hub / QNNINT8/INT4 量化 + 编译到 Hexagon移动端/机器人 Jetson 竞品封闭但车规成熟
自研 QAT(华为/寒武纪等)与自家编译器/格式绑定国内 AI 芯片软硬一体;迁移成本高

3.3 演进趋势

  1. 权重量化收敛 INT4/NVFP4:Blackwell NVFP4(16 值块缩放) 成为端侧 LLM/VLM 新标杆;INT4 AWQ 在 Orin 仍主流。
  2. 激活量化 FP8 普及:W4A8 / W8A8 混合;关键层(softmax/LayerNorm/动作头最后一层)保留 BF16。
  3. "减步"≈"量化"同等重要:扩散/流匹配从 100 步→10 步→5 步(一致性模型/步数蒸馏);硬件须优化单步延迟
  4. 结构化稀疏(2:4)预留但尚未在具身量产:NVIDIA 稀疏 FP4 需硬件支持(ADR-008);具身模型稀疏验证不足 → 端侧基线阶段不依赖
  5. 蒸馏走向"系统级":Helix 三系统 = 大 VLM 蒸馏/分工到小网;π0 动作专家 300M 从 VLM 分离 → 模块化蒸馏
  6. PTQ 先行、QAT 补精度:量产路径多为 PTQ 快速落地 + 关键任务 QAT/LoRA 微调(OpenVLA 已验证 LoRA+4bit)。
  7. NAS/自动结构搜索:中心/边缘高吞吐场景有 AutoML 研究(HNAS、Once-for-All 等),但端侧具身基线阶段以已知 VLA 架构 + PTQ/减步为主——NAS 作 规模化阶段前瞻(更大模型族、多租户 edge);第一代不依赖 NAS 交付。

3.4 最新学术研究(2024–2026,具身/VLA 专用)

LLM 通用量化(SmoothQuant/GPTQ/AWQ)直接套 VLA 已被证明次优——具身控制中微小 action 偏差会复合为任务失败;2025–2026 研究转向 action-centric(动作空间敏感)步数/一致性蒸馏

研究/方法机构/年份核心思想量化/压缩效果(公开)对我们的启示
QVLA / AutoQVLASJTU 等, ICLR 2026通道级非均匀 bit 分配 16;以 action-space sensitivity 而非 hidden-state 误差为优化目标;统一量化+剪枝(0-bit)OpenVLA-OFT on LIBERO:29.2% VRAM98.9% 性能1.49× 加速;较 SmoothQuant +22.6% 任务性能SDK 须支持 per-channel 混合 bit-width;校准以 rollout 为准
OpenVLA 官方 PTQStanford, 2024均匀 NF4/INT8 PTQ4-bit rollout≈BF16;8-bit 更慢且 rollout 降均匀 4-bit 可用但非最优;8-bit 有陷阱
One-Step Diffusion Policy (OneDP)NVIDIA Research, 2024预训练 Diffusion Policy → 单步 KL 蒸馏1.5Hz→62Hz;额外训练成本仅 2–10%扩散类动作头可 蒸馏为 1-NFE;极大降算力
One-Step Flow Policy (OFP)2026from-scratch 自蒸馏:self-consistency + self-guidance;无需 teacher1-NFE 超 100-NFE 扩散/流 baseline;56 仿真任务 SOTA流匹配可训练为 单步;硬件只需优化单次前向
Consistency PolicyStanford 等, 2024Diffusion Policy → CTM 一致性蒸馏~10× 推理加速;6 仿真+2 真机任务 competitive小策略网(数十–百 M)首选路径
Hybrid Consistency Policy (HCP)2025短 SDE 前缀 + 单步 consistency jump保多模态 + 实时;robotics ODE/flow 加速综述扩散/流匹配的 "前缀随机+单步收敛" 折中
FlowPolicy2024Consistency Flow Matching;无需 teacher 蒸馏3D 操作任务;one-step 生成无 teacher 的减步路径
π0 RTC / Training-Time RTCPI, 2025–2026软件层 异步 chunk + 训练期 delay conditioning5 步 76ms;RTC 97ms 但消除停顿;训练时 RTC 108ms vs 135ms减步 + RTC 与量化正交;须同时支持

学术判断:具身压缩已从"LLM 均匀低比特"演进为 (1) action-centric 混合 bit (QVLA) + (2) 扩散步数/一致性蒸馏 (OneDP/OFP/HCP) + (3) 系统级模型分级 (Helix) 三轨并行;我们硬件须原生支持 INT4/NVFP4 + 块/通道 scale,软件须支持 非对称 + 混合 bit-width lowering

3.5 TOP 级 AI 推理芯片压缩方案横向对比(2025–2026)

对标 07/15 章格式;覆盖全球+国内代表芯片在 LLM/VLM/扩散动作头 上的量化格式、工具链与机器人落地。

公司/芯片主力量化格式量化/压缩工具链具身/机器人落地(点名)优势劣势
NVIDIA Jetson/DRIVE Thor(Blackwell)NVFP4(W4A4,16 值块缩放);ViT FP8;DiT FP8;Orin 用 INT4 AWQModelOpt → ONNX → TensorRT Edge-LLM / TensorRT;EAGLE-3 投机解码Isaac GR00T N1.5:LLM nvfp4 + ViT fp8 + DiT fp8;Thor E2E ~92ms(10.9Hz) vs eager 117ms;Cosmos Reason2 8B VLM NVFP4 ~4GB格式+工具+模型 端到端闭环;机器人栈最成熟闭源;绑 NVIDIA;NVFP4 仅 Blackwell(端侧即 Thor SM110)
NVIDIA OrinINT4 AWQ, FP16TensorRT / TensorRT-LLMGR00T DiT TRT:Orin ~173ms(5.8Hz)量产基数大无 NVFP4/FP8;VLA 频率偏低
Qualcomm Dragonwing IQ10INT8/INT4(Hexagon);700 TOPS 宣称QNN + AI Hub 量化编译;MLOps/DevOpsCES 2026 Physical AI 全栈;VLA/VLM 感知→规划→操控;VinMotion/Booster 等人形车规/功能安全子系统;端侧 VLA 战略明确大模型量化细节少于 NVIDIA;生态 building
Google TPU(云/Edge)INT8/INT4(训练友好);无 NVFP4XLA quant + OpenXLA;JAX 生态Gemini Robotics 云训练;On-Device 端侧优化(细节未公开)编译兼容;图融合强端侧芯片不外卖;闭源
Google DeepMind Gemini On-Device未公开(推测 INT8/混合)Gemini Robotics SDK;50–100 demo 微调双臂/Apollo 人形;本地低延迟;Boston Dynamics Atlas 2026双模型 VLA+ER;跨本体仅合作伙伴;格式不透明
华为昇腾 310P/910BW8A8 / W4A8;OptiQuant 混精;无原生 FP8→INT8 对齐CANN AMCT + llm-compressor;ATC → .omπ0 on 310P(LeRobot):FP16 ~430ms/步;叠衣 demo;BF16→FP16 适配国产可控;Cube INT8 算力≈2× FP16310P 无 BF16;VLA 延迟高;机器人栈较新
寒武纪 MLUINT8/INT4CNCC + 框架接入通用 LLM;具身案例少开放 BANG C + Triton 接入具身生态弱
地平线 BPUINT8 为主(编译器自动)天工开物;替换算子模式车载感知;具身"大脑"非主战场利用率/能效高新算子难上 BPU;不适合快速演进 VLA
Groq LPUINT8/INT4;权重复制到 SRAMGroqFlow(MLIR);静态调度云/低延迟 LLM;非端侧具身确定性、零抖动端侧不可行;封闭
Tesla AI5/FSD推测 INT8/稀疏/私有低比特全私有Optimus 端侧本地极致软硬协同零生态
Physical Intelligence量产多用 BF16;压缩靠 减步+RTCPyTorch;硬件中立π0/π0.5/π0.7;不绑芯片量化栈模型中立;客户可选我们未发布官方 INT4 权重

横向规律(2025–2026):

  1. TOP 端侧机器人 = NVFP4/INT4 权重 + FP8 视觉/扩散 + TensorRT 类 AOT 编译——NVIDIA 已用 GR00T on Thor 验证。
  2. 8-bit 均匀量化不是安全默认——OpenVLA 与 QVLA 均证明:具身要看 action rollout,且 混合 bit 优于均匀 8-bit
  3. 扩散/流匹配动作头:NVIDIA OneDP、PI π0 减步、Consistency/OFP 表明 "蒸馏到 1–5 步"与权重量化同等重要
  4. 国内端侧现状:昇腾 310P 可跑 π0(FP16 ~430ms)但离实时远 → 我们若 INT4/NVFP4 + 减步 + DSA 小 batch 优化,有机会在 能效/延迟 上显著超越现有国产方案。

3.6 具体公司/产品方案(压缩+部署)

公司压缩/部署方案硬件来源
NVIDIAGR00T:ModelOpt nvfp4/fp8 → TRT Edge-LLM;DiT 单独 TRT engine;denoising 4 步Jetson Thor 10.9Hz/Orin 5.8HzIsaac-GR00T GitHub #415;optimization docs
QualcommQNN INT8 编译;Physical AI VLA/VLM 全栈Dragonwing IQ10 700 TOPSCES 2026
Google DeepMindGemini On-Device;50–100 demo 微调本地机器人(Atlas/Apollo/Franka)deepmind.google 2025
Physical IntelligenceBF16 + 5 步流匹配 + RTC硬件中立arXiv:2506.07339
Figure三系统模型分级(10M/中型/7B)双 NVIDIA RTXfigure.ai
Stanford/OpenVLANF4 PTQ + LoRA;社区 bitsandbytes通用 GPUarXiv:2406.09246
华为/千寻π0 FP16 on 昇腾 310P;LeRobot 0.3.3310P ~430ms/推理devpress.gitcode.com
特斯拉私有 INT8/稀疏(推测)自研 AI 芯片
宇树UnifoLM-VLA-0;端侧量化未公开自研/外购2026.1 发布

3.7 压缩三轴与流水线全景(小结图)

前面 §3.1–§3.6 点了大量模型与工具,容易「见树不见林」。这里用一张图把具身端侧压缩收敛成三条正交的轴,并标出每条轴落到哪个子模块、对应哪个 ADR——这也是后续 §4 候选矩阵的骨架。

怎么读这张图:传统 LLM 压缩往往只盯「轴1 权重 bit」,但具身端侧必须三轴同压——只压权重会漏掉扩散动作头的多步开销(轴3),只减步又救不了 7B 主干装不进 8GB(轴1)。三轴叠加后,还要按子模块分配精度(非对称策略),因为视觉塔、VLM 主干、动作头对量化误差的敏感度截然不同(§5.2)。最终验收口径是任务 rollout 成功率 + 控制频率,而非离线 token perplexity——这是具身压缩区别于通用 LLM 压缩的根本立场。


3b. 由演进反推的芯片诉求(量化)

π0 3.3B INT4 + 5 步流匹配 + batch=1 为端侧基准:

维度当前(压缩后)未来(π0.7 5B + 更长上下文)芯片诉求
权重~1.7–3.5 GB(INT4)~2.5–5 GB原生 INT4/NVFP4 MAC;块缩放单元(ADR-007)
带宽5 步×(动作专家 300M 激活)≈ 访存密集多模型并发≥100 GB/s LPDDR + 大 SRAM 驻留动作头
算力有效需求 ≈ 5× 单步 FLOPs + ViT prefill10M→100M 控制网叠加小 GEMM 高能效;prefill/decode 分路径
精度硬件W4A8 为主NVFP4 权重 + FP8 KV(可选)INT4/FP8/NVFP4 混合精度 datapath
校准PTQ 校准集 ~512–1024 样本多本体/多场景编译器 per-channel/per-block scale 表达

关键量化:OpenVLA 4-bit 将 7B 权重从 ~14GB(BF16) 压到 ~3.5GB,使 8GB 级端侧 SoC 可跑 VLA——这是端侧落地的必要条件,不是可选项。


4. 候选方案与对比矩阵

4.1 量化策略

候选性能/能效成本风险生态成熟度演进性可驾驭度小结
A. PTQ 为主(W4A8/W4A4)+ 关键层 BF16553455建议方案(端侧基线):OpenVLA 已验证;快速落地
B. 全链路 QAT424343精度最优但训练成本高;用于旗舰任务
C. 仅 8-bit PTQ243535OpenVLA 证明更慢且 rollout 更差;初判不宜作主力
D. NVFP4 全栈(对标 Thor)533354与 ADR-007 对齐;需硬件原生支持

4.2 压缩组合路线

候选性能/能效成本风险生态成熟度演进性可驾驭度小结
E. 量化 + 步数蒸馏(扩散/流匹配)543354π0/RTC 路线;软件减步 × 硬件单步
F. 量化 + 结构化剪枝 2:4434243硬件预留(ADR-008);模型验证不足,扩展阶段
G. 系统级蒸馏(三系统分级)524253Helix 范式;需模型团队深度参与
H. 量化 + LoRA 任务适配442545OpenVLA 标准做法;与 PTQ 叠加

建议方向:A + E + H 组合(PTQ W4A8 先行 + 流匹配/扩散步数蒸馏 + LoRA 任务微调)为主线候选;QAT(B) 用于精度敏感旗舰;NVFP4(D) 与硬件共演进;F(稀疏)扩展阶段 再评估;G(三系统蒸馏)依模型团队 ROI。


5. 关键权衡、风险与依赖

5.1 跨层耦合

  • 量化格式 ↔ 硬件(02/07):INT4/NVFP4 块缩放须在 MAC 阵列原生支持;否则 PTQ 收益被 dequant 开销吃掉。
  • 量化 ↔ 编译器(15):需 quantization-aware lowering(scale/zero-point 折叠、QDQ 消除、per-channel weight layout)。
  • 量化 ↔ 运行时(12):INT4 权重 layout、KV-cache FP8/INT8 压缩、动态 scale 更新接口。
  • 减步 ↔ 实时(13):步数减少降低延迟,但 RTC 引入 ~20ms 额外开销(97ms vs 76ms@π0.5)——需整体预算。

5.2 单点风险

  • 8-bit 陷阱:社区默认"8-bit 更安全",OpenVLA 反例证明延迟回归可致命 → 须用任务级 rollout验收,非仅 perplexity。
  • 视觉塔量化敏感:DINOv2+SigLIP 双塔;视觉特征量化误差会放大到动作 → 视觉塔可 W8A8,LLM W4 的非对称策略。
  • 扩散动作头:迭代去噪对数值噪声敏感 → 动作头统一采用 FP8 权重 + FP16 计算(对齐 ADR-043 / GR00T Thor 的 DiT 口径),即权重以 FP8 存储、matmul 累加与激活走 FP16,兼顾 footprint 与去噪数值稳定。
  • 校准数据域偏移:工厂/家庭/零售场景差异大 → 须支持端侧少量样本 recalibration(512 帧级即可)。

5.3 依赖与时间窗口

  • M1 Demo(05-importer-models) 须含 量化标注 stub 与 manifest 精度字段 → 与 19 章同步。
  • Tape-out 前冻结 INT4/FP8 硬件格式(ADR-007);压缩流水线须在此窗口前跑通 OpenVLA/π0 级 PTQ E2E。

6. 结论与待决项

6.1 初步结论

以下基于 §3 业界调研(含 QVLA/OneDP/OFP、GR00T Thor、TOP 芯片横向对比)与 §4 矩阵;非正式 ADR

  1. 需求侧判断(非方案锁定):端侧 VLA 在 8–16GB 预算下,权重量化(INT4/NVFP4 量级)是工程必要条件;BF16 7B 难落端——对标 GR00T Thor 的 nvfp4+fp8 组合为公开靶标,非唯一路径。
  2. 量化路线候选:§4 倾向 A(PTQ W4A8) + E(步数蒸馏) + H(LoRA);均匀 8-bit PTQ(C) 在 OpenVLA/QVLA 证据下初判不宜默认;扩展阶段 评估 QVLA 式 action-centric 混合 bit。
  3. 扩散/流匹配:须 权重量化 + 步数/一致性蒸馏(10→5→1-NFE) + RTC 三轨并行评估;仅压权重通常不够(§3.4 OneDP/OFP/HCP)。
  4. 流水线候选:action-sensitive 校准 → MLIR mixed-bit lowering → AOT → 运行时;对标 ModelOpt→TensorRT Edge-LLM,自研路径走 MLIR/IREE(与 15/12 章候选一致)。
  5. 非对称精度候选:ViT FP8/W8A8 + LLM W4A8/NVFP4 + 动作头 FP16/BF16 计算 —— 与 GR00T Thor 部署对齐,待 silicon 实测后定。
  6. 国内差异化窗口:昇腾 310P π0 FP16 ~430ms vs Thor GR00T 92ms —— INT4+减步+DSA 小 batch 若达 <100ms 为卖点,须 M3 profiling 验证。

6.2 待决项

  • NVFP4 vs INT4 AWQ 在自研 DSA 上的精度-能效曲线(需 silicon/ISS 后实测)。
  • KV-cache INT8/FP8 压缩是否 端侧基线阶段 启用(03 章 ADR-012 可选)。
  • 端侧 recalibration 工具链是否纳入 SDK M3(与 26 章 DevRel 衔接)。
  • 基线验证模型(OpenVLA vs π0)的量化验收指标:rollout 成功率阈值 + 控制频率下限。

6.3 ADR 候选

  • ADR-042 量化策略(PTQ/QAT,候选):倾向候选 PTQ W4A8 为主;精度不达标时 LoRA+QAT 补;验收以任务 rollout + 控制频率为准,非仅离线 token 精度;均匀 8-bit PTQ 初判不宜默认主力(OpenVLA/QVLA 反例),待 M3 实测后定。
  • ADR-043 混合精度与校准:倾向候选 非对称量化——ViT FP8/W8A8、LLM W4A8/NVFP4、DiT/动作头 FP8 权重+FP16 计算(对齐 GR00T Thor);PTQ 校准 ≥512 样本;支持 per-channel/per-block scale;扩展阶段 评估 QVLA 式混合 bit-width;预留端侧 recalibration API。
  • ADR-044 稀疏/剪枝路线:端侧基线阶段 倾向不依赖结构化稀疏;硬件预留 2:4(ADR-008); unstructured 剪枝仅作研究;扩展阶段 依模型验证启用。
  • ADR-045 蒸馏与步数压缩:倾向候选 步数蒸馏(10→5→3→1-NFE,OneDP/OFP/HCP) + RTC;GR00T 参考 4 步 DiT;系统级蒸馏(Helix 三系统)扩展阶段;编译器/runtime 暴露 loop 融合/单步快路径

深入思考

下面三题每题先给题干,再用 <details> 折叠一份图文并茂的参考答案。建议先合上答案自己算 3 分钟,再展开对照。三题分别对应本章三条压缩轴:权重量化(footprint)、扩散减步(NFE)、动作头精度选型。

思考题 1:INT4 量化为何能把 7B 压到 3.5GB

端侧 SoC 常见主存是 8GB。一个 BF16 精度的 7B VLA 权重根本装不下,但同一个模型量化到 INT4 后就能跑。结合 §2.2 与 §3b 的 footprint 换算,亲手算一遍「7B 参数在 BF16 / INT8 / INT4 下各占多少显存」,并解释为什么说 INT4 是「8GB 级端侧能否跑 VLA」的必要条件而非可选项,以及块缩放(block scale)会额外占多少。

展开参考答案(含 footprint 换算图 + 算一遍)

结论:权重显存 = 参数量 × 每参数 bit ÷ 8。7B 在 BF16 下要 14GB(超 8GB 主存),INT4 只要约 3.5GB,正好给 KV-cache、感知缓冲、控制小网留出余量——所以 INT4 不是「锦上添花的优化」,而是「端侧能不能跑」的门槛开关。

用具体数字算一遍(核心公式:显存字节 = 参数量 × bit ÷ 8):

  1. BF16:7×10⁹ × 16 ÷ 8 = 14×10⁹ 字节 = 14 GB。8GB 主存直接装不下——这就是「BF16 7B 难落端」的算术根源。
  2. INT8:7×10⁹ × 8 ÷ 8 = 7 GB。理论装得下,但几乎挤满整块主存,不留 KV-cache / 感知缓冲 / 控制小网的空间;加上 OpenVLA 实测「8-bit 反而更慢(~1.2Hz)」,双输。
  3. INT4:7×10⁹ × 4 ÷ 8 = 3.5 GB。相比 BF16 省 4 倍,给其余组件留出约 4.5GB——这正是 §3b「OpenVLA 4-bit 从 ~14GB 压到 ~3.5GB」的来源。
  4. 块缩放额外开销:NVFP4 每 16 个值共享 1 个缩放因子。若 scale 用 FP8(8bit),额外开销 ≈ 8 ÷ (16×4) = 12.5% 位宽;实际实现常更省,量级 +3%~6%,即 3.5GB → ~3.7GB,仍远低于 8GB。

为什么是必要条件:端侧不是「跑得快一点」的问题,而是「装不装得下」的二值问题。14GB 权重在 8GB 主存上根本无法加载,再快的算力也无从谈起。因此 INT4/NVFP4 权重量化是端侧 VLA 落地的入场券(§6.1 结论1),QAT/减步/LoRA 都是在「已经装得下」之后才谈的优化。回链:footprint 换算见 §3b 关键量化,精度-延迟权衡见 §2.2 表

思考题 2:扩散策略 100→几步减步如何降延迟

一个 Diffusion Policy 原始要跑 100 步去噪(NFE=100),端侧根本达不到 50Hz 控制频率。结合 §3.3 与 §3.4 的减步/一致性蒸馏证据,用 NFE(函数求值次数)× 单步延迟 的模型算一遍:从 100 步减到 10 步、5 步、1-NFE,端到端延迟与可达控制频率各是多少?并说明为什么「减步」和「量化」是两条正交且同等重要的压缩轴。

展开参考答案(含 NFE-延迟对比图 + 算一遍)

结论:扩散动作头的延迟 ≈ NFE × 单步延迟,与步数近似线性。把 NFE 从 100 压到 5(减 20 倍)或 1-NFE(减 100 倍),延迟同比例下降,才可能从「跑不动」跨到 50Hz+ 实时——而这条轴独立于权重 bit,必须与量化叠加。

用具体数字算一遍(设单步动作专家去噪 ≈ 6ms,取 §3b「5×6ms=30ms」口径):

  1. NFE=100:100 × 6ms = 600ms/chunk → 最快 ~1.7Hz。控制频率远低于抓取所需,不可用
  2. NFE=10(DDIM):10 × 6ms = 60ms → ~16Hz。勉强能动,但叠加 ViT prefill(~40ms)后单 chunk ~100ms,仍紧张。
  3. NFE=5(π0 流匹配 / §3.1):5 × 6ms = 30ms;加 prefill 46ms ≈ 76ms/chunk——正是 §3.1「RTX4090 ~73–97ms」的来源,对标 GR00T Thor 92ms。
  4. NFE=1(OneDP/OFP 蒸馏,§3.4):1 × 6ms = 6ms。去噪本身几乎消失,总延迟被 prefill 主导;OneDP 实测 1.5Hz→62Hz(~40 倍),因为它把「重复 62 次的循环」压成「1 次前向」。

为什么与量化正交且同等重要:量化压的是「每一步 matmul 的算力/访存」(轴1+轴2),而减步压的是「要跑几步」(轴3)。两者相乘才是总延迟:总延迟 ≈ NFE × 单步延迟(单步延迟又受量化影响)。只量化不减步,100 步的循环开销压不掉;只减步不量化,7B 主干仍装不进 8GB。所以 §6.1 结论3 强调「权重量化 + 步数蒸馏 + RTC 三轨并行」。回链:减步证据见 §3.4 OneDP/OFP/HCP,单步硬件诉求见 §3b 算力行,ADR 见 ADR-045

思考题 3:动作头精度选型——FP8 权重 vs INT8,与 ADR 对齐

给动作头(DiT/流匹配专家)选精度时,有人主张「INT8 权重」省显存,有人主张「FP8 权重 + FP16 计算」。结合 §5.2 视觉塔/动作头量化敏感性ADR-043,论证为什么本章统一口径是 FP8 权重 + FP16 计算,而不是给动作头也上 INT8/INT4?迭代去噪对数值精度的敏感性在其中起什么作用?

展开参考答案(含精度选型决策图 + 对比表)

结论:动作头是「多步迭代 + 误差复合」的最敏感环节,量化误差会在去噪循环里逐步累积并放大成动作偏差 → 任务失败。因此对它用 FP8 权重(省显存)+ FP16 计算(保去噪数值稳定),而不是像 VLM 主干那样激进上 W4/INT8——这正是 ADR-043 的非对称精度立场。

FP8 权重 vs INT8 权重(动作头场景)对比:

维度INT8 权重FP8 权重 + FP16 计算(本章口径)
数值分布均匀整数网格,小值区分辨率差浮点非均匀,小激活/小残差保留动态范围
去噪迭代稳定性量化噪声每步累积 → 动作偏差复合FP16 累加,去噪循环数值稳定
与硬件对齐需 INT8 datapath;与 NVFP4 权重栈割裂对齐 GR00T Thor DiT FP8;ADR-043 一致
显存8bit,与 FP8 同档8bit 存权重,计算态 FP16(激活/累加)
适用视觉塔等单次前向、误差不迭代的模块动作头/DiT 这类多步迭代模块

敏感性在其中的作用:普通 LLM 一次前向出结果,量化误差不会「滚雪球」;但扩散/流匹配动作头要跑 5~10 步去噪,每一步的输入是上一步的输出——量化噪声在循环里被反复叠加放大,最终体现为动作轨迹偏移。具身控制里微小 action 偏差会复合成任务失败(§3.4 开头),所以动作头必须比主干保守:用 FP8 保住浮点动态范围、用 FP16 计算保住累加精度,显存与 INT8 同档但数值鲁棒性高得多。这与 ADR-043「DiT/动作头 FP8 权重+FP16 计算」完全一致,也解释了为什么 §5.2 把动作头列为单点风险。回链:非对称精度全景见 §3.7 图,ADR 见 ADR-043,单点风险见 §5.2


7. 端→边→中心演进影响

维度端侧边缘中心
主力精度W4A8 / NVFP4W8A8 / FP8FP8/BF16
压缩重点权重 + 步数 + 模型分级多路 batch 量化稀疏 + 投机解码
工具链轻量 PTQ + recalibration批量 PTQ 流水线QAT + NAS

不可逆点:硬件 INT4/NVFP4 格式与块缩放粒度一旦冻结,后续改 scale 粒度代价高 → 端侧基线阶段 对齐 NVIDIA NVFP4 16 值块或 INT4 per-channel 主流做法。规避:编译器 scale 表达与硬件解耦一层(虚拟 scale → 后端 legalize)。


附:信息来源

区分公开/估计;参考时间 2026-06。

  • QVLA / AutoQVLA(ICLR 2026;通道级混合 bit;action-centric;OpenVLA-OFT LIBERO 29.2% VRAM/98.9% perf/1.49×;+22.6% vs SmoothQuant):arXiv:2602.03782(编号待核);github.com/AutoLab-SAI-SJTU/QVLA;openreview.net TpL2nXanru。[公开]
  • One-Step Diffusion Policy (OneDP)(NVIDIA;1.5→62Hz;2–10% 训练成本):arXiv:2410.21257;research.nvidia.com/labs/dir/onedp/。[公开]
  • One-Step Flow Policy (OFP)(1-NFE 超 100-NFE baseline):arXiv:2603.12480(编号待核)。[公开]
  • Consistency Policy / HCP / FlowPolicy:consistency-policy.github.io;arXiv:2510.26670;arXiv:2412.04987。[公开]
  • Isaac GR00T Thor 量化(LLM nvfp4/ViT fp8/DiT fp8;4 denoising steps):GitHub NVIDIA/Isaac-GR00T commit 4af2b62;mintlify optimization/tensorrt docs(Thor 92ms/10.9Hz)。[公开]
  • OpenVLA 量化评估(4-bit ~3Hz/8-bit ~1.2Hz/BF16 ~5Hz@A5000;4-bit rollout≈BF16;Table 2/Fig.5/Section D.4):Kim et al., arXiv:2406.09246;openvla.github.io。[公开]
  • π0 流匹配推理(10 步 Euler;KV-cache 前缀;~73ms@4090):Physical Intelligence, arXiv:2410.24164。[公开]
  • Real-Time Chunking(π0.5 5 步 76ms baseline/97ms RTC;+200ms 延迟鲁棒):PI, arXiv:2506.07339;pi.website/research/real_time_chunking。[公开]
  • Training-Time RTC(108ms vs 135ms@H100):arXiv:2512.05964(编号待核)。[公开]
  • NVIDIA TensorRT Edge-LLM(NVFP4/INT4 AWQ/FP8;端侧仅 Blackwell 即 Jetson Thor SM110;Cosmos Reason2 8B;NVFP4 1.1–2.3× vs INT4 AWQ):NVIDIA Technical Blog 2025;jetson-ai-lab.com;nvidia.github.io/TensorRT-Edge-LLM。[公开]
  • NVIDIA ModelOpt 量化格式(FP8/INT4 AWQ/NVFP4):github.com/NVIDIA/Model-Optimizer。[公开]
  • Figure Helix 02 三系统(S0 10M/S1 200Hz/S2 7–9Hz):figure.ai 2025。[公开]
  • Diffusion Policy / DDIM 减步:Chi et al., 2023。[公开]
  • Qualcomm Dragonwing IQ10 Physical AI(700 TOPS;VLA/VLM):BusinessWire CES 2026;edge-ai-vision.com。[公开]
  • 华为 OptiQuant / W8A8(INT8≈FP8 精度):news.qq.com 2025;华为云 llm-compressor 文档。[公开]
  • 昇腾 310P π0 部署(LeRobot FP16 ~430ms):devpress.gitcode.com 智能机器人开发手册。[公开]
  • 端侧内存/带宽量化推算:基于上述公开规格与 01 章 ADR-003 的工程估算。[估计]