跳到主要内容

01 具身智能负载与场景需求洞察

  • 章节编号:01
  • 所属层:需求输入(驱动 H/I/S/R/C/M/D/A 全栈)
  • 关联 ADR:ADR-001(数值精度基线)、ADR-002(实时性分层)、ADR-003(内存/带宽预算)、ADR-004(基线验证模型)

学习目标

  • 前置知识:知道「具身智能 = 机器人 + AI 大脑」这一朴素图景即可;了解 Transformer/注意力(attention)是什么、什么叫「量化(quantization)」把权重从 FP16 压到 INT4;听说过 VLA(Vision-Language-Action,视觉-语言-动作)这个词。无需读过后续任何一章——本章就是整套洞察的输入层,后面所有章节的硬指标都从这里反推而来。
  • 学完产出:① 能把一个具身场景(叠衣物 / 移动抓取 / 1kHz 伺服)翻译成一组芯片可量化的硬指标——延迟预算、控制频率、权重容量、精度组合;② 能亲手「算一遍」一个 VLA 的端到端延迟(如 π0 的 46ms prefill 加 5 步去噪 30ms ≈ 76ms)与量化后显存占用(OpenVLA 7B INT4 ≈ 3.5GB),不再对「够不够跑得动」拍脑袋;③ 能说清具身负载为什么是多频率、混合实时的——策略 1–50Hz、视觉运动 200Hz、伺服 1kHz 为何必须分域调度而非塞进一个大循环;④ 能判断一个具身模型该落在端 / 边 / 中心的哪一形态,以及这一选择如何由场景的实时性、隐私、带宽约束倒推出来。
  • 阅读姿势:盯住一条主线——「芯片的每一条硬指标,都是被某个具体场景加具体模型逼出来的」。不要孤立地记「端侧要 8GB」,而要记住它来自「π0 类 INT4 权重 1.7–3.5GB 加 KV-cache 加感知缓冲 加控制小网」这条反推链。本章之后的每一章(微架构 / 编译 / 运行时 / 压缩),本质都在回答本章提出的某一条需求。

1. 范围与目标

本章是整个洞察的输入层:把"具身智能"翻译成芯片与软件栈可量化的需求。所有论断点名具体模型/公司/场景并标注来源;参数量/频率/功耗如无官方数据则标"估计"。

要回答的核心问题

  1. 业界最常用的具体模型有哪些?结构(主干/参数量/算子)如何?演进趋势是什么?
  2. 随这种演进,芯片需具备的算力 / 功耗 / 内存(容量+带宽) 诉求如何变化?
  3. 具体公司落地用了什么硬件/软件方案?
  4. 具身的实时性与确定性如何分层?延迟预算怎么分配?
  5. 端 / 边 / 中心三形态差异,及基线验证模型与关键设计约束(喂给后续各章与技术选型)。

一图看懂本章的反推逻辑——从「场景」出发,经「模型」落到「硬指标」,最终喂给全栈各章:


2. 业界最常用的具体模型(点名 · 结构 · 算子 · 演进)

具身"大脑"主流是 VLA(Vision-Language-Action)+ 扩散/流匹配动作头 + 分层控制。下列为当前(2024–2026)最常被采用/复现的代表模型。

2.1 代表模型与结构

模型机构 / 年份参数量主干结构动作生成方式控制频率
RT-2 / RT-2-XGoogle DeepMind, 202355B(RT-2-X)PaLI-X / PaLM-E(VLM)动作 token 自回归~1–3 Hz
OpenVLAStanford 等, 20247BDINOv2 ViT-L/14 + SigLIP ViT-So400M/14(融合视觉)+ Llama-2 7B动作离散为 256 bin token,自回归~5–10 Hz
Octo开源, 202427M–93MTransformer(模块化)扩散动作头较高
Diffusion PolicyColumbia/MIT, 2023数十–百 MCNN/Transformer U-NetDDPM 迭代去噪(原 ~100 步,DDIM 可降)10–100 Hz
ACT(Action Chunking Transformer)Stanford ALOHA, 2023~80MCVAE + Transformer动作分块(chunk)直接回归~高频
π0 / π0.5 / π0.7Physical Intelligence, 2024–20263.3B → ~4B → 5BPaliGemma 3B VLM + 300M 动作专家(π0.7 用 Gemma3 4B)流匹配(flow matching),动作分块 H=50,10(→5)步 Euler 积分up to 50 Hz
NVIDIA Isaac GR00T N1/N1.5/N1.7NVIDIA, 2025–2026~2B双系统:VLM(System 2)+ 扩散 Transformer DiT(System 1)扩散动作头分层

时效补注(截至 2026 年中):π0.7 已于 2026-04 发布(Gemma3 4B 主干,进一步减步);GR00T N1.7 已 GA(正式可用);Figure Helix 02 三层分工细化为 S2 VLM 7–9Hz / S1 视觉运动 200Hz / S0 运动先验 1kHz。上述代次演进节奏极快,具体规格与发布状态以官方为准

2.2 算子/计算模式构成(对硬件的压力来源)

计算模式来源(点名)对硬件的诉求
GEMM / 全连接Llama-2 7B(OpenVLA)、Gemma/PaliGemma(π0)FFN 与投影、控制 MLP计算阵列利用率、小 GEMM/低延迟
注意力 + KV-cache所有 VLM 主干;π0 对前缀 o_t 做 KV-cache,仅重算动作 token内存带宽、KV-cache 容量、softmax
卷积 / ViT patchDINOv2 + SigLIP(OpenVLA)、各感知前端数据复用、原生 conv / winograd
迭代去噪 / 流匹配Diffusion Policy(~100 步)、π0(10 步)、GR00T(DiT)同网络多步迭代→延迟敏感的高有效算力
多模态融合 / cross-attnVLA 视觉-语言-状态融合、Helix"全传感器入"不规则张量、动态 shape、blockwise 注意力掩码
小算子 / 标量控制底层伺服、后处理极低延迟、CPU/标量协同

2.3 演进趋势(代际对比)

  1. 动作头从"离散 token 自回归"→"连续流匹配/扩散":RT-2/OpenVLA 用离散 token;π0 改用流匹配生成连续动作(更适合高频灵巧操作,50Hz)。→ 芯片需高效支持迭代式小网络推理
  2. 主干规模上行:π0(3.3B,PaliGemma 3B)→ π0.5(~4B)→ π0.7(5B,Gemma3 4B,2026-04)→ RT-2-X 达 55B。→ 权重容量与带宽压力持续上升,端侧靠强压缩
  3. 分层化(双/三系统):Figure Helix 02 = System 2(VLM,7–9Hz)+ System 1(视觉运动 Transformer,200Hz)+ System 0(运动先验,1kHz);NVIDIA GR00T = VLM + DiT 双系统。→ 芯片必须服务多频率、混合实时并发。
  4. 减步加速:扩散从 ~100 步向一致性/步数蒸馏(π0 从 10 步减到 5 步)收敛。→ 软件"减步"换延迟,硬件优化单步能效
  5. 端侧本地化:Figure Helix"fully onboard,无云依赖"。→ 认知层须可在端侧功耗包络内本地运行。

3. 具体公司落地方案(点名)

"TOP3"无官方统一排名,取决于口径(AI 能力/量产落地/估值/出货量);下列为 2026 主流共识的代表厂商及其模型 + 硬件/算力方案,作为我们的潜在客户与对标对象。

3.1 全球代表厂商

公司场景/产品模型方案硬件/算力方案
特斯拉 TeslaOptimus(Gen 3),自有工厂(搬运/装配),目标 2 万–3 万美元/台复用 FSD 神经网络栈,自训车队数据自研 AI 芯片(Tesla AI/DOJO 体系) + 垂直整合电池/制造,端侧本地推理
Figure AI人形(Figure 02/03);BMW 工厂 11 个月试点(搬运 X3 零件)、家务上货架Helix / Helix 02 三系统(S2 VLM 7–9Hz / S1 视觉运动 Transformer 200Hz / S0 运动先验 1kHz),全身控制,全程 onboard 无云依赖双 NVIDIA RTX GPU 模块(约 Figure 01 的 3×);Figure 03 加掌心相机+指尖触觉
波士顿动力 Boston Dynamics(现代汽车)电动 Atlas,工业/仓储试点运动/操作能力最强,转向工业可靠性端侧算力(采用 NVIDIA Jetson Thor 生态);Orbit 车队管理
Physical Intelligence(Pi)"机器人基础模型/OS";叠衣物、清桌、装箱π0/π0.5/π0.7 流匹配 VLA(PaliGemma 3B/Gemma3 4B + 动作专家),50Hz,跨本体训练/评测 RTX 4090 级(π0 ~76ms@4090,公开);软件中立,适配多硬件
NVIDIAhumanoid 基础模型 + 边缘平台(给全行业供算力)Isaac GR00T N1.5/N1.7(开源 humanoid 基础模型,VLM + DiT 双系统)Jetson Thor(Blackwell,2070 FP4 TFLOPS/128GB/273GB/s/40–130W,2026 量产),事实标杆
Agility RoboticsDigit,亚马逊仓储 tote 搬运(商用部署最实)任务级策略端侧算力(Jetson 生态)
Google DeepMind通用操作研究RT-2 / RT-2-X(55B)/ Gemini Robotics(VLA)TPU 云训练 + 机器人端

早期采用 Jetson Thor 的公司(NVIDIA 官方列示):Figure、Boston Dynamics、Agility Robotics、Amazon Robotics、Meta 等。

3.2 中国代表厂商

公司场景/产品模型方案硬件/算力方案
宇树科技 UnitreeH1/H2 人形、Go2 四足;人形出货全球第一(2025 约 5500+ 台);科创板 IPO 过会极致硬件 + 运动控制;2026.1 发布 UnifoLM-VLA-0 通用 VLA,自有工厂部署测试自研本体/关节模组;AI"大脑"为补强方向(募资 85% 投研发)
智元机器人 AgiBot远征 A3、灵犀 X2;已达万台级量产(2025 出货 5100+);汽车/3C/物流全栈自研 + 标准化供应链;具身基础模型订单驱动柔性产线,核心零部件自主可控
银河通用 GalbotGalbot G1(轮式双臂);零售/药店 24h 自动分拣规模化具身大模型 + 仿真合成数据路线(软件大脑派)轮式双臂平台;国家大基金重仓
其他("具身五杰"+)星动纪元(灵巧手全球标杆、海外占比高)、星海图(世界模型/开发者生态);优必选 UBTech(已上市,Walker S2)、傅利叶 Fourier、小鹏 IRON、小米多为本体 + 关节 + 模型并进

2026 预计宇树 + 智元合计囊括中国人形约 80% 出货(TrendForce)。

3.3 对我们的信号

  1. 头部普遍走"VLM 大脑 + 高频动作/控制层 + 端侧本地推理"路线 → 印证本章负载画像(多频率混合实时)。
  2. 边缘算力事实标杆 = NVIDIA Jetson Thor;特斯拉走自研芯片垂直整合 → 我们以能效/确定性/成本做差异化对标。
  3. 中国厂商(宇树/智元/银河通用)出货量与量产领先,但 AI"大脑"普遍在补强 → 是我们芯片 + 软件栈的重点潜在客户(尤其需要高能效端侧推理 + 易用工具链)。
  4. Physical Intelligence 等"模型中立"路线 → 我们需良好支持其 VLA(π0 流匹配)以争取生态。

4. 由演进反推的芯片诉求(量化)

以"端侧人形机器人本体、batch=1、实时闭环"为基准场景,结合上节模型反推:

4.1 算力 / 能效

  • 基准对标:NVIDIA Jetson Thor T5000 提供 2070 FP4(稀疏)/ 1035 FP8 TFLOPS,功耗 40–130W(默认 120W),相对 Orin 能效提升约 3.5×(NVIDIA 官方);2026 量产,128GB LPDDR5X
  • 诉求:端侧推理 SoC 算力量级 ~数百–2000 TFLOPS(低精度),但能效(TOPS/W)是第一 KPI;须支持稀疏。
  • 小批量利用率:VLA/控制为 batch≈1,需在小 GEMM/小算子下保持高利用率(堆峰值无意义)。

4.2 功耗

  • 端侧 SoC 预算 ~10–60W(机器人本体电池供电,温升受限);对标 Thor 的 40–130W 区间,我们若主打能效应在同等任务下显著低功耗

4.3 内存(容量 + 带宽)——常为真正瓶颈

  • 容量口径(务必写明,避免区间歧义):π0 3.3B、OpenVLA 7B 权重量化后——INT4 口径 1.7–3.5GB;INT8 为 3.3–7GB(估计,随主干规模而定)。叠加 KV-cache、多模型并发、感知缓冲,端侧建议 ≥8–16 GB(Thor 给到 128GB LPDDR5X,面向多模型/大模型余量)。
  • 带宽:注意力 + KV-cache + 扩散多步迭代是访存密集;Thor 为 273 GB/s LPDDR5X。端侧建议带宽量级 ≥100–300 GB/s,且需大片上 SRAM减少 DRAM 往返(详见 03 章)。

4.4 精度

  • 无单一精度通吃:权重 INT4/INT8 + 激活 INT8/FP8 + 关键路径 BF16/FP16;OpenVLA 已验证 4-bit 量化半内存、精度基本无损(公开)。Thor/Blackwell 原生支持 FP4/FP8/INT8/BF16,印证混合精度方向。

4.5 演进映射(当前 → 未来)

维度当前(π0 3.3B/OpenVLA 7B)未来(π0.7 5B+、更大 VLM、多模型并发)
权重容量INT4 后 ~1.7–3.5GB~3–8GB+,需更大内存/更强压缩
带宽压力中(KV-cache + 5–10 步扩散)高(更长上下文、世界模型、多路)
算力数百 TFLOPS 级够用向 ~1–2k 低精度 TFLOPS,且能效更关键
精度INT4/8 + FP8同左 + 更激进低比特/稀疏

4.6 反推链一图串起:从负载到硬件需求

前面几节把「模型演进」拆成了一堆分散的指标。这里用一张图把**「场景负载 → 计算特征 → 芯片硬指标」**的反推链完整串起来,便于后续各章直接引用为需求锚点:

这张图的用法:后续任何一章要论证「为什么芯片要这么设计」时,都可以回溯到左侧的某个场景负载。例如 02 章的「小 GEMM 利用率」直接对应 A1→B3→C3;13 章的「确定性调度」对应 A3→B3→C4;19 章的「强压缩」对应 A1→B1→C1 的延迟压力。需求不是凭空拍的,每一条都能追溯到一个具体场景。


5. 具身分层负载与实时性(确定性是护城河)

层级代表(点名)频率实时性算力特征
认知/任务规划VLM(System 2,Helix 7–9Hz)0.2–9 Hz软实时大权重、访存密集
策略/动作生成(VLA)OpenVLA / π01–50 Hz准实时Transformer + 视觉编码器 + 迭代动作头
视觉运动控制Helix System 1200 Hz硬实时中型 Transformer,全传感→全关节
底层伺服/运动先验Helix System 0 / MPC1 kHz强硬实时(确定性)低算力、极低延迟、确定性 p999
感知前端ViT/CNN 检测分割/深度/SLAM10–60 Hz准实时卷积+注意力,多路并发

端到端延迟预算(示例:移动抓取,目标整链 ≤ ~100ms)

传感+ISP ~5–15ms → 感知前端 ~15–30ms → VLA/策略 ~30–60ms → 规划/下发 ~5–15ms → 执行
底层伺服闭环单独运行:周期 ≤1ms(1kHz),确定性 p999

关键洞察:VLA/策略是整链延迟大头(π0 ~76ms@4090 为参考,端侧需更优),是芯片+编译+运行时主战场;1kHz 控制是确定性硬约束 → 运行时须优先级抢占 + 隔离 + QoS(13 章)。


6. 候选定位与对比矩阵

候选定位性能/能效成本风险生态成熟度演进性可驾驭度小结
A. 通用大算力(堆峰值 TOPS,大 batch)323443不贴合端侧小批量/能效
B. 能效优先 + 混合精度 + 小批量低延迟 + 强实时(具身定向)543244建议方案(主线)(对标但差异化于 Jetson Thor)
C. 纯超低功耗 MCU 级(只跑小控制网)452325覆盖不了 VLA 认知层

建议方向:候选 B——围绕"能效 + 混合精度 + 小批量低延迟 + 多频率强实时"构建;认知层靠压缩落端侧,控制层靠确定性调度保障;以 Jetson Thor 为对标,在能效/成本/确定性上做差异化。


7. 关键权衡、风险与依赖

  • 认知层 vs 控制层资源争用:VLM 大模型推理可能拖累 1kHz 控制 → 依赖硬件抢占(H/I 层)+ 运行时隔离(13 章)。
  • 模型膨胀 vs 端侧预算:VLA 主干 3.3B→5B+ 增长快,端侧靠压缩能否跟上是产品级风险(19 章 + 模型团队)。
  • 小批量利用率:DSA 若为大 batch 设计,端侧利用率低 → 02 章重点验证小 GEMM/小算子。
  • 扩散/流匹配迭代延迟:多步采样端侧延迟,需软件减步(蒸馏/一致性)+ 硬件单步高能效。
  • 生态对标 NVIDIA:Jetson Thor + Isaac/GR00T 生态强大,我们生态成熟度起点低 → 必须用 MLIR/IREE 复用 + AI-Native 提效弥补(15/30 章)。
  • 需求不确定性:具身模型快速演进 → 芯片须留可编程性余量(07 章)。

8. 结论与待决项

初步结论

  1. 主流是 VLM 大脑 + 流匹配/扩散动作头 + 分层(双/三系统)控制;负载异构、多频率、混合实时
  2. 能效(TOPS/W)+ 确定性 + 混合精度优先级高于峰值算力;内存容量/带宽常为真瓶颈
  3. 端侧 batch≈1 低延迟为常态;需保障小 GEMM/小算子效率与低调度开销。
  4. 对标 NVIDIA Jetson Thor(2070 FP4 TFLOPS / 128GB / 273GB/s / 40–130W),我们在能效/成本/确定性上差异化。

待决项

  • 基线验证模型最终选定(候选:OpenVLA 7Bπ0 类(流匹配)+ Diffusion Policy + 一款感知前端)——模型团队 2 周内定。
  • 端到端延迟/功耗的量化目标值(结合目标机器人平台与客户场景)。
  • 认知层端侧全本地 vs 端云协同(依赖 24 章)。

ADR 候选

  • ADR-001 数值精度基线:权重 INT4/INT8 + 激活 INT8/FP8 + 关键路径 BF16/FP16;硬件原生支持(对标 Blackwell FP4/FP8),软件提供 QAT/校准。
  • ADR-002 实时性分层:认知/策略层(软/准实时,优化吞吐+尾延迟)+ 控制层(硬实时,确定性 p999);运行时支持抢占/隔离。
  • ADR-003 内存/带宽预算:端侧 ≥8–16GB、带宽 ≥100–300GB/s、大片上 SRAM;以 KV-cache + 扩散迭代为压力点。
  • ADR-004 基线验证模型集:1×VLA(OpenVLA/π0 级)+ 1×扩散策略 + 1×感知前端,作为 M1–M3 贯通对象。

9. 端→边→中心演进影响

维度端侧本体边缘侧中心推理(远期)
批量batch≈1 低延迟小批量多路大批量高吞吐
KPI能效 + 确定性能效 + 密度吞吐 + 成本/查询
模型强压缩(INT4)中等压缩全精度/大模型
实时性硬实时(1kHz 控制)准实时软实时

不可逆点与规避:端侧"能效/混合精度/小批量"优化不应牺牲可编程性与吞吐扩展性,否则堵死中心化;在 02(微架构)、07(ISA)章保留向上扩展路径(更大 batch、更高并发、对外高速互联)。


深入思考

下面三题每题先给题干,再用 <details> 折叠一份图文并茂的参考答案。建议先合上答案自己想 3 分钟,再展开对照。每份答案都以「结论」开头,配一张深色 mermaid 图加一次「算一遍」或对比表,并回链到正文对应节。

思考题 1:从具身负载反推硬件指标——延迟、频率、内存、精度怎么算出来?

给你一个场景:「端侧人形机器人跑 π0 类流匹配 VLA 做叠衣物,目标 chunk 延迟对标 GR00T on Thor 的 92ms」。请结合 2.1 节的模型结构4.3 节的容量口径,亲手算一遍:(a) π0 的端到端 chunk 延迟由哪几段构成、加起来大约多少?(b) OpenVLA 7B 用 INT4 量化后权重占多少显存,和 INT8 差多少?说清「延迟 / 频率 / 内存 / 精度」这四个硬指标各自是被哪一段负载逼出来的。

展开参考答案(含负载→指标反推链图 + 两次算一遍)

结论:硬指标不是拍脑袋定的,而是把模型结构与数据类型代进去算出来的——π0 的 chunk 延迟约等于 46ms prefill 加 5 步去噪各 6ms 共约 76ms,决定了延迟这条红线;OpenVLA 7B INT4 权重约 3.5GB、INT8 翻倍到约 7GB,决定了内存容量的下限;50Hz 灵巧操作决定了单步必须够快,混合精度决定了同一网络不同段用不同数据类型。

算一遍 (a):π0 的端到端 chunk 延迟(以 4090、BF16 公开 profiling 为量级参考):

  1. VLM prefill:PaliGemma 3B 对「图像加语言指令加状态」前缀做一次编码,约 46ms。这一段是访存密集的大注意力,决定了整链延迟的「地板」。
  2. 动作专家去噪:300M 动作专家做流匹配 Euler 积分,π0 原 10 步、减步后约 5 步;每步一次小网络前向约 6ms,合计 5 乘 6 等于 30ms
  3. 合计 约等于 46 加 30 等于 76ms/chunk。这就是延迟硬指标目标 ≤80ms 的来源;对标 GR00T on Thor 的 92ms,端侧 INT4 加 DSA 若能做到 60–80ms 即逼近标杆。
  4. 频率校验:一个 chunk 覆盖 H=50 个动作步,即使 chunk 生成花 76ms,分摊到 50 个动作后单动作输出频率远高于 50Hz——这正是「动作分块加 RTC 异步」能撑起高频控制语义的原因。

算一遍 (b):OpenVLA 7B 量化后权重显存(容量等于参数量乘每参数字节):

精度每参数比特7B 权重估算口径说明
FP1616 bit~14 GB原始半精度基线
INT88 bit~7 GBINT8 口径 3.3–7GB(随主干规模)
INT44 bit~3.5 GBINT4 口径 1.7–3.5GB(随主干规模)

计算:7 乘 10⁹ 参数,乘 4 bit,除以 8 等于 3.5 乘 10⁹ 字节,约 3.5GB(INT4);换成 8 bit 则约 7GB(INT8)。这就是内存容量硬指标的下限来源:仅权重 3.5GB,再叠加 KV-cache 加感知缓冲 加控制小网,端侧建议 ≥8GB。务必写明口径避免歧义:INT4 是 1.7–3.5GB 区间、INT8 是 3.3–7GB 区间,两个区间随 π0 3.3B 与 OpenVLA 7B 等不同主干规模而变。

四个硬指标的负载归因:延迟来自 prefill 加去噪迭代;频率来自 50Hz 灵巧操作要求单步够快;内存来自权重量化 加 KV-cache 容量;精度来自不同网络段对范围与精度需求不同,故混合精度。

回链:本题对应正文 §2.1 代表模型与结构(π0 结构与步数)与 §4.3 内存(容量口径)、§4.4 精度——把那两节的静态指标,变成一次可复算的反推。

思考题 2:多频率分域(1–50Hz / 200Hz / 1kHz)为何必须分域调度,而不是塞进一个大循环?

Helix 02 的三层是 S2 VLM 7–9Hz / S1 视觉运动 200Hz / S0 运动先验 1kHz。一个自然的偷懒想法是:写一个 1kHz 的主循环,每一拍都把三层都跑一遍。结合 §5 分层负载表§7 资源争用风险,论证为什么这个想法会崩,以及为什么必须把不同频率分域调度(隔离到不同优先级/执行域)。

展开参考答案(含分域 vs 单循环对比图 + 周期预算表)

结论:三层频率差了两个数量级(9Hz vs 1kHz,约 100 倍),把慢的 VLM 塞进 1kHz 主循环会让每一拍都被最慢的那一层拖垮——1kHz 意味着每拍只有 1ms 预算,而 VLM 一次要几十毫秒,一旦同域就必然错过伺服的硬实时截止时间;唯一出路是分域,让 1kHz 伺服在独立高优先级域里确定性运行,VLM 在低优先级域里异步产出,靠数据缓冲解耦。

周期预算算一遍——每层「一拍」有多少时间,和它「跑一次」要多久,冲不冲突:

层级频率每拍预算单次跑约需能否塞进 1kHz 主循环?
S0 伺服1 kHz1 ms小于 1 ms本就该 1kHz,必须独占
S1 视觉运动200 Hz5 ms~几 ms勉强,但会挤占 S0
S2 VLM7–9 Hz~110–140 ms数十 ms绝无可能——一次就吃掉上百个 1kHz 拍

读这张表:S0 每拍只有 1ms,而 S2 一次前向要几十毫秒,等于几十个 S0 拍。若同域串行,S2 一跑起来,S0 就连续几十拍无法执行,伺服闭环断裂,机器人抖动甚至失控。这正是 §7「认知层 vs 控制层资源争用」风险的微观机理。

为什么分域是唯一解:三层频率差两个数量级,天然是「生产者-消费者」而非「同拍齐跑」关系——S2 慢速产出「去哪、抓什么」的目标,S1 中速把目标翻译成关节轨迹,S0 高速执行伺服。分域调度做三件事:① 优先级抢占,S0 永远能抢占 S1/S2;② 执行域隔离,1kHz 伺服可下放到独立核 / DSP / 安全岛,不与 VLM 争 SM/内存;③ 数据缓冲解耦,层间用双缓冲传递最新结果,慢层不阻塞快层。这三点直接落到运行时(13 章)的抢占加隔离加 QoS 设计。

回链:本题对应正文 §5 具身分层负载与实时性(频率/实时性分层表)与 §7「认知层 vs 控制层资源争用」——把「表里为什么要分层」这件事,追到「不分域就会崩」的物理必然。

思考题 3:端 / 边 / 中心的部署形态,如何由场景决定?

同样是跑 VLA,为什么 Figure Helix 坚持「全程 onboard 无云依赖」把一切放端侧,而有的方案却把大 VLM 放在边缘网关中心云?结合 §9 端→边→中心演进表§3 厂商方案,分析:哪些场景约束(实时性 / 隐私 / 带宽 / 成本)会把部署形态往「端」推,哪些往「中心」推?为什么这个选择不是纯技术偏好,而是被场景倒逼的?

展开参考答案(含四约束→形态决策图 + 三形态对比表)

结论:部署形态是四个场景约束共同投票的结果——实时性和可靠性把负载往端侧推(网络往返几十毫秒会击穿闭环、断网即失控),隐私和带宽也常倾向本地;而模型规模、算力成本、跨机协同则把重负载往中心推;Figure Helix 全程 onboard 正是因为「1kHz 伺服闭环容不下任何网络抖动」这一硬实时约束压倒了一切,而云端只适合放对延迟不敏感的训练/蒸馏。

三形态对比表(把 §9 的演进表读成一张决策依据):

维度端侧本体(往这推的约束)边缘网关中心云(往这推的约束)
实时性硬实时 1kHz,闭环延迟 ≤ 1ms → 强推端侧准实时软实时,可容忍网络往返
隐私视频/状态不出本体 → 推端侧局域共享需上云,隐私敏感场景排除
带宽多路相机本地消化,断网仍能动 → 推端侧网关聚合大带宽上传昂贵/不稳
模型规模靠 INT4 强压缩塞进 8–16GB中等压缩共享 VLM全精度大模型 → 强推中心
成本单机 SoC 分摊多机分摊一台 VLM 服务集中算力,单位成本低

为什么是场景倒逼而非技术偏好:考虑「移动抓取」——伺服闭环 1kHz、单周期 1ms,任何一次云端往返(哪怕 30ms)都等于 30 个控制周期的黑洞,机器人当场失控;而且工厂/家庭断网是常态,依赖云 = 依赖不可靠链路。所以 Figure Helix 把三层全放本体,不是「因为端侧算力强」,而是「因为闭环实时性和断网鲁棒性根本不给云留位置」。反过来,训练和蒸馏对延迟毫不敏感、却极吃算力,天然属于中心。同一个 VLA,认知层(慢、能忍延迟)可端可边可云,控制层(快、硬实时)只能在端——形态由每一层的实时性/隐私/带宽约束逐层裁定。 这也解释了 §3 里 Physical Intelligence 支持「远程推理可选」而 Figure 坚持全本地的差异:它们赌的场景约束不同。

回链:本题对应正文 §9 端→边→中心演进影响(演进表与不可逆点)与 §3.1/§3.3 厂商方案与信号——把「三形态各是什么」升级成「给定场景该选哪个形态、为什么」。


附:信息来源

区分公开/估计;访问/参考时间 2026-06。

  • NVIDIA Jetson Thor(规格:2070 FP4 稀疏/1035 FP8 TFLOPS、128GB LPDDR5X 273GB/s、40–130W、Neoverse-V3AE、PVA、2026 量产;早期采用者 Figure/Boston Dynamics/Agility/Amazon/Meta):NVIDIA 官网 jetson-thor 页与 T5000 数据手册;NVIDIA 投资者新闻稿(2025)。[公开]
  • π0 / π0.5 / π0.7(3.3B=PaliGemma 3B + 300M 动作专家、流匹配、H=50、10(→5)步 Euler、50Hz、~76ms@RTX4090;π0.7 于 2026-04 发布,Gemma3 4B 主干):Physical Intelligence《π0: A Vision-Language-Action Flow Model》arXiv:2410.24164(2024);PI 官方;Gatech CS7643 课件(2026)。[公开]
  • OpenVLA 7B(Prismatic-7B = DINOv2 ViT-L/14 + SigLIP ViT-So400M/14 + Llama-2 7B;256-bin 动作 token;970k Open-X Embodiment;LoRA + 4-bit 量化):openvla.github.io、arXiv:2406.09246、HuggingFace openvla/openvla-7b。[公开]
  • Figure Helix / Helix 02(S2 VLM 7–9Hz / S1 视觉运动 Transformer 200Hz / S0 运动先验 1kHz;全程 onboard;双 NVIDIA RTX GPU 模块;Figure 03 加掌心相机+触觉):figure.ai/news/helix-02、Figure 02 规格评测(2026)。[公开 + 媒体]
  • Diffusion Policy(DDPM 迭代去噪,CNN/Transformer):Chi et al.,2023。[公开]
  • ACT(CVAE + Transformer,动作分块):Zhao et al.,ALOHA,2023。[公开]
  • NVIDIA Isaac GR00T N1.5 / N1.7(开源 humanoid 基础模型,双系统;N1.7 已 GA):NVIDIA Isaac,2025–2026。[公开]
  • 全球厂商格局(Tesla Optimus 工厂部署/自研芯片、Figure 估值约 390 亿美元 与 BMW 试点、Boston Dynamics 电动 Atlas、Agility Digit、Physical Intelligence 估值约 56 亿美元):Presenc AI《Humanoid Robot Market Tracker 2026》、Robotomated《Top Humanoid Robot Companies 2026》、IBTimes(2026)。[公开 + 媒体]
  • 中国厂商格局(宇树 IPO 过会/估值约 420 亿/2025 人形 5500+ 台/UnifoLM-VLA-0、智元万台量产/出货 5100+、银河通用估值约 225 亿;宇树+智元约 80% 出货):上交所过会公告与宇树招股书、新浪财经/36氪(2026)、TrendForce 人形机器人报告(2026)、新浪"中国具身五杰"。[公开 + 媒体]
  • 量化的内存/功耗推算、端到端延迟分解:基于上述公开规格的工程估算。[估计]