01 具身智能负载与场景需求洞察
- 章节编号:01
- 所属层:需求输入( 驱动 H/I/S/R/C/M/D/A 全栈)
- 关联 ADR:ADR-001(数值精度基线)、ADR-002(实时性分层)、ADR-003(内存/带宽预算)、ADR-004(基线验证模型)
学习目标
- 前置知识:知道「具身智能 = 机器人 + AI 大脑」这一朴素图景即可;了解 Transformer/注意力(attention)是什么、什么叫「量化(quantization)」把权重从 FP16 压到 INT4;听说过 VLA(Vision-Language-Action,视觉-语言-动作)这个词。无需读过后续任何一章——本章就是整套洞察的输入层,后面所有章节的硬指标都从这里反推而来。
- 学完产出:① 能把一个具身场景(叠衣物 / 移动抓取 / 1kHz 伺服)翻译成一组芯片可量化的硬指标——延迟预算、控制频率、权重容量、精度组合;② 能亲手「算一遍」一个 VLA 的端到端延迟(如 π0 的 46ms prefill 加 5 步去噪 30ms ≈ 76ms)与量化后显存占用(OpenVLA 7B INT4 ≈ 3.5GB),不再对「够不够跑得动」拍脑袋;③ 能说清具身负载为什么是多频率、混合实时的——策略 1–50Hz、视觉运动 200Hz、伺服 1kHz 为何必须分域调度而非塞进一个大循环;④ 能判断一个具身模型该落在端 / 边 / 中心的哪一形态,以及这一选择如何由场景的实时性、隐私、带宽约束倒推出来。
- 阅读姿势:盯住一条主线——「芯片的每一条硬指标,都是被某个具体场景加具体模型逼出来的」。不要孤立地记「端侧要 8GB」,而要记住它来自「π0 类 INT4 权重 1.7–3.5GB 加 KV-cache 加感知缓冲 加控制小网」这条 反推链。本章之后的每一章(微架构 / 编译 / 运行时 / 压缩),本质都在回答本章提出的某一条需求。
1. 范围与目标
本章是整个洞察的输入层:把"具身智能"翻译成芯片与软件栈可量化的需求。所有论断点名具体模型/公司/场景并标注来源;参数量/频率/功耗如无官方数据则标"估计"。
要回答的核心问题
- 业界最常用的具体模型有哪些?结构(主干/参数量/算子)如何?演进趋势是什么?
- 随这种演进,芯片需具备的算力 / 功耗 / 内存(容量+带宽) 诉求如何变化?
- 具体公司落地用了什么硬件/软件方案?
- 具身的实时性与确定性如何分层?延迟预算怎么分配?
- 端 / 边 / 中心三形态差异,及基线验证模型与关键设计约束(喂给后续各章与技术选型)。
一图看懂本章的反推逻辑——从「场景」出发,经「模型」落到「硬指标」,最终喂给全栈各章:
2. 业界最常用的具体模型(点名 · 结构 · 算子 · 演进)
具身"大脑"主流是 VLA(Vision-Language-Action)+ 扩散/流匹配动作头 + 分层控制。下列为当前(2024–2026)最常被采用/复现的代表模型。
2.1 代表模型与结构
| 模型 | 机构 / 年份 | 参数量 | 主干结构 | 动作生成方式 | 控制频率 |
|---|---|---|---|---|---|
| RT-2 / RT-2-X | Google DeepMind, 2023 | 55B(RT-2-X) | PaLI-X / PaLM-E(VLM) | 动作 token 自回归 | ~1–3 Hz |
| OpenVLA | Stanford 等, 2024 | 7B | DINOv2 ViT-L/14 + SigLIP ViT-So400M/14(融合视觉)+ Llama-2 7B | 动作离散为 256 bin token,自回归 | ~5–10 Hz |
| Octo | 开源, 2024 | 27M–93M | Transformer(模块化) | 扩散动作头 | 较高 |
| Diffusion Policy | Columbia/MIT, 2023 | 数十–百 M | CNN/Transformer U-Net | DDPM 迭代去噪(原 ~100 步,DDIM 可降) | 10–100 Hz |
| ACT(Action Chunking Transformer) | Stanford ALOHA, 2023 | ~80M | CVAE + Transformer | 动作分块(chunk)直接回归 | ~高频 |
| π0 / π0.5 / π0.7 | Physical Intelligence, 2024–2026 | 3.3B → ~4B → 5B | PaliGemma 3B VLM + 300M 动作专家(π0.7 用 Gemma3 4B) | 流匹配(flow matching),动作分块 H=50,10(→5)步 Euler 积分 | up to 50 Hz |
| NVIDIA Isaac GR00T N1/N1.5/N1.7 | NVIDIA, 2025–2026 | ~2B | 双系统:VLM(System 2)+ 扩散 Transformer DiT(System 1) | 扩散动作头 | 分层 |
时效补注(截至 2026 年中):π0.7 已于 2026-04 发布(Gemma3 4B 主干,进一步减步);GR00T N1.7 已 GA(正式可用);Figure Helix 02 三层分工细化为 S2 VLM 7–9Hz / S1 视觉运动 200Hz / S0 运动先验 1kHz。上述代次演进节奏极快,具体规格与发布状态以官方为准。
2.2 算子/计算模式构成(对硬件的压力来源)
| 计算模式 | 来源(点名) | 对硬件的诉求 |
|---|---|---|
| GEMM / 全连接 | Llama-2 7B(OpenVLA)、Gemma/PaliGemma(π0)FFN 与投影、控制 MLP | 计算阵列利用率、小 GEMM/低延迟 |
| 注意力 + KV-cache | 所有 VLM 主干;π0 对前缀 o_t 做 KV-cache,仅重算动作 token | 内存带宽、KV-cache 容量、softmax |
| 卷积 / ViT patch | DINOv2 + SigLIP(OpenVLA)、各感知前端 | 数据复用、原生 conv / winograd |
| 迭代去噪 / 流匹配 | Diffusion Policy(~100 步)、π0(10 步)、GR00T(DiT) | 同网络多步迭代→延迟敏感的高有效算力 |
| 多模态融合 / cross-attn | VLA 视觉-语言-状态融合、Helix"全传感器入" | 不规则张量、动态 shape、blockwise 注意力掩码 |
| 小算子 / 标量控制 | 底层伺服、后处理 | 极低延迟、CPU/标量协同 |
2.3 演进趋势(代际对比)
- 动作头从"离散 token 自回归"→"连续流匹配/扩散":RT-2/OpenVLA 用离散 token;π0 改用流匹配生成连续动作(更适合高频灵巧操作,50Hz)。→ 芯片需高效支持迭代式小网络推理。
- 主干规模上行:π0(3.3B,PaliGemma 3B)→ π0.5(~4B)→ π0.7(5B,Gemma3 4B,2026-04)→ RT-2-X 达 55B。→ 权重容量与带宽压力持续上升,端侧靠强压缩。
- 分层化(双/三系统):Figure Helix 02 = System 2(VLM,7–9Hz)+ System 1(视觉运动 Transformer,200Hz)+ System 0(运动先验,1kHz);NVIDIA GR00T = VLM + DiT 双系统。→ 芯片必须服务多频率、混合实时并发。
- 减步加速:扩散从 ~100 步向一致性/步数蒸馏(π0 从 10 步减到 5 步)收敛。→ 软件"减步"换延迟,硬件优化单步能效。
- 端侧本地化:Figure Helix"fully onboard,无云依赖"。→ 认知层须可在端侧功耗包络内本地运行。
3. 具体公司落地方案(点名)
"TOP3"无官方统一排名,取决于口径(AI 能力/量产落地/估值/出货量);下列为 2026 主流共识的代表厂商及其模型 + 硬件/算力方案,作为我们的潜在客户与对标对象。
3.1 全球代表厂商
| 公司 | 场景/产品 | 模型方案 | 硬件/算力方案 |
|---|---|---|---|
| 特斯拉 Tesla | Optimus(Gen 3),自有工厂(搬运/装配),目标 2 万–3 万美元/台 | 复用 FSD 神经网络栈,自训车队数据 | 自研 AI 芯片(Tesla AI/DOJO 体系) + 垂直整合电池/制造,端侧本地推理 |
| Figure AI | 人形(Figure 02/03);BMW 工厂 11 个月试点(搬运 X3 零件)、家务上货架 | Helix / Helix 02 三系统(S2 VLM 7–9Hz / S1 视觉运动 Transformer 200Hz / S0 运动先验 1kHz),全身控制,全程 onboard 无云依赖 | 双 NVIDIA RTX GPU 模块(约 Figure 01 的 3×);Figure 03 加掌心相机+指尖触觉 |
| 波士顿动力 Boston Dynamics(现代汽车) | 电动 Atlas,工业/仓储试点 | 运动/操作能力最强,转向工业可靠性 | 端侧算力(采用 NVIDIA Jetson Thor 生态);Orbit 车队管理 |
| Physical Intelligence(Pi) | "机器人基础模型/OS";叠衣物、清桌、装箱 | π0/π0.5/π0.7 流匹配 VLA(PaliGemma 3B/Gemma3 4B + 动作专家),50Hz,跨本体 | 训练/评测 RTX 4090 级(π0 ~76ms@4090,公开);软件中立,适配多硬件 |
| NVIDIA | humanoid 基础模型 + 边缘平台(给全行业供算力) | Isaac GR00T N1.5/N1.7(开源 humanoid 基础模型,VLM + DiT 双系统) | Jetson Thor(Blackwell,2070 FP4 TFLOPS/128GB/273GB/s/40–130W,2026 量产),事实标杆 |
| Agility Robotics | Digit,亚马逊仓储 tote 搬运(商用部署最实) | 任务级策略 | 端侧算力(Jetson 生态) |
| Google DeepMind | 通用操作研究 | RT-2 / RT-2-X(55B)/ Gemini Robotics(VLA) | TPU 云训练 + 机器人端 |
早期采用 Jetson Thor 的公司(NVIDIA 官方列示):Figure、Boston Dynamics、Agility Robotics、Amazon Robotics、Meta 等。
3.2 中国代表厂商
| 公司 | 场景/产品 | 模型方案 | 硬件/算力方案 |
|---|---|---|---|
| 宇树科技 Unitree | H1/H2 人形、Go2 四足;人形出货全球第一(2025 约 5500+ 台);科创板 IPO 过会 | 极致硬件 + 运动控制;2026.1 发布 UnifoLM-VLA-0 通用 VLA,自有工厂部署测试 | 自研本体/关节模组;AI"大脑"为补强方向(募资 85% 投研发) |
| 智元机器人 AgiBot | 远征 A3、灵犀 X2;已达万台级量产(2025 出货 5100+);汽车/3C/物流 | 全栈自研 + 标准化供应链;具身基础模型 | 订单驱动柔性产线,核心零部件自主可控 |
| 银河通用 Galbot | Galbot G1(轮式双臂);零售/药店 24h 自动分拣规模化 | 具身大模型 + 仿真合成数据路线(软件大脑派) | 轮式双臂平台;国家大基金重仓 |
| 其他("具身五杰"+) | — | 星动纪元(灵巧手全球标杆、海外占比高)、星海图(世界模型/开发者生态);优必选 UBTech(已上市,Walker S2)、傅利叶 Fourier、小鹏 IRON、小米 | 多为本体 + 关节 + 模型并进 |
2026 预计宇树 + 智元合计囊括中国人形约 80% 出货(TrendForce)。
3.3 对我们的信号
- 头部普遍走"VLM 大脑 + 高频动作/控制层 + 端侧本地推理"路线 → 印证本章负载画像(多频率混合实时)。
- 边缘算力事实标杆 = NVIDIA Jetson Thor;特斯拉走自研芯片垂直整合 → 我们以能效/确定性/成本做差异化对标。
- 中国厂商(宇树/智元/银河通用)出货量与量产领先,但 AI"大脑"普遍在补强 → 是我们芯片 + 软件栈的重点潜在客户(尤其需要高能效端侧推理 + 易用工具链)。
- Physical Intelligence 等"模型中立"路线 → 我们需良好支持其 VLA(π0 流匹配)以争取生态。
4. 由演进反推的芯片诉求(量化)
以"端侧人形机器人本体、batch=1、实时闭环"为基准场景,结合上节模型反推:
4.1 算力 / 能效
- 基准对标:NVIDIA Jetson Thor T5000 提供 2070 FP4(稀疏)/ 1035 FP8 TFLOPS,功耗 40–130W(默认 120W),相对 Orin 能效提升约 3.5×(NVIDIA 官方);2026 量产,128GB LPDDR5X。
- 诉求:端侧推理 SoC 算力量级 ~数百–2000 TFLOPS(低精度),但能效(TOPS/W)是第一 KPI;须支持稀疏。
- 小批量利用率:VLA/控制为 batch≈1,需在小 GEMM/小算子下保持高利用率(堆峰值无意义)。
4.2 功耗
- 端侧 SoC 预算 ~10–60W(机器人本体电池供电,温升受限);对标 Thor 的 40–130W 区间,我们若主打能效应在同等任务下显著低功耗。
4.3 内存(容量 + 带宽)——常为真正瓶颈
- 容量口径(务必写明,避免区间歧义):π0 3.3B、OpenVLA 7B 权重量化后——INT4 口径 1.7–3.5GB;INT8 为 3.3–7GB(估计,随主干规模而定)。叠加 KV-cache、多模型并发、感知缓冲,端侧建议 ≥8–16 GB(Thor 给到 128GB LPDDR5X,面向多模型/大模型余量)。
- 带宽:注意力 + KV-cache + 扩散多步迭代是访存密集;Thor 为 273 GB/s LPDDR5X。端侧建议带宽量级 ≥100–300 GB/s,且需大片上 SRAM减少 DRAM 往返(详见 03 章)。
4.4 精度
- 无单一精度通吃:权重 INT4/INT8 + 激活 INT8/FP8 + 关键路径 BF16/FP16;OpenVLA 已验证 4-bit 量化半内存、精度基本无损(公开)。Thor/Blackwell 原生支持 FP4/FP8/INT8/BF16,印证混合精度方向。
4.5 演进映射(当前 → 未来)
| 维度 | 当前(π0 3.3B/OpenVLA 7B) | 未来(π0.7 5B+、更大 VLM、多模型并发) |
|---|---|---|
| 权重容量 | INT4 后 ~1.7–3.5GB | ~3–8GB+,需更大内存/更强压缩 |
| 带宽压力 | 中(KV-cache + 5–10 步扩散) | 高(更长上下文、世界模型、多路) |
| 算力 | 数百 TFLOPS 级够用 | 向 ~1–2k 低精度 TFLOPS,且能效更关键 |
| 精度 | INT4/8 + FP8 | 同左 + 更激进低比特/稀疏 |
4.6 反推链一图串起:从负载到硬件需求
前面几节把「模型演进」拆成了一堆分散的指标。这里用一张图把**「场景负载 → 计算特征 → 芯片硬指标」**的反推链完整串起来,便于后续各章直接引用为需求锚点:
这张图的用法:后续任何一章要论证「为什么芯片要这么设计」时,都可以回溯到左侧的某个场景负载。例如 02 章的「小 GEMM 利用率」直接对应 A1→B3→C3;13 章的「确定性调度」对应 A3→B3→C4;19 章的「强压缩」对应 A1→B1→C1 的延迟压力。需求不是凭空拍的,每一条都能追溯到一个具体场景。
5. 具身分层负载与实时性(确定性是护城河)
| 层级 | 代表(点名) | 频率 | 实时性 | 算力特征 |
|---|---|---|---|---|
| 认知/任务规划 | VLM(System 2,Helix 7–9Hz) | 0.2–9 Hz | 软实时 | 大权重、访存密集 |
| 策略/动作生成(VLA) | OpenVLA / π0 | 1–50 Hz | 准实时 | Transformer + 视觉编码器 + 迭代动作头 |
| 视觉运动控制 | Helix System 1 | 200 Hz | 硬实时 | 中型 Transformer,全传感→全关节 |