跳到主要内容

33 应用场景矩阵洞察

  • 章节编号:33
  • 所属层:需求/产品(A 层输入;扩展 01 章)
  • 关联 ADR:ADR-131(场景优先级与基线聚焦)、ADR-132(形态×行业验收模板)、ADR-133(国内 vs 全球场景差异)

学习目标

  • 前置知识:读过 01 章(负载/场景画像)与 21 章(具身模型支持)——知道 VLA、流匹配(flow matching)、动作 chunk、双系统(VLM+动作头)这些名词各指什么;了解「策略频率」与「伺服频率」是两条独立的时间线;对 SKU(32 章)有个模糊印象即可。不需要写过机器人控制代码。
  • 学完产出:① 能把「具身智能」这个泛词拆成 本体形态 × 行业垂直 × 具体任务 × 量化指标 四维矩阵,并说清每一维如何反推芯片诉求;② 能解释「为什么家庭场景要 50Hz 动作输出、但 chunk 推理只有 10-13Hz 也能跑」这个看似矛盾的现象——理解 chunk 长度 H 如何把「低频推理」摊成「高频输出」;③ 能判断一个新场景该选大 VLA 还是「任务级策略 + 小网」,并说清判据(节拍/可靠性/成本);④ 能从场景指标(成功率/节拍/可靠性)反推 SKU 选型(Edge-Lite / Pro / Dev Kit),而不是拍脑袋定配置;⑤ 理解国内(宇树/智元)与全球(Figure/NVIDIA)场景权重差异,及其对 Model Zoo 与合规策略的影响。
  • 阅读姿势:盯住一条主线——「场景不是用来罗列的,是用来做减法的」。具身创业最大的坑是「什么都想做」;本章所有矩阵的最终目的,都是把无穷的场景收敛到「基线必须跑通的两三个垂直」,再由这两三个垂直反推出确定的模型族、部署形态与 SKU。读的时候不断问自己:这一格如果去掉,基线验收会不会塌?

1. 范围与目标

将具身智能从「泛指机器人」落实为 本体形态 × 行业垂直 × 具体任务 × 量化指标 矩阵,驱动 SKU(32)、外设(06)、评测(27)优先级。这张矩阵是需求侧的「地图」:上游是 01 章的负载画像与 21 章的模型族,下游是 32 章的 SKU 定义与 27 章的验收集。它回答的不是「机器人能做什么」,而是「我们的芯片基线,必须先把哪几个场景做到可验收」。

核心问题

  1. 基线场景应 聚焦哪些任务?避免「什么都做」?
  2. 不同形态(人形/臂/四足/AMR)的 算力/延迟/外设 差异?
  3. 国内(宇树/智元)vs 全球(Figure/NVIDIA)场景权重?
  4. 场景的量化指标(成功率/节拍/可靠性)如何反推 SKU 与模型选型,而非拍脑袋?
  5. 同一个「50Hz 控制」需求,在算力侧到底意味着什么——是 50 次推理,还是 chunk 摊出来的高频输出?

2. 本体形态 taxonomy

具身智能的第一层收敛是本体形态:形态决定了自由度(DoF)、传感器数量、策略/伺服频率的分层结构,进而决定算力画像与 SKU 档位。下表是五类主流形态的画像;注意「策略频率」与「伺服频率」是两条独立时间线——策略频率是「大脑」多久输出一次动作意图,伺服频率是「小脑/关节」多久闭环一次,两者相差 1-2 个数量级。

形态代表产品DoF/传感策略频率算力画像优先 SKU
人形双足Figure 03, Unitree H2高 DoF;6-8 相机;触觉 P1VLA 7-50Hz;1kHz 伺服高内存;多 MIPI;安全岛必选Edge-Pro
移动 manipulatorDigit, Galbot G1轮式+双臂;4-6 相机准实时 VLA中等;长期运行Edge-Lite/Pro
固定/协作臂Franka, UR+AI1-3 相机;力控10-50Hz chunk较低;确定性重Edge-Lite
四足+臂Unitree B2-W3-4 相机;IMU运动+VLA 分层振动/散热Edge-Pro
AMR 仓储Amazon/Digit tote2-4 相机任务级 1-5Hz能效优先Edge-Lite

2.1 形态 → 频率分层的时间线视角

要理解为什么人形要 Edge-Pro、AMR 却只要 Edge-Lite,关键是看清每类形态需要同时驻留几条频率链路。人形是「三层塔」(S2 语义 / S1 视觉运动 / S0 伺服),三条链路必须同时在 onboard 算力上跑;AMR 只有「任务级 + 底盘运动」两层,且节拍宽松。下图把五类形态映射到 Figure Helix 02 那套 S2/S1/S0 分层坐标里(2026-07:Helix 02 为 S2 7-9Hz / S1 200Hz / S0 1kHz 三层):

读这张图的方式:一个形态需要「同时常驻的频率链路数」越多、最高频链路的确定性要求越硬,SKU 档位就越高。人形三链路同驻,且 S0 是 1kHz 硬实时,所以必须 Edge-Pro + 独立安全岛(伺服不能被大模型推理抢占);AMR 只有任务级(1-5Hz,可容忍抖动)+ 底盘运动,能效优先的 Edge-Lite 就够。这解释了为什么「形态」是场景矩阵的第一层收敛——它先把 SKU 档位的可行区间框死了。


3. 行业 × 任务矩阵(量化)

第二层收敛是行业垂直。同一个形态放到不同行业,任务的节拍、可靠性、延迟预算完全不同。下表把行业、具体任务、代表厂商、延迟预算、模型路线与芯片诉求一次对齐。修正一处历史口径:家庭服务的 π0 类模型是 50Hz 动作输出(不是「50Hz 语义」),其 chunk 推理本身只有 10-13Hz(单次 chunk 76-100ms),50Hz 是靠 chunk 长度 H=50 把一次推理摊成 50 个动作输出得到的——详见 §3.2 与思考题 1。

行业具体任务代表厂商延迟预算模型路线我们的芯片诉求
汽车工厂零件搬运/分拣Figure BMW, 智元chunk ≤100msVLM+DiT/π0Pro;安全岛;EtherCAT
仓储物流Tote 搬运/码垛Agility, Amazon1-5Hz 任务级任务策略+小网Lite;能效
零售/pharmacy24h 分拣/补货Galbot软实时VLM+仿真数据Pro;多相机
家庭服务叠衣/清桌/抓取PI π050Hz 动作输出;chunk 推理 76-100ms流匹配+RTCPro;INT4+减步
实验室/研发teleop/数据采集LeRobot非量产 SLOeager/BF16Dev Kit

基线聚焦候选(ADR-131):家庭叠衣/抓取 + 工厂分拣 两垂直 —— 覆盖 π0 与 GR00T-class(2026-07:GR00T 最新 N1.7 GA);AMR 作 Lite SKU 第二赛道。

3.1 场景 → 模型 → 部署形态 → SKU 的映射链

矩阵的价值在于打通「场景到 SKU 的整条推导链」,让每个 SKU 决策都有场景依据可追溯。下图把三条基线赛道(家庭 / 工厂 / 仓储)各自的推导链画成一张端到端映射——从场景约束出发,经模型族与部署形态,落到具体 SKU 与关键外设:

这张图是本章的骨架:它说明「SKU 不是芯片团队自己定的,是场景倒逼出来的」。家庭与工厂都落到 Edge-Pro,但驱动因素不同——家庭是「高柔性长尾 + INT4 大 VLA 驻留」,工厂是「强节拍 + 双模型 VM + 安全岛」;仓储则因为「任务级低频 + 无需大模型驻留」直接落 Edge-Lite。任何一格的场景约束变了,整条链都要重推

3.2 场景化真实业务症状(为什么这些约束是硬的)

矩阵里的数字不是拍出来的,背后是真实的业务症状。列几个「一线会踩的坑」帮助建立体感:

  • 家庭叠衣「动作发抖 / 卡顿」:若把 chunk 推理频率(10-13Hz)直接当作动作输出频率,机械臂每 76-100ms 才更新一次目标位姿,肉眼可见的「一顿一顿」。真实做法是 chunk 内 50 个动作以 50Hz 平滑回放,同时 用 RTC(Real-Time Chunking,2026-07 仍是 π 系列延迟事实解法)异步生成下一 chunk,避免 chunk 边界处的停顿。症状根因见思考题 1。
  • 工厂分拣「节拍掉线 / 漏件」:产线节拍(takt time)是刚性的,大 VLA 若单次推理波动到 300ms+(如 GR00T 在 Orin 上 173ms、eager 300ms),就会错过传送带上的目标窗口。工厂宁可用「任务级策略 + 小网」把每个动作压到确定性的几十毫秒,也不要一个平均更快但 p99 不可控的大模型。这是「可靠性 > 平均延迟」的典型。
  • 仓储 tote「跑一天热到降频」:AMR 是 7×24 长期运行,散热与能效是第一约束。大 VLA 满血跑会让 SoC 持续高温触发 thermal throttling,反而不如小网稳定。所以仓储 SKU 选 Edge-Lite「能效优先」,不是抠成本,是热预算决定的(对接 05/11 章 TDP)。
  • 人形「大模型推理把伺服卡死」:S0 的 1kHz 关节伺服若和 S2 大模型共享同一算力域,一次大推理就可能让伺服 miss deadline,机器人当场跌倒。所以人形必须有独立安全岛跑伺服(需求红线,详见 13 章分域调度),这是 Edge-Pro 而非 Lite 的硬理由。

4. 场景 × 章节 traceability

场景需求驱动章节
多相机同步06 MIPI/PTP;09 dmabuf
力控装配35 控制栈;06 EtherCAT
长时运行散热05/11 TDP SKU
断网工厂24 onboard;31 edge-only
国内 LeRobot20/26 manifest

5. 国内 vs 全球差异(ADR-133)

第三层收敛是地域权重。国内与全球的出货形态、大脑栈、合规红线、生态入口差异极大,直接影响 Model Zoo 该收哪些模型、合规默认什么策略。

维度全球国内
出货形态人形+工业试点人形量产(宇树/智元 80%+)
大脑栈NVIDIA Thor/自研310P demo;补强中
数据/合规GDPRPIPL;视频默认本地(28)
生态入口Isaac/GR00TLeRobot + 自研 VLA

2026-07 出货侧信号(以官方/第三方为准):宇树 Unitree 于 2026-07 科创板 IPO,产能与品牌进一步放大;智元 AgiBot 2025 年出货 5100+ 台(Omdia 口径),是国内出货量领跑者之一;Tesla Optimus 截至 2026-07 仍未量产(roadmap 口径,以官方为准),生态仍全私有。这组信号强化了一个判断:国内的差异化窗口是「量产本体已就位、但大脑栈仍在补强」——芯片侧只要把 310P 的 π0 430ms 追到 <100ms,就有明确的国产替代卖点。

机会:国内 430ms→<100ms 差异化 + 开放 MLIR 栈(01/21)。


6. 结论与 ADR 候选

  • ADR-131 场景优先级:基线场景 叠衣/抓取 + 工厂分拣;AMR Lite 第二;家庭/零售 Sim 先行。
  • ADR-132 验收模板:每场景绑定 27 章指标子集(manifest scenario_id)。
  • ADR-133 国内/全球权重:Model Zoo 必含 π0/OpenVLA;兼容 UnifoLM-VLA-0;合规默认 local-only

深入思考

下面三题每题先给题干,再用 <details> 折叠一份图文并茂的参考答案。建议先合上答案自己想 3 分钟,再展开对照。三题分别对应本章的三个核心判断:频率摊派、模型选型、SKU 反推。

思考题 1:为何家庭场景「50Hz 动作输出」而 chunk 推理只有 10-13Hz

家庭叠衣用 π0 流匹配,对外宣称 50Hz 动作输出,但你 profiling 发现单次 chunk 推理要 76-100ms(即 10-13Hz)。这两个数字看起来矛盾——如果推理只有 13Hz,机械臂怎么可能 50Hz 更新?结合 §3.1 的 chunk 长度 H 与 21 章的动作 chunk 概念,解释「低频推理如何摊成高频输出」,并算清:chunk H=50、单次推理延迟 100ms 时,一次推理够撑多久的动作回放?RTC 在其中解决什么问题?

展开参考答案(含 chunk 摊派时序图 + 算一遍)

结论:50Hz 是「动作输出频率」,10-13Hz 是「推理频率」,两者靠 chunk 长度 H 解耦——一次推理吐出 H=50 个动作,机械臂以 50Hz 逐个回放,这 50 个动作能撑 1 秒;只要下一次推理在这 1 秒内完成(76-100ms 绰绰有余),输出就永不断流;RTC 负责在 chunk 边界处无缝拼接,消除「换 chunk」时的停顿。

用具体数字算一遍:

  1. 动作输出周期:50Hz → 每个动作 1/50 = 20ms 输出一次。
  2. 一次推理产出的动作数:chunk 长度 H = 50 个动作。
  3. 一个 chunk 能撑的时长:50 个动作 × 20ms/动作 = 1000ms = 1 秒这就是关键——一次推理虽然慢(100ms),但它一口气产出了够回放整整 1 秒的动作序列。
  4. 推理必须多快才不断流:只要「下一次推理完成」早于「当前 chunk 回放完」,即推理延迟 100ms &lt; 1000ms,就有 900ms 富余。所以 10-13Hz 的推理频率完全撑得起 50Hz 的输出。
  5. 对比:若不用 chunk(每步单独推理):要 50Hz 输出就得 50Hz 推理,即每次 ≤20ms——而 π0 单次 chunk 就要 76-100ms,根本不可能。chunk 正是把「慢推理」变成「快输出」的杠杆。

RTC 解决什么:朴素做法是「回放完当前 chunk 再开始下一次推理」,但推理那 100ms 里没有新动作产出 → chunk 边界处停顿。RTC(Real-Time Chunking)在当前 chunk 还在回放时 就异步启动下一次推理,并用 inpainting 让新 chunk 与旧 chunk 在交界处平滑衔接。代价是 runtime 要做 双缓冲 + 并发度 +1(对接 21 章部署模式 E)。回链:这正是 §3.2「家庭叠衣动作发抖」症状的根因——把推理频率误当输出频率,或漏了 RTC 双缓冲,就会看到肉眼可见的顿挫。

思考题 2:仓储/工厂场景为何用「任务级策略 + 小网」而非大 VLA

同样是「抓东西放进箱子」,家庭场景用 π0 这种 3-5B 大 VLA,但仓储 tote 搬运却推荐「任务级策略 + 小网」(§3 表)。既然大 VLA 更「聪明」,为什么不无脑上大模型?结合 §3.2 的工厂/仓储症状 与 21 章的算力画像,从「任务柔性」「节拍/可靠性」「热与能效」三个维度论证选型逻辑。

展开参考答案(含选型判据图 + 对比表)

结论:大 VLA 的价值是「柔性泛化」——应对家庭那种无穷长尾、非结构化的任务;而仓储/工厂是「结构化、重复、强节拍」场景,不需要柔性,却对可靠性、节拍确定性、能效极度敏感。在这类场景,大 VLA 的高柔性用不上,反而它的高延迟波动、高功耗、大内存占用全是负债——所以用确定性更强、更省电的「任务级策略 + 小网」更划算。

三维度对比:

维度大 VLA(π0/GR00T-class)任务级策略 + 小网
任务柔性强:能泛化到未见过的物体/布局弱:只覆盖预设 SKU/工位,但仓储任务本就固定
节拍 / 可靠性平均可能更快,但 p99 波动大(Orin 173ms、eager 300ms);错过传送带窗口 → 漏件每动作确定性几十毫秒;p99 可控 → 不漏件
热 / 能效满血推理持续高功耗 → 7×24 易 thermal throttling小网低功耗 → 长期运行温度稳,能效优先
内存驻留INT4 后仍 1.7-3.5GB + KV → 须 ≥8GB 主存几十 M 到百 M 小网,可驻 SRAM
落地 SKUEdge-ProEdge-Lite

算一遍(节拍视角):设产线 takt time = 一件 500ms。用小网每动作确定性 40ms,一个抓放动作序列(如 8 步)= 8 × 40 = 320ms &lt; 500ms,稳稳赶上节拍且有富余。换大 VLA,平均 chunk 100ms 看似够,但 p99 抖到 300ms 时,单次动作就吃掉大半节拍预算,连续几件累积就会 miss。结论:仓储/工厂选型的第一判据不是「模型多聪明」,而是「p99 是否稳落在节拍预算内」。回链:这正是 §3.2「工厂分拣节拍掉线」与「仓储热到降频」两个症状背后的选型逻辑。

思考题 3:场景指标(成功率/节拍/可靠性)如何反推 SKU 选型

你拿到一个新场景需求:「零售药房 24 小时补货,要求任务成功率 ≥99%、单件节拍 ≤2s、可 7×24 运行」。手上有 Edge-Lite / Edge-Pro / Dev Kit 三档 SKU(32 章)。结合 §2.1 频率分层§3.1 场景→SKU 映射链,说清你如何从这三个指标反推 SKU,而不是先选芯片再凑场景。

展开参考答案(含指标→SKU 反推图 + 算一遍)

结论:SKU 选型应该「指标先行、芯片后选」——把每个场景指标翻译成对算力/内存/热/确定性的硬约束,取这些约束的并集,再匹配到能同时满足全部约束的最低档 SKU。成功率高 → 需大 VLA + 多相机(算力/内存);节拍紧 → 需低 p99(确定性/算力冗余);7×24 → 需热预算(能效/散热)。三条约束叠加,药房场景落 Edge-Pro。

用具体指标算一遍:

  1. 成功率 ≥99% → 药房 SKU 种类多、包装各异,属高柔性长尾 → 需大 VLA(+ 仿真数据),内存 INT4 后仍 ≥8GB;多相机覆盖货架深度 → 多路 MIPI这一条已经把 Edge-Lite 淘汰(内存/相机路数不足)。
  2. 节拍 ≤2s → 单件预算 2000ms,即使一次 chunk 100ms、动作序列 10 步 ≈ 1s,仍需留出感知/规划/失败重试余量;为压住 p99,需要算力冗余,不能选算力刚好卡线的档位。指向 Pro 级冗余
  3. 7×24 运行 → 持续满载不能 thermal throttling,须足够 TDP 与散热(对接 05/11 章)。Edge-Lite 的能效档在满载大 VLA 下热预算不够;Dev Kit 是非量产开发件,直接排除。
  4. 取并集:内存 ≥8GB(来自①)∩ 算力冗余 + 多相机(①②)∩ 足够热预算(③)= 只有 Edge-Pro 同时满足
  5. 反向验证:若强行用 Edge-Lite,会先卡在内存(装不下大 VLA + KV + 多相机缓冲),再卡在热(满载降频拖垮节拍)——两条都撞墙,证明 Lite 不可行。

方法论要点:永远是「指标 → 硬约束 → 约束并集 → 最低可行 SKU」,而非「先有芯片再找场景」。每条约束都要能追溯到具体指标,这样 SKU 决策才可审计、可复用到新场景。回链:这套反推正是 §3.1 场景→SKU 映射链的「指标侧入口」,也是 ADR-132 验收模板要求「每场景绑定 27 章指标子集」的原因——指标是 SKU 的第一性依据。


附:信息来源

区分公开/估计;参考时间 2026-07。roadmap 项标「以官方为准」。

  • 01 章厂商表;TrendForce 2026 出货;Figure BMW / PI / Galbot 公开案例。[公开]
  • Figure Helix 02 三层频率(S2 7-9Hz / S1 200Hz / S0 1kHz):figure.ai/news/helix-02。[公开]
  • π 系列最新(π0.7 2026-04;π*0.6+Recap):pi.website;arXiv。[公开]
  • GR00T N1.7 GA:NVIDIA Isaac 2026。[公开]
  • RTC / Training-Time RTC(chunk 双缓冲、延迟鲁棒):arXiv:2506.07339, arXiv:2512.05964;pi.website。[公开]
  • 宇树 Unitree 2026-07 科创板 IPO:公开新闻,以官方招股书/公告为准。[公开;以官方为准]
  • 智元 AgiBot 2025 出货 5100+ 台:Omdia 口径。[公开]
  • Tesla Optimus 截至 2026-07 未量产:roadmap 口径,以官方为准。[以官方为准]
  • 昇腾 310P π0(~430ms FP16 叠衣真机):devpress.gitcode.com;对标 GR00T Thor 92ms。[公开]
  • chunk 摊派 / 节拍 / SKU 反推算例:基于 π0/RTC 公开 profiling 与产线节拍常识的工程估算。[估计]