33 应用场景矩阵洞察
- 章节编号:33
- 所属层:需求/产品(A 层输入;扩展 01 章)
- 关联 ADR:ADR-131(场景优先级与基线聚焦)、ADR-132(形态×行业验收模板)、ADR-133(国内 vs 全球场景差异)
学习目标
- 前置知识:读过 01 章(负载/场景画像)与 21 章(具身模型支持)——知道 VLA、流匹配(flow matching)、动作 chunk、双系统(VLM+动作头)这些名词各指什么;了解「策略频率」与「伺服频率」是两条独立的时间线;对 SKU(32 章)有个模糊印象即可。不需要写过机器人控制代码 。
- 学完产出:① 能把「具身智能」这个泛词拆成 本体形态 × 行业垂直 × 具体任务 × 量化指标 四维矩阵,并说清每一维如何反推芯片诉求;② 能解释「为什么家庭场景要 50Hz 动作输出、但 chunk 推理只有 10-13Hz 也能跑」这个看似矛盾的现象——理解 chunk 长度 H 如何把「低频推理」摊成「高频输出」;③ 能判断一个新场景该选大 VLA 还是「任务级策略 + 小网」,并说清判据(节拍/可靠性/成本);④ 能从场景指标(成功率/节拍/可靠性)反推 SKU 选型(Edge-Lite / Pro / Dev Kit),而不是拍脑袋定配置;⑤ 理解国内(宇树/智元)与全球(Figure/NVIDIA)场景权重差异,及其对 Model Zoo 与合规策略的影响。
- 阅读姿势:盯住一条主线——「场景不是用来罗列的,是用来做减法的」。具身创业最大的坑是「什么都想做」;本章所有矩阵的最终目的,都是把无穷的场景收敛到「基线必须跑通的两三个垂直」,再由这两三个垂直反推出确定的模型族、部署形态与 SKU。读的时候不断问自己:这一格如果去掉,基线验收会不会塌?
1. 范围与目标
将具身智能从「泛指机器人」落实为 本体形态 × 行业垂直 × 具体任务 × 量化指标 矩阵,驱动 SKU(32)、外设(06)、评测(27)优先级。这张矩阵是需求侧的「地图」:上游是 01 章的负载画像与 21 章的模型族,下游是 32 章的 SKU 定义与 27 章的验收集。它回答的不是「机器人能做什么」,而是「我们的芯片基线,必须先把哪几个场景做到可验收」。
核心问题
- 基线场景应 聚焦哪些任务?避免「什么都做」?
- 不同形态(人形/臂/四足/AMR)的 算力/延迟/外设 差异?
- 国内(宇树/智元)vs 全球(Figure/NVIDIA)场景权重?
- 场景的量化指标(成功率/节拍/可靠性)如何反推 SKU 与模型选型,而非拍脑袋?
- 同一个「50Hz 控制」需求,在算力侧到底意味着什么——是 50 次推理,还是 chunk 摊出来的高频输出?
2. 本体形态 taxonomy
具身智能的第一层收敛是本体形态:形态决定了自由度(DoF)、传感器数量、策略/伺服频率的分层结构,进而决定算力画像与 SKU 档位。下表是五类主流形态的画像;注意「策略频率」与「伺服频率」是两条独立时间线——策略频率是「大脑」多久输出一次动作意图,伺服频率是「小脑/关节」多久闭环一次,两者相差 1-2 个数量级。
| 形态 | 代表产品 | DoF/传感 | 策略频率 | 算力画像 | 优先 SKU |
|---|---|---|---|---|---|
| 人形双足 | Figure 03, Unitree H2 | 高 DoF;6-8 相机;触觉 P1 | VLA 7-50Hz;1kHz 伺服 | 高内存;多 MIPI;安全岛必选 | Edge-Pro |
| 移动 manipulator | Digit, Galbot G1 | 轮式+双臂;4-6 相机 | 准实时 VLA | 中等;长期运行 | Edge-Lite/Pro |
| 固定/协作臂 | Franka, UR+AI | 1-3 相机;力控 | 10-50Hz chunk | 较低;确定性重 | Edge-Lite |
| 四足+臂 | Unitree B2-W | 3-4 相机;IMU | 运动+VLA 分层 | 振动/散热 | Edge-Pro |
| AMR 仓储 | Amazon/Digit tote | 2-4 相机 | 任务级 1-5Hz | 能效优先 | Edge-Lite |
2.1 形态 → 频率分层的时间线视角
要理解为什么人形要 Edge-Pro、AMR 却只要 Edge-Lite,关键是看清每类形态需要同时驻留几条频率链路。人形是「三层塔」(S2 语义 / S1 视觉运动 / S0 伺服),三条链路必须同时在 onboard 算力上跑;AMR 只有「任务级 + 底盘运动」两层,且节拍宽松。下图把五类形态映射到 Figure Helix 02 那套 S2/S1/S0 分层坐标里(2026-07:Helix 02 为 S2 7-9Hz / S1 200Hz / S0 1kHz 三层):
读这张图的方式:一个形态需要「同时常驻的频率链路数」越多、最高频链路的确定性要求越硬,SKU 档位就越高。人形三链路同驻,且 S0 是 1kHz 硬实时,所以必须 Edge-Pro + 独立安全岛(伺服不能被大模型推理抢占);AMR 只有任务级(1-5Hz,可容忍抖动)+ 底盘运动,能效优先的 Edge-Lite 就够。这解释了为什么「形态」是场景矩阵的第一层收敛——它先把 SKU 档位的可行区间框死了。
3. 行业 × 任务矩阵(量化)
第二层收敛是行业垂直。同一个形态放到不同行业,任务的节拍、可靠性、延迟预算完全不同。下表把行业、具体任务、代表厂商、延迟预算、模型路线与芯片诉求一次对齐。修正一处历史口径:家庭服务的 π0 类模型是 50Hz 动作输出(不是「50Hz 语义」),其 chunk 推理本身只有 10-13Hz(单次 chunk 76-100ms),50Hz 是靠 chunk 长度 H=50 把一次推理摊成 50 个动作输出得到的——详见 §3.2 与思考题 1。
| 行业 | 具体任务 | 代表厂商 | 延迟预算 | 模型路线 | 我们的芯片诉求 |
|---|---|---|---|---|---|
| 汽车工厂 | 零件搬运/分拣 | Figure BMW, 智元 | chunk ≤100ms | VLM+DiT/π0 | Pro;安全岛;EtherCAT |
| 仓储物流 | Tote 搬运/码垛 | Agility, Amazon | 1-5Hz 任务级 | 任务策略+小网 | Lite;能效 |
| 零售/pharmacy | 24h 分拣/补货 | Galbot | 软实时 | VLM+仿真数据 | Pro;多相机 |
| 家庭服务 | 叠衣/清桌/抓取 | PI π0 | 50Hz 动作输出;chunk 推理 76-100ms | 流匹配+RTC | Pro;INT4+减步 |
| 实验室/研发 | teleop/数据采集 | LeRobot | 非量产 SLO | eager/BF16 | Dev Kit |
基线聚焦候选(ADR-131):家庭叠衣/抓取 + 工厂分拣 两垂直 —— 覆盖 π0 与 GR00T-class(2026-07:GR00T 最新 N1.7 GA);AMR 作 Lite SKU 第二赛道。
3.1 场景 → 模型 → 部署形 态 → SKU 的映射链
矩阵的价值在于打通「场景到 SKU 的整条推导链」,让每个 SKU 决策都有场景依据可追溯。下图把三条基线赛道(家庭 / 工厂 / 仓储)各自的推导链画成一张端到端映射——从场景约束出发,经模型族与部署形态,落到具体 SKU 与关键外设:
这张图是本章的骨架:它说明「SKU 不是芯片团队自己定的,是场景倒逼出来的」。家庭与工厂都落到 Edge-Pro,但驱动因素不同——家庭是「高柔性长尾 + INT4 大 VLA 驻留」,工厂是「强节拍 + 双模型 VM + 安全岛」;仓储则因为「任务级低频 + 无需大模型驻留」直接落 Edge-Lite。任何一格的场景约束变了,整条链都要重推。
3.2 场景化真实业务症状(为什么这些约束是硬的)
矩阵里的数字不是拍出来的,背后是真实的业务症状。列几个「一线会踩的坑」帮助建立体感:
- 家庭叠衣「动作发抖 / 卡顿」:若把 chunk 推理频率(10-13Hz)直接当作动作输出频率,机械臂每 76-100ms 才更新一次目标位姿,肉眼可见的「一顿一顿」。真实做法是 chunk 内 50 个动作以 50Hz 平滑回放,同时 用 RTC(Real-Time Chunking,2026-07 仍是 π 系列延迟事实解法)异步生成下一 chunk,避免 chunk 边界处的停顿。症状根因见思考题 1。
- 工厂分拣「节拍掉线 / 漏件」:产线节拍(takt time)是刚性的,大 VLA 若单次推理波动到 300ms+(如 GR00T 在 Orin 上 173ms、eager 300ms),就会错过传送带上的目标窗口。工厂宁可用「任务级策略 + 小网」把每个动作压到确定性的几十毫秒,也不要一个平均更快但 p99 不可控的大模型。这是「可靠性 > 平均延迟」的典型。
- 仓储 tote「跑一天热到降频」:AMR 是 7×24 长期运行,散热与能效是第一约束。大 VLA 满血跑会让 SoC 持续高温触发 thermal throttling,反而不如小网稳定。所以仓储 SKU 选 Edge-Lite「能效优先」,不是抠成本,是热预算决定的(对接 05/11 章 TDP)。
- 人形「大模型推理把伺服卡死」:S0 的 1kHz 关节伺服若和 S2 大模型共享同一算力域,一次大推理就可能让伺服 miss deadline,机器人当场跌倒。所以人形必须有独立安全岛跑伺服(需求红线,详见 13 章分域调度),这是 Edge-Pro 而非 Lite 的硬理由。
4. 场景 × 章节 traceability
| 场景需求 | 驱动章节 |
|---|---|
| 多相机同步 | 06 MIPI/PTP;09 dmabuf |
| 力控装配 | 35 控制栈;06 EtherCAT |
| 长时运行散热 | 05/11 TDP SKU |
| 断网工厂 | 24 onboard;31 edge-only |
| 国内 LeRobot | 20/26 manifest |
5. 国内 vs 全球差异(ADR-133)
第三层收敛是地域权重。国内与全球的出货形态、大脑栈、合规红线、生态入口差异极大,直接影响 Model Zoo 该收哪些模型、合规默认什么策略。
| 维度 | 全球 | 国内 |
|---|---|---|
| 出货形态 | 人形+工业试点 | 人形量产(宇树/智元 80%+) |
| 大脑栈 | NVIDIA Thor/自研 | 310P demo;补强中 |
| 数据/合规 | GDPR | PIPL;视频默认本地(28) |
| 生态入口 | Isaac/GR00T | LeRobot + 自研 VLA |
2026-07 出货侧信号(以官方/第三方为准):宇树 Unitree 于 2026-07 科创板 IPO,产能与品牌进一步放大;智元 AgiBot 2025 年出货 5100+ 台(Omdia 口径),是国内出货量领跑者之一;Tesla Optimus 截至 2026-07 仍未量产(roadmap 口径,以官方为准),生态仍全私有。这组信号强化了一个判断:国内的差异化窗口是「量产本体已就位、但大脑栈仍在补强」——芯片侧只要把 310P 的 π0 430ms 追到 <100ms,就有明确的国产替代卖点。
机会:国内 430ms→<100ms 差异化 + 开放 MLIR 栈(01/21)。
6. 结论与 ADR 候选
- ADR-131 场景优先级:基线场景 叠衣/抓取 + 工厂分拣;AMR Lite 第二;家庭/零售 Sim 先行。
- ADR-132 验收模板:每场景绑定 27 章指标子集(manifest
scenario_id)。 - ADR-133 国内/全球权重:Model Zoo 必含 π0/OpenVLA;兼容 UnifoLM-VLA-0;合规默认 local-only。
深入思考
下面三题每题先给题干,再用
<details>折叠一份图文并茂的参考答案。建议先合上答案自己想 3 分钟,再展开对照。三题分别对应本章的三个核心判断:频率摊派、模型选型、SKU 反推。
思考题 1:为何家庭场景「50Hz 动作输出」而 chunk 推理只有 10-13Hz
家庭叠衣用 π0 流匹配,对外宣称 50Hz 动作输出,但你 profiling 发现单次 chunk 推理要 76-100ms(即 10-13Hz)。这两个数字看起来矛盾——如果推理只有 13Hz,机械臂怎么可能 50Hz 更新?结合 §3.1 的 chunk 长度 H 与 21 章的动作 chunk 概念,解释「低频推理如何摊成高频输出」,并算清:chunk H=50、单次推理 延迟 100ms 时,一次推理够撑多久的动作回放?RTC 在其中解决什么问题?
展开参考答案(含 chunk 摊派时序图 + 算一遍)
结论:50Hz 是「动作输出频率」,10-13Hz 是「推理频率」,两者靠 chunk 长度 H 解耦——一次推理吐出 H=50 个动作,机械臂以 50Hz 逐个回放,这 50 个动作能撑 1 秒;只要下一次推理在这 1 秒内完成(76-100ms 绰绰有余),输出就永不断流;RTC 负责在 chunk 边界处无缝拼接,消除「换 chunk」时的停顿。
用具体数字算一遍:
- 动作输出周期:50Hz → 每个动作
1/50 = 20ms输出一次。 - 一次推理产出的动作数:chunk 长度
H = 50个动作。 - 一个 chunk 能撑的时长:
50 个动作 × 20ms/动作 = 1000ms = 1 秒。这就是关键——一次推理虽然慢(100ms),但它一口气产出了够回放整整 1 秒的动作序列。 - 推理必须多快才不断流:只要「下一次推理完成」早于「当前 chunk 回放完」,即推理延迟
100ms < 1000ms,就有 900ms 富余。所以 10-13Hz 的推理频率完全撑得起 50Hz 的输出。 - 对比:若不用 chunk(每步单独推理):要 50Hz 输出就得 50Hz 推理,即每次
≤20ms——而 π0 单次 chunk 就要 76-100ms,根本不可能。chunk 正是把「慢推理」变成「快输出」的杠杆。
RTC 解决什么:朴素做法是「回放完当前 chunk 再开始下一次推理」,但推理那 100ms 里没有新动作产出 → chunk 边界处停顿。RTC(Real-Time Chunking)在当前 chunk 还在回放时 就异 步启动下一次推理,并用 inpainting 让新 chunk 与旧 chunk 在交界处平滑衔接。代价是 runtime 要做 双缓冲 + 并发度 +1(对接 21 章部署模式 E)。回链:这正是 §3.2「家庭叠衣动作发抖」症状的根因——把推理频率误当输出频率,或漏了 RTC 双缓冲,就会看到肉眼可见的顿挫。
思考题 2:仓储/工厂场景为何用「任务级策略 + 小网」而非大 VLA
同样是「抓东西放进箱子」,家庭场景用 π0 这种 3-5B 大 VLA,但仓储 tote 搬运却推荐「任务级策略 + 小网」(§3 表)。既然大 VLA 更「聪明」,为什么不无脑上大模型?结合 §3.2 的工厂/仓储症状 与 21 章的算力画像,从「任务柔性」「节拍/可靠性」「热与能效」三个维度论证选型逻辑。
展开参考答案(含选型判据图 + 对比表)
结论:大 VLA 的价值是「柔性泛化」——应对家庭那种无穷长尾、非结构化的任务;而仓储/工厂是「结构化、重复、强节拍」场景,不需要柔性,却对可靠性、节拍确定性、能效极度敏感。在这类场景,大 VLA 的高柔性用不上,反而它的高延迟波动、高功耗、大内存占用全是负债——所以用确定性更强、更省电的「任务级策略 + 小网」更划算。
三维度对比:
| 维度 | 大 VLA(π0/GR00T-class) | 任务级策略 + 小网 |
|---|---|---|
| 任务柔性 | 强:能泛化到未见过的物体/布局 | 弱:只覆盖预设 SKU/工位,但仓储任务本就固定 |
| 节拍 / 可靠性 | 平均可能更快,但 p99 波动大(Orin 173ms、eager 300ms);错过传送带窗口 → 漏件 | 每动作确定性几十毫秒;p99 可控 → 不漏件 |
| 热 / 能效 | 满血推理持续高功耗 → 7×24 易 thermal throttling | 小网低功耗 → 长期运行温度稳,能效优先 |
| 内存驻留 | INT4 后仍 1.7-3.5GB + KV → 须 ≥8GB 主存 | 几十 M 到百 M 小网,可驻 SRAM |
| 落地 SKU | Edge-Pro | Edge-Lite |
算一遍(节拍视角):设产线 takt time = 一件 500ms。用小网每动作确定性 40ms,一个抓放动作序列(如 8 步)= 8 × 40 = 320ms < 500ms,稳稳赶上节拍且有富余。换大 VLA,平均 chunk 100ms 看似够,但 p99 抖到 300ms 时,单次动作就吃掉大半节拍预算,连续几件累积就会 miss。结论:仓储/工厂选型的第一判据不是「模型多聪明」,而是「p99 是否稳落在节拍预算内」。回链:这正是 §3.2「工厂分拣节拍掉线」与「仓储热到降频」两个症状背后的选型逻辑。