14 多模型/多任务编排洞察
- 章节编号:14
- 所属层:R 运行时层(承接 12 IREE VM、13 实时/QoS、09 MIG、21 双系统 VLA)
- 关联 ADR:ADR-099(多 VM/多 context 编排模型)、ADR-100(GR00T/Gemini 双系统流水线)、ADR-101(RTC 与 chunk 调度)、ADR-102(资源仲裁:QoS/MIG/内存组)
- 上游依赖:09(context/MIG)、11(power profile)、12(IREE VM)、13(QoS/抢占)、21(π0/GR00T/Gemini)
学习目标
- 前置知识:读过 12 章(IREE VM 与 module/HAL stream 概念)、13 章(实时/QoS/抢占/分域调度)、21 章(π0/GR00T/Gemini 双系统模型形态);了解「一个大模型低频、一个小模型高频」的具身双系统直觉即可。无需写过 CUDA stream 或 IREE HAL 代码。
- 学完产出:① 能画出「一个 SoC 上多个模型同时在线」的编排拓扑图,区分 Sequential / Pipelined / Parallel / RTC 双缓冲 / Split 五种模式,并说清各自的中间 tensor 传递路径;② 能给双系统(VLM 低频 + 动作头高频)算一遍分频编排的时间预算——在一个 VLM 周期里塞进几个动作头周期、中间 hidden state 如何复用;③ 能列出多模型并发的显存账(权重 + KV-cache + 激活 + RTC 双缓冲),判断某个内存配置能不能同时驻留几个 context;④ 能把 Helix 的 S2/S1/S0 三频率映射到运行时的三类载体(IREE module / 独立 vmfb / 安全岛),说清为什么 1kHz 那一层不能走通用 NPU 图;⑤ 能对比 TensorRT multi-engine、IREE multi-module、QNN multi-context 三种编排单元的隔离与同步代价。
- 阅读姿势:盯住一条主线——「具身编排的本质,是在同一块内存/算力上,让多个不同频率的模型互不饿死」。VLM 想慢慢想、动作头要拼命跑、伺服环一刻不能停;运行时要做的就是给它们分配算力配额、传递中间张量、并在降频/抢占时决定「谁先被牺牲」。所有 ADR 都在回答这一个问题。
1. 范围与目标
定义端侧 多模型并发、多任务流水线、动态 shape、资源仲裁 的运行时编排。13 章管 OS/RTOS 分域;本章管 NPU/IREE 域内 多 graph/多 VM。
核心问题
- GR00T VLM+DiT、Gemini VLA+ER、Helix S2/S1/S0 如何映射到 runtime?
- Thor MIG 式分区 vs 软件 QoS 如何选型?
- π0 RTC 双缓冲在编排层的语义?
- TOP 方案(TensorRT multi-engine、IREE multi-module、QNN multi-context)对比?
- 感知 CNN + VLA + 小控制网 同时在线 如何仲裁?