31 数据与评测闭环洞察
- 章节编号:31
- 所属层:X 横向(端→边→中心;承接 24/27/29/30)
- 关联 ADR:ADR-115(field data 回流架构)、ADR-116(持续评测与模型再编译)、ADR-117(数据治理与隐私)、ADR-118(sim2real 与 Isaac Sim 边界)
- 上游依赖:23(Fleet)、24(边云)、27(benchmark)、29(telemetry)、30(Agent)
学习目标
- 前置知识:读过 23(Fleet 分组/canary/OTA)、24(边云 compile farm)、27(benchmark/评测门禁)、29(telemetry)四章的骨架;知道「rollout 成功率(success rate)」是具身模型的核心指标而非 perplexity;对「量化(INT4/FP8)」「蒸馏(distillation)」「sim2real」有基本印象即可。无需数据工程或 MLOps 背景——本章从「闭环反馈回路」而非「数据湖工程」切入。
- 学完产出:① 能画出 field data 回流的五段闭环——端侧采集 → 边侧缓冲聚合 → 云端评测/再训练/再编译 → OTA 下发 → 端侧生效,并说清每段的隐私默认与触发条件;② 能把「数据飞轮(data flywheel)」为什么能持续提升成功率算一遍——从「部署量 → 失败样本量 → 针对性 fine-tune → 成功率」的正反馈量化推导;③ 能解释 sim2real gap 的三个来源(物理/渲染/传感器),以及它如何决定「sim 评测能信到几分、必须留多少 real 校准」;④ 能说清云端大模型如何通过蒸馏压到端侧 NPU,以及蒸馏在闭环里扮演的角色;⑤ 能读懂本章的 ADR 候选(ADR-115~118),把「数据闭环」翻译成「回流架构 + 评测触发器 + 治理策略 + sim/real 边界」的可执行输入。
- 阅读姿势:盯住一条主线——「闭环的价值不在采了多少数据,而在『失败 → 修复 → 验证 → 再部署』这条回路转得有多快、多可信」。原始视频、shadow mode、大数据湖都是手段;真正的杠杆是「让一次真机失败,最短路径地变成下一版模型的一次成功」。读表格时不要只看谁采集得多,要问「它的反馈回路闭合了没有、闭合得可信不可信」。
1. 范围与目标
定义 field data 回流 → 评测 → 再训练/再编译 → OTA 的闭环。规模化阶段 到 架构;大规模数据湖 非目标(总纲)。
核心问题
- 端侧失败 rollout 什么数据可上云?
- 对标 Tesla Fleet Learning、Isaac Sim、LeRobot dataset、VLABench?
- 回流如何触发 18 spec 重调 / 19 quant 重校?
- 边侧在闭环中的角色?
- 云端大模型如何蒸馏压到端侧、并在闭环里持续更新?
2. 需求洞察
| 场景 | 闭环诉求 |
|---|---|
| 工厂部署 1000 台 | 失败模式 聚类 → 针对性 fine-tune |
| sim2real gap | sim 评测 + 少量 real 校准 |
| 客户 IP | 数据 不出厂 选项 |
| QAT/蒸馏(19) | 小规模 edge 采集 → 云 GPU |
原则:默认 edge 缓冲 + 聚合上传;原始视频 opt-in(28/29)。
2.1 闭环诉求反推的能力项(量化)
把上表的「诉求」进一步拆成对回流/评测/部署三段的可执行能力(数量级估算,均以实测为准):
| 诉求 | 反推能力 | 数量级口径 |
|---|---|---|
| 失败模式聚类 | 端侧须打 失败标签 + embedding;边侧做初步聚类 | 1000 台 × 每台每天 ~50 次 rollout,失败率 5% → 每天 ~2500 条失败样本待聚类 |
| sim2real 校准 | sim 评测跑批 + real 少量校准集 | sim 每 nightly 跑 ~1000 episode;real 校准仅需 ~50–100 episode/本体 |
| 数据不出厂 | edge-only SKU;闭环全本地 | 云端仅收 L0 聚合 metadata(每台每天 < 1 MB),不收原始视频 |
| QAT/蒸馏采集 | 端侧采「教师-学生」对齐样本 | 蒸馏一次 ~数千–数万 episode;端侧只贡献 opt-in 子集 |
要点:闭环的带宽预算几乎全花在「原始视频 opt-in」这一档;只要默认走 L0 聚合遥测,1000 台的日回流量可以压到 GB 级以内——这是「隐私默认 + 边侧缓冲」既保护 IP 又省带宽的根因。
3. 技术现状与趋势(2025–2026)
3.1 TOP 级数据闭环方案深度对比
| 公司/栈 | 采集 | 存储/治理 | 评测 | 回流部署 | 优势 | 劣势 |
|---|---|---|---|---|---|---|
| Tesla Optimus/FSD | 全车 shadow mode | 自有 data lake | 内部 bench | 整车 OTA | 规模 | 闭源 |
| NVIDIA Isaac Sim | sim 数据生成 | Omniverse | GR00T 训练 | NGC→Thor | 渲染质量 | 非 field |
| LeRobot/HF | teleop/sim | HF Dataset | 社区 | 手动 | 开放 | 无 Fleet |
| VLABench | sim+real | HF | leaderboard | checkpoint | 标准任务 | 偏研究 |
| Physical Intelligence | 真实机器人 | 内部 | π0 bench | 权重发布 | 质量 | 不开放 |
| Figure | onboard | 内部 | Helix | onboard | 无云依赖 | — |
| RADAR | real async Δt | 研究 | 真实动态 | — | 真实 | 小规模 |
| 我们(目标) | L0 telemetry+opt-in L2 | 边侧 buffer→云 | 27+VLABench | 23 bundle OTA | 隐私默认 | 待建 |
2026 年中信号:LeRobot 已成为国内外 π0/OpenVLA 端侧部署与数据流转的事实入口(dataset schema + Hub 分发);π0.7(2026-04) 与 GR00T N1.7(GA) 均把「sim2real 数据生成 + 真机少量校准」写进官方训练链。整体趋势是:数据飞轮从「大厂私有」走向「开源 schema + 私有 Fleet」两条腿,谁的回路闭合得快、可信,谁就在成功率曲线上领先。roadmap 相关数值 以官方为准。
3.1a 闭环模式深度对比
Tesla 式 Fleet Learning
| 优势 | 劣势 | 我们借鉴 |
|---|---|---|
| 规模+OTA 一体 | 不可复用 | Fleet 分组+canary(23) |
| shadow 采集 | 隐私争议 | 仅 L0 默认 |
Isaac Sim → GR00T(云训边推)
| 优势 | 劣势 | 我们借鉴 |
|---|---|---|
| sim 数据规模化 | 不验证 DSA kernel | 31 sim 数据 + 27 sim eval |
| 与 NGC 一体 | 绑 NVIDIA | compile farm 独立(24) |
LeRobot 开源数据飞轮
| 优势 | 劣势 | 我们借鉴 |
|---|---|---|
| dataset schema 标准 | 无量产 OTA | manifest/dataset 字段对齐 |
| HF Hub 分发 | — | Model Zoo 可选 HF 镜像(26) |
Figure Helix onboard 闭环
| 优势 | 劣势 | 我们借鉴 |
|---|---|---|
| S0 岛侧、S1 端侧 NPU;云非必需 | 闭源 | 06 岛 + 31 edge-only SKU |
| 200Hz+1kHz 分层 | 难 audit | 14 Helix 映射 |
与 14 章映射对齐(修正):此处「S0 岛侧、S1 端侧 NPU」按 14 章约定——S0(1kHz 伺服)落安全岛、S1(200Hz 视觉运动)落端侧 NPU,S2(7–9Hz VLM)走主 SoC。这与 21 章「三系统分级(S2→S1→S0)」的 footprint 分级一致:越靠近实时/安全的层,越往专用/隔离的算力单元下沉。
Physical Intelligence π0 权重发布
| 优势 | 劣势 | 我们借鉴 |
|---|---|---|
| 开放权重 | 无 Fleet | 26 Model Zoo manifest |
| 真实数据质量 | 不开放采集 | L2 opt-in 仅 metadata |
3.2 闭环架构(候选)
Robot(field) ──L0 telemetry──► Edge buffer ──aggregate──► Cloud
│ │
opt-in L2 episode ├─► 27 持续评测
│ ├─► 19 QAT(小)
│ ├─► 18 spec 重调(30 Agent)
└─ local-only mode ────────────┴─► 23 OTA signed bundle
用深色图重画这条五段闭环(标出隐私边界与触发点):
逐段读这张图:端侧默认只吐 L0 聚合遥测,原始轨迹 L2 需 opt-in;边侧 buffer 先做缓冲和初步聚类降带宽;云端把回流数据分流给 27 评测(判断有没有退化)、19 QAT/蒸馏(修成功率)、18 spec 重调(修延迟/时序);最后统一打包成 23 signed OTA bundle 下发,回到端侧生效——一整圈闭合,才算一次「数据飞轮」转动。
3.3 触发条件(ADR-116)
| 触发 | 动作 |
|---|---|
| chunk p99 +10% fleet-wide | 29 归因 → 18 spec PR |
| task SR -5% on task X | 31 聚类 → QAT subset |
| 新硬件 stepping | 07/18 重跑 spec |