跳到主要内容

31 数据与评测闭环洞察

  • 章节编号:31
  • 所属层:X 横向(端→边→中心;承接 24/27/29/30)
  • 关联 ADR:ADR-115(field data 回流架构)、ADR-116(持续评测与模型再编译)、ADR-117(数据治理与隐私)、ADR-118(sim2real 与 Isaac Sim 边界)
  • 上游依赖:23(Fleet)、24(边云)、27(benchmark)、29(telemetry)、30(Agent)

学习目标

  • 前置知识:读过 23(Fleet 分组/canary/OTA)、24(边云 compile farm)、27(benchmark/评测门禁)、29(telemetry)四章的骨架;知道「rollout 成功率(success rate)」是具身模型的核心指标而非 perplexity;对「量化(INT4/FP8)」「蒸馏(distillation)」「sim2real」有基本印象即可。无需数据工程或 MLOps 背景——本章从「闭环反馈回路」而非「数据湖工程」切入。
  • 学完产出:① 能画出 field data 回流的五段闭环——端侧采集 → 边侧缓冲聚合 → 云端评测/再训练/再编译 → OTA 下发 → 端侧生效,并说清每段的隐私默认与触发条件;② 能把「数据飞轮(data flywheel)」为什么能持续提升成功率算一遍——从「部署量 → 失败样本量 → 针对性 fine-tune → 成功率」的正反馈量化推导;③ 能解释 sim2real gap 的三个来源(物理/渲染/传感器),以及它如何决定「sim 评测能信到几分、必须留多少 real 校准」;④ 能说清云端大模型如何通过蒸馏压到端侧 NPU,以及蒸馏在闭环里扮演的角色;⑤ 能读懂本章的 ADR 候选(ADR-115~118),把「数据闭环」翻译成「回流架构 + 评测触发器 + 治理策略 + sim/real 边界」的可执行输入。
  • 阅读姿势:盯住一条主线——「闭环的价值不在采了多少数据,而在『失败 → 修复 → 验证 → 再部署』这条回路转得有多快、多可信」。原始视频、shadow mode、大数据湖都是手段;真正的杠杆是「让一次真机失败,最短路径地变成下一版模型的一次成功」。读表格时不要只看谁采集得多,要问「它的反馈回路闭合了没有、闭合得可信不可信」。

1. 范围与目标

定义 field data 回流 → 评测 → 再训练/再编译 → OTA 的闭环。规模化阶段 到 架构;大规模数据湖 非目标(总纲)。

核心问题

  1. 端侧失败 rollout 什么数据可上云?
  2. 对标 Tesla Fleet Learning、Isaac Sim、LeRobot dataset、VLABench?
  3. 回流如何触发 18 spec 重调 / 19 quant 重校?
  4. 边侧在闭环中的角色?
  5. 云端大模型如何蒸馏压到端侧、并在闭环里持续更新?

2. 需求洞察

场景闭环诉求
工厂部署 1000 台失败模式 聚类 → 针对性 fine-tune
sim2real gapsim 评测 + 少量 real 校准
客户 IP数据 不出厂 选项
QAT/蒸馏(19)小规模 edge 采集 → 云 GPU

原则:默认 edge 缓冲 + 聚合上传;原始视频 opt-in(28/29)。

2.1 闭环诉求反推的能力项(量化)

把上表的「诉求」进一步拆成对回流/评测/部署三段的可执行能力(数量级估算,均以实测为准):

诉求反推能力数量级口径
失败模式聚类端侧须打 失败标签 + embedding;边侧做初步聚类1000 台 × 每台每天 ~50 次 rollout,失败率 5% → 每天 ~2500 条失败样本待聚类
sim2real 校准sim 评测跑批 + real 少量校准集sim 每 nightly 跑 ~1000 episode;real 校准仅需 ~50–100 episode/本体
数据不出厂edge-only SKU;闭环全本地云端仅收 L0 聚合 metadata(每台每天 < 1 MB),不收原始视频
QAT/蒸馏采集端侧采「教师-学生」对齐样本蒸馏一次 ~数千–数万 episode;端侧只贡献 opt-in 子集

要点:闭环的带宽预算几乎全花在「原始视频 opt-in」这一档;只要默认走 L0 聚合遥测,1000 台的日回流量可以压到 GB 级以内——这是「隐私默认 + 边侧缓冲」既保护 IP 又省带宽的根因。


3. 技术现状与趋势(2025–2026)

3.1 TOP 级数据闭环方案深度对比

公司/栈采集存储/治理评测回流部署优势劣势
Tesla Optimus/FSD全车 shadow mode自有 data lake内部 bench整车 OTA规模闭源
NVIDIA Isaac Simsim 数据生成OmniverseGR00T 训练NGC→Thor渲染质量非 field
LeRobot/HFteleop/simHF Dataset社区手动开放无 Fleet
VLABenchsim+realHFleaderboardcheckpoint标准任务偏研究
Physical Intelligence真实机器人内部π0 bench权重发布质量不开放
Figureonboard内部Helixonboard无云依赖
RADARreal async Δt研究真实动态真实小规模
我们(目标)L0 telemetry+opt-in L2边侧 buffer→云27+VLABench23 bundle OTA隐私默认待建

2026 年中信号:LeRobot 已成为国内外 π0/OpenVLA 端侧部署与数据流转的事实入口(dataset schema + Hub 分发);π0.7(2026-04)GR00T N1.7(GA) 均把「sim2real 数据生成 + 真机少量校准」写进官方训练链。整体趋势是:数据飞轮从「大厂私有」走向「开源 schema + 私有 Fleet」两条腿,谁的回路闭合得快、可信,谁就在成功率曲线上领先。roadmap 相关数值 以官方为准

3.1a 闭环模式深度对比

Tesla 式 Fleet Learning

优势劣势我们借鉴
规模+OTA 一体不可复用Fleet 分组+canary(23)
shadow 采集隐私争议仅 L0 默认

Isaac Sim → GR00T(云训边推)

优势劣势我们借鉴
sim 数据规模化不验证 DSA kernel31 sim 数据 + 27 sim eval
与 NGC 一体绑 NVIDIAcompile farm 独立(24)

LeRobot 开源数据飞轮

优势劣势我们借鉴
dataset schema 标准无量产 OTAmanifest/dataset 字段对齐
HF Hub 分发Model Zoo 可选 HF 镜像(26)

Figure Helix onboard 闭环

优势劣势我们借鉴
S0 岛侧、S1 端侧 NPU;云非必需闭源06 岛 + 31 edge-only SKU
200Hz+1kHz 分层难 audit14 Helix 映射

与 14 章映射对齐(修正):此处「S0 岛侧、S1 端侧 NPU」按 14 章约定——S0(1kHz 伺服)落安全岛、S1(200Hz 视觉运动)落端侧 NPU,S2(7–9Hz VLM)走主 SoC。这与 21 章「三系统分级(S2→S1→S0)」的 footprint 分级一致:越靠近实时/安全的层,越往专用/隔离的算力单元下沉。

Physical Intelligence π0 权重发布

优势劣势我们借鉴
开放权重无 Fleet26 Model Zoo manifest
真实数据质量不开放采集L2 opt-in 仅 metadata

3.2 闭环架构(候选)

Robot(field) ──L0 telemetry──► Edge buffer ──aggregate──► Cloud
│ │
opt-in L2 episode ├─► 27 持续评测
│ ├─► 19 QAT(小)
│ ├─► 18 spec 重调(30 Agent)
└─ local-only mode ────────────┴─► 23 OTA signed bundle

用深色图重画这条五段闭环(标出隐私边界与触发点):

逐段读这张图:端侧默认只吐 L0 聚合遥测,原始轨迹 L2 需 opt-in;边侧 buffer 先做缓冲和初步聚类降带宽;云端把回流数据分流给 27 评测(判断有没有退化)、19 QAT/蒸馏(修成功率)、18 spec 重调(修延迟/时序);最后统一打包成 23 signed OTA bundle 下发,回到端侧生效——一整圈闭合,才算一次「数据飞轮」转动

3.3 触发条件(ADR-116)

触发动作
chunk p99 +10% fleet-wide29 归因 → 18 spec PR
task SR -5% on task X31 聚类 → QAT subset
新硬件 stepping07/18 重跑 spec

3.3a 触发到再部署的时延预算(候选)

闭环「转一圈」的总时延决定了飞轮转速。粗算一次「成功率跌 → 修复 → 再部署」的关键路径(数量级,以实测为准):

阶段典型耗时卡点
端→边→云回流聚合小时级(按聚合窗口)带宽 + opt-in 采集量
失败聚类 + QAT 子集构建数小时聚类质量 + 标注
QAT/蒸馏 + 27 回归评测天级(云 GPU)训练算力 + 评测覆盖
23 canary → 全量 OTA天级(灰度节奏)灰度安全窗口

要点:一次完整飞轮从「发现退化」到「全量修复」通常是天到周级;缩短它靠三件事——边侧初筛降回流量、评测集自动回归免人工、canary 灰度可并行。这也是为什么 ADR-116 把「触发器」做成可编程规则,而非人工看板。

3.4 数据治理(ADR-117)

  • 租户隔离:客户数据 独立 bucket
  • retention:L0 90d;L2 30d 默认。
  • on-prem:全闭环 edge-only SKU(23 离线 OTA;36 阶段 2)。

3.5 仿真平台对比(sim2real 专节,v4)

平台物理渲染GR00T/π0 链我们的用法
Isaac Sim/OmniverseGPU 物理照片级GR00T 官方训练sim 数据 + 27 sim eval
MuJoCo/MJX简单π0/DP 研究常用L2 nightly sim
Genesis新;GPU社区上升观察;P2 集成
ISS/cycle-approx无物理不替代 sim编译 CI 门禁(24)

判断(ADR-118):Isaac Sim = 数据/任务评测;ISS = kernel/编译正确性;二者 不可混为同一 Gate

3.5a sim2real gap 的三个来源

sim 里 95% 成功率的策略,搬到真机常掉到 60%——差在哪?把 gap 拆成三层,才知道「哪层用 sim、哪层必须 real」:

三层各自的对策:物理 gap 靠域随机化(domain randomization)——训练时随机化摩擦/质量/接触参数,逼模型学鲁棒策略;视觉 gap 靠照片级渲染 + 真机图像微调;传感 gap 靠在 sim 里注入噪声/时延模型。三层都压下去后仍有残差,这就是为什么 sim 评测必须配 real 校准集——sim 判「相对好坏」,real 判「绝对能不能用」(对应 §3.6 的 sim:real 比例)。

3.6 合成数据比例(候选)

阶段sim : real 目标依据
M3 POC80:20VLABench + 少量 teleop
Pilot50:50工厂 field L2 opt-in
量产客户定on-prem 可能 100% local

3.7 云端大模型 → 端侧 NPU 的蒸馏路径

闭环里最重的一环是「怎么把云上跑得动、端上跑不动的大模型,压到端侧 NPU 还能保成功率」。蒸馏(distillation)是主力手段:

蒸馏维度教师(云)学生(端侧 NPU)闭环里的角色
参数量7B VLA / 大 VLM3–4B VLM + 300M 专家回流失败样本 → 定向蒸馏该场景
步数100 步扩散 / 多步流匹配1–5 步(OneDP/OFP 单步蒸馏)runtime loop 简化,提端侧频率
精度BF16/FP8INT4 + per-channel(QVLA)19 章 QAT 联动,校准精度
模态多路视觉 + 语言 + 世界模型单/双路 RGB + 语言端侧基线简化,P1 扩展

蒸馏在闭环里不是一次性动作:每当 §3.3 触发器报「task X 成功率跌 5%」,就用回流的失败子集定向蒸馏/微调教师在该场景的行为到学生,再走 27 评测 + 23 OTA。这就是「数据飞轮 + 蒸馏」的合流——飞轮提供样本,蒸馏把云端能力持续搬到端侧。相关模型代次(π0.7、GR00T N1.7 GA、OneDP/OFP 单步蒸馏)以官方为准


6. 结论与 ADR

  1. 默认 L0 遥测闭环;L2 field episode opt-in
  2. 边侧缓冲 降带宽;云做 27 评测 + 18/19 迭代
  3. Isaac Sim 互补 非替代 ISS farm(24)。
  4. OTA 23 完成闭环最后一环。
  5. 蒸馏 + 数据飞轮合流:回流失败子集定向蒸馏,持续把云端能力压到端侧 NPU。
  • ADR-115 回流架构:端→边→云;L0 默认;edge buffer。
  • ADR-116 持续评测:fleet 触发 spec/quant 重跑;27 门禁联动;触发器可编程(§3.3a 时延预算为设计输入)。
  • ADR-117 数据治理:租户/retention/on-prem;28 隐私。
  • ADR-118 sim2real:Isaac Sim/VLABench sim 轨;real 校准轨;不混淆 ISS CI;sim2real gap 三来源(§3.5a)决定 real 校准集规模。

深入思考

每题先给题干,再折叠一份图文并茂的参考答案。建议先合上答案自己想 3 分钟,再展开对照。

思考题 1:数据飞轮为何能持续提升成功率

工厂部署了 1000 台机器人,每天大量 rollout 里总有一部分失败。为什么「把失败样本回流 → 针对性 fine-tune → 再部署」这套 数据飞轮(data flywheel) 能让成功率持续爬升,而不是原地打转?结合 §2.1 的回流量估算与 §3.2 闭环架构,把这条正反馈回路算一遍,并说明什么情况下飞轮会「转不动」。

展开参考答案(含数据飞轮正反馈图 + 回流量算一遍)

结论:飞轮能持续提升成功率的根因,是它把「部署规模」直接转化成「失败样本量」——部署越多、越暴露长尾失败,而每次针对性 fine-tune 都在补上一批之前没见过的失败模式;只要「新增修复的失败 > 新引入的退化」,成功率曲线就单调向上。它会转不动,只在两种情况:回流的失败样本不够多/不够有代表性(飞轮缺料),或修复引入的退化盖过了增益(评测门禁没守住)。

用具体数字算一遍(数量级估算,以实测为准):

  1. 1000 台 × 每台每天 ~50 次 rollout = 50000 次/天 的真实执行。
  2. 若当前成功率 90%,则失败 = 50000 × 10% = 5000 条失败/天
  3. 边侧聚类后,假设收敛成 ~20 个高频失败模式(如「透明杯抓取滑脱」「反光桌面视觉误判」)。
  4. 针对 Top-5 失败模式定向蒸馏/fine-tune,假设每个模式修复后该类成功率从 40% 提到 80%,而这 5 类占全部失败的 ~50%(2500 条/天)。
  5. 净效果:整体成功率约从 90% 提到 90% + (2500/50000 × 40%) ≈ 92%。下一轮部署量不变但成功率更高 → 失败样本从 5000 降到 4000,飞轮聚焦到下一批长尾模式,继续爬升。
轮次日失败量修复的失败模式修复后整体成功率
第 1 轮5000Top-5 高频~92%
第 2 轮4000次 5 个模式~93.5%
第 N 轮递减长尾越来越稀逼近饱和(边际递减)

什么时候转不动:① 缺料——若默认只回流 L0 聚合、失败样本没打上可聚类的标签/embedding,云端拿不到「可 fine-tune 的失败子集」,飞轮空转;② 门禁失守——若 27 评测覆盖不全,fine-tune 修了 A 场景却悄悄弄坏了 B 场景(灾难性遗忘),净增益变负,飞轮反转。这正是 §3.2 里「27 持续评测」必须卡在 QAT 与 OTA 之间的原因。

回链:详见 §2.1 回流量反推、§3.2 闭环架构(五段回路)、§3.3 触发条件(task SR -5% → QAT subset),以及 §6 结论 1/2 与 ADR-116。

思考题 2:sim2real gap 如何影响部署

同一个策略在 Isaac Sim 里 95% 成功率,搬到真机常常掉到 60% 上下。结合 §3.5a 的 sim2real gap 三来源与 §3.6 的 sim:real 比例,分析这条 gap 具体从哪来、为什么「纯 sim 评测」不能作为量产验收 Gate,以及「sim 训练 + real 少量校准」这套折衷在部署上如何取舍。

展开参考答案(含 sim2real gap 部署影响图 + 对比表)

结论:sim2real gap 来自物理近似、渲染差异、传感器理想化三层偏差的叠加,它让「sim 上的绝对成功率」不可直接采信;所以 sim 只能作「相对好坏的回归评测」,量产验收必须有 real 校准轨兜底。工程折衷是「sim 管规模、real 管可信」:用海量 sim 数据训练 + 域随机化压 gap,再用少量 real 校准集校准并作为发布 Gate——sim 提供数量,real 提供真实性。

为什么纯 sim 不能作量产 Gate:sim 的 95% 是「在 sim 的物理/渲染/传感假设下」的成功率;真机相机有噪声畸变、接触有滑移形变、传感器有时延丢帧——这三层偏差叠加,让 sim 的绝对数字系统性偏高。若拿 sim 95% 直接放行量产,现场很可能只有 60%,酿成召回。

sim:real 折衷的取舍对比:

策略优点代价适用阶段
纯 sim(0 real)成本极低、可无限扩绝对成功率不可信,量产必翻车仅早期算法原型
纯 real(0 sim)最可信采集慢/贵,长尾场景采不全不现实(数据量不够)
sim 训练 + real 校准(子集)sim 提供规模、real 提供可信;成本可控需维护两套评测轨 + 校准流程量产首选(§3.6)

为什么 real 校准集可以很小:real 不承担「训练规模」,只承担「校准 + 验收」——用 ~50–100 episode/本体 就能标定「sim 分数 → real 分数」的偏移量,并作为发布 Gate 卡住 sim 过于乐观的候选。这正是 §3.6 里 M3 阶段 80:20、Pilot 50:50 逐步加 real 的逻辑:越靠近量产,越要 real 兜底;而 ADR-118 把 Isaac Sim(sim 轨)与 real 校准轨、以及 ISS 编译 CI 三者严格分开,不混为同一个 Gate。

回链:详见 §3.5 仿真平台对比、§3.5a sim2real gap 三来源、§3.6 合成数据比例,以及 §6 ADR-118「sim 轨 + real 校准轨,不混淆 ISS CI」。

思考题 3:蒸馏如何把云大模型压到端侧

云上跑得动的 7B VLA / 大 VLM,端侧 NPU 内存/算力都吃不下。结合 §3.7 的蒸馏路径表与 §3.2 闭环架构,分析蒸馏(distillation)在「参数量、步数、精度、模态」四个维度上分别怎么压,以及为什么蒸馏在数据闭环里不是「一次成型」而是「随飞轮持续进行」。

展开参考答案(含蒸馏四维压缩图 + 算一遍)

结论:蒸馏是让一个大「教师」模型教一个小「学生」模型模仿其输出,从而在四个维度同时压缩——参数量(7B → 3–4B+专家)、步数(100 步扩散 → 1–5 步)、精度(BF16 → INT4)、模态(多路 → 单双路 RGB);它在闭环里不是一次成型,因为每次飞轮回流的失败子集,都揭示了学生在某个新场景上「没学到位」,于是用教师在该场景的行为定向再蒸馏,把云端能力持续搬到端侧 NPU。

用具体数字算一遍(数量级估算,以官方/实测为准):

  1. 参数量:教师 7B(BF16 ≈ 14 GB)→ 学生蒸成 3–4B VLM + 300M 专家,INT4 后 ≈ 1.7–2 GB——直接从「装不下」变成「可驻端侧主存」。
  2. 步数:教师 100 步扩散,单次动作生成慢;OneDP/OFP 把动作头蒸成 1 步(单次前向),吞吐从 ~1.5Hz 拉到 数十 Hz 级(§21 章 §3.5),runtime loop 从「多步循环」简化成「一次前向」。
  3. 精度:BF16 → INT4 + per-channel,配合 19 章 QAT 校准,权重体积 ÷4,推理带宽压力骤降(§21「带宽 > 峰值算力」)。
  4. 模态:多路视觉 + 世界模型 → 端侧基线只留单/双路 RGB + 语言,砍掉端侧跑不起的重模态(§21 §3.7)。

为什么是「持续」而非「一次成型」:第一次蒸馏只能覆盖训练时见过的分布;部署后,飞轮回流的失败样本(思考题 1)会不断暴露学生在长尾场景「没学到位」——比如「透明物体抓取」教师会、学生不会。这时用教师在该场景的输出作监督信号,定向再蒸馏/微调学生,再走 27 评测 + 23 OTA。于是蒸馏和数据飞轮合流成一条持续回路:飞轮找出学生的短板,蒸馏把教师的能力补进去——这正是 §6 结论 5「蒸馏 + 数据飞轮合流」的含义。

回链:详见 §3.7 蒸馏路径表(四维)、§3.2 闭环架构(19 QAT/蒸馏节点)、§3.3 触发条件(task SR -5% → 定向蒸馏),以及 §6 结论 5 与 ADR-116。


附:信息来源

区分公开/估计;参考时间 2026-06。

  • Tesla OTA;Isaac Sim;LeRobot;VLABench;RADAR。[公开]
  • LeRobot(HuggingFace) dataset schema + Hub 分发,国内外 π0/OpenVLA 端侧部署事实入口:github.com/huggingface/lerobot。[公开]
  • π0/π0.5/π0.7(2026-04) 训练链含 sim2real 数据生成 + 真机校准:Physical Intelligence;pi.website。[公开,代次以官方为准]
  • GR00T N1.7(GA) + Isaac Sim 官方训练/评测链:NVIDIA Isaac docs 2025–2026。[公开,版本以官方为准]
  • OneDP / OFP 单步蒸馏:见 19/21 章来源;倍数与频率以官方为准。[公开]
  • 23/24/27/29 章。[内部]
  • 数据飞轮回流量/蒸馏压缩/闭环时延:基于公开部署规模的工程估算。[估计]