27 任务级评测与 Benchmark 洞察
- 章节编号:27
- 所属层:A 应用与领域层 + 横向能力(验收 21/18/11;喂 31 闭环)
- 关联 ADR:ADR-107(具身评测指标体系)、ADR-108(标准 benchmark 集与回归)、ADR-109(硬件对比方法论:ms/Hz/TOPS/W)、ADR-110(CI 门禁与公开靶标)
- 上游依赖:01(指标)、11(能效)、18(autotune)、21(模型)、26(Model Zoo)
学习目标
- 前置知识:读过 21 章(具身模型支持,尤其三大部署形态与 chunk 延迟口径)与 01 章(负载/指标画像);知道「rollout(策略回放)」「chunk(动作块)」「effective Hz(有效控制频率)」是什么;对「p50/p99 延迟」「manifest(模型清单)」有基本概念。无需机器人学背景——本章从「评测口径」而非「运动学」切入。
- 学完产出:① 能说清「为什么具身评测的第一指标是 rollout 成功率(success rate)而非 perplexity(困惑度)」,把「训练损失低 ≠ 机器人能干活」这条鸿沟讲透;② 能对照 §2.1 指标分层表,把「任务 / 控制 / 推理 / 能效 / 算子」五层指标各自的工具与门禁说清楚,理解为什么禁止只报 TOPS;③ 能解释「同 manifest 同任务对比」为什么是硬件横评公平性的地基,并亲手算一遍「跨模型 / 跨精度混测」会把结论扭曲到什么程度;④ 能读懂 §3.1 benchmark 横评表,区分 LIBERO / SimplerEnv(仿真)、VLABench(long-horizon 仿真)、RADAR / RoboArena(真机)各自评什么、饱和到什么程度,理解「饱和后要看鲁棒性变体」的逻辑;⑤ 能把 ADR-107~110 翻译成「CI 门禁字段 + 对标表维护规则」的可执行输入。
- 阅读姿势:盯住一条主线——「具身评测的所有争议,本质都是『你到底在测什么』的口径之争」。一个 92ms 的延迟数字,不说清「什么模型、什么精度、什么 manifest、几路相机、baseline 还是 optimized」,就是一个无法对比、无法复现、无法进 CI 的孤立数字。读表格时不要只看数字大小,要先问「这两个数字是不是在同一把尺子下量出来的」。
1. 范围与目标
定义 具身任务级 精度/成功率/延迟/能效的 benchmark 体系——非仅 kernel GFLOPS。
核心问题
- 评 rollout 成功率 还是 chunk ms 还是 Hz?
- 对标 VLABench、RADAR、VLA-Perf、FlashRT、Isaac GR00T?
- 公开靶标(Thor 92ms)如何纳入 CI?
- 国产 310P 430ms 如何表达差异化?
为什么「任务级」是必须的:kernel 级 benchmark(GFLOPS、算子 ms)回答的是「芯片理论快不快」,而具身产品交付的是「机器人能不能把衣服叠好」。这两者之间隔着一 整条推理流水、一整套控制回路、一整个真实世界的物理不确定性。一颗芯片可以在 GEMM(通用矩阵乘)micro-benchmark 上跑出漂亮的 TOPS,却因为动态 shape(形状)算子没覆盖、KV-cache(键值缓存)管理低效、chunk 双缓冲没做,导致端到端 rollout 成功率惨不忍睹。任务级评测的存在意义,就是把「芯片指标」和「产品价值」之间的鸿沟量化出来、纳入门禁。
2. 需求洞察
2.1 指标分层(ADR-107)
| 层级 | 指标 | 工具 |
|---|---|---|
| 任务 | success rate @ N trials | sim/real |
| 控制 | effective Hz;RTC overlap | runtime |
| 推理 | chunk p50/p99 ms | profiler |
| 能效 | J/chunk;TOPS/W | 11+power |
| 算子 | op ms;roofline | 18/ISS |
基线门禁(M3):π0 子集 chunk p99 ≤100ms;≥10Hz effective @ sustained TDP。
2.2 五层指标的因果链:从算子到任务
指标分层不是随意划的五格,而是一条自底向上的因果链:底层算子快 → 单次推理 chunk 延迟低 → 有效控制频率高 → 机器人动作连贯 → 任务成功率高。任何一层塌了,上层就被卡死。下图把这条链和「常见塌方点」画在一起:
为什么禁止「只报 TOPS」:TOPS 只是算子层的一个峰值理论值,它既不保证 chunk 延迟低(可能被访存墙卡住),也不保证有效频率高(可能被 p99 长尾拖垮),更不保证任务成功(可能算子覆盖不全跑不起来)。一颗标称 700 TOPS 的芯片,若在真实 π0 部署上跑出 300ms/chunk,对机器人产品毫无意义——这正是 §2.1 把指标拆成五层、并规定「任务/控制/推理」三层为对外可信口径的根因。
3. 技术现状与趋势(2025–2026)
3.1 TOP 级 VLA Benchmark/评测工具深度对比
| 名称 | 机构 | 评什么 | 硬件维度 | 具身 | 优势 | 劣势 |
|---|---|---|---|---|---|---|
| VLA-Perf | 待核/社区 2026 | E2E latency 建模 | Thor/4090/H100/网络 | π0 7 实验 | deployment scenario | 建模非实测;repo 名待核 |
| FlashRT | 社区 2026 | 实测 ms/Hz | Thor/5090/Orin | π0/GR00T | 公开表格 | 绑 CUDA 栈;待核 |
| VLABench | OpenMOSS ICCV 2025 | long-horizon SR | sim+real | π0/OpenVLA | 任务丰富 | 偏 sim |
| RADAR | arXiv 2026(待核) | real-world + 异步延迟 Δt | Franka real | π0/π0.5/OpenVLA | 真实动态 | 成本高 |
| LeRobot eval | HF | episode logging | 用户 GPU | π0 | 易用 | 无标准 Hz |
| Isaac GR00T bench | NVIDIA | 92ms Thor | Thor | GR00T | 量产靶标 | 闭源 |
| KernelBench | Stanford | GPU kernel | GPU | 非 VLA | 算子 | 非具身 |
| 我们 dsa-bench | 内部 | chunk+Hz+W+SR | ISS→硅 | manifest 驱动 | 全栈 | 待建 |
| ActionFlow | 研究 2025(待核) | OpenVLA FPS 2.55× | 边缘 | 系统调度 | 无重训 | 非 VLA 专用 bench |
| DeeR-VLA | 研究 | 动态推理 | — | token 稀疏 | 能效 | 研究阶段 |
可疑名核对提醒:表中 VLA-Perf / NVlabs/vla-perf 的仓库归属与命名 待核——2026-07 未见稳定权威一手来源确认其为 NVIDIA 官方(NVlabs)项目,暂标「待核/社区」;FlashRT、RADAR、ActionFlow 的机构/编号同样以社区流传为主,数值引用时须 回溯一手仓库/论文。凡标「待核」者,进对标表前必须先核实来源真实性,避免把社区传闻当量产靶标。
3.1-sim 仿真 benchmark:LIBERO / SimplerEnv 与「饱和后看鲁棒性」
仿真 benchmark 是任务级评测的入门台阶——便宜、可复现、不需要真机。但到 2026-07,主流仿真集正集体面临「饱和(saturation)」问题:头部模型分数逼近上限,区分度消失。
| 仿真 benchmark | 评什么 | 2026-07 状态 | 鲁棒性变体 / 应对 |
|---|---|---|---|
| LIBERO | 桌面操作 long-horizon;4 套件(Spatial/Object/Goal/Long) | 已饱和——头部 VLA 平均成功率高位,区分度下降 | LIBERO-PRO / LIBERO-Plus(社区鲁棒变体,待核):加入光照/纹理/干扰物/初始位姿扰动,测泛化而非记忆 |
| SimplerEnv | 真机策略在仿真中的可复现评测;桥接 sim2real | 广泛用于 π0/OpenVLA 对比;视觉匹配(visual matching)与变体聚合(variant aggregation)两档 | 保留「变体聚合」档专测背景/干扰鲁棒性 |
| VLABench | long-horizon、组合任务、常识推理 | ICCV 2025;任务丰富、饱和度低 | 本身即偏难,作为「未饱和」补充 |
| RoboArena | 分布式真机众测 / 相对排名(待核) | 2026 新兴;用相对偏好而非绝对 SR | 真机、跨机构、抗刷分 |
判断:仿真 benchmark 在 M3 阶段作为便宜的回归信号(每 nightly 跑)是划算的,但一旦某个集饱和,绝对分数就失去营销价值——此时要么切到鲁棒性变体(LIBERO-PRO/Plus),要么承认「仿真只证下限、真机才证价值」,把对外 claim 收缩到 RADAR/RoboArena 这类真机口径。别拿一个饱和 benchmark 的高分当差异化卖点。
3.1a 公开延迟靶标汇总(2026-06,公开来源)
| 模型 | 硬件 | 延迟 | 频率 | 来源 |
|---|---|---|---|---|
| GR00T N1.5 E2E | Jetson Thor TRT | 92ms | 10.9Hz | NVIDIA Isaac |
| GR00T DiT | Thor TRT | 49ms/4步 | — | 21 章 |
| π0.5 | RTX 4090 | ~76ms | ~13Hz | Physical Intelligence |
| π0.5 | Jetson Thor(FlashRT) | 44ms | 23Hz | FlashRT 2026(待核) |
| π0 | Thor(FlashRT) | 46ms | 22Hz | FlashRT(待核) |
| GR00T N1.6 | Thor(FlashRT) | 45ms | 22Hz | FlashRT(待核) |
| π0 | 昇腾 310P FP16 | ~430ms | ~2.3Hz | 华为 demo |
| OpenVLA 7B 4bit | A5000 | ~333ms | ~3Hz | 21 章 |
| π0 openpi naive | Thor | 714ms | 1.4Hz | openpi JAX |
判断:Thor 上 优化栈差 10×+;我们的 benchmark 须分 baseline vs optimized 两栏。
同表混测的陷阱:这张表里的数字跨了不同模型(π0 vs GR00T vs OpenVLA)、不同精度(FP16 vs INT4 vs nvfp4/fp8)、不同硬件(Thor vs 4090 vs 310P vs A5000)、不同栈成熟度(naive vs FlashRT 优化)——它只能用来「感知量级」,绝不能直接跨行相减得出「A 芯片比 B 芯片快多少」的结论。例如把「π0 @ FP16 on 310P 430ms」与「GR00T @ nvfp4/fp8 on Thor 92ms」相除得出「4.7×」,严格说是「非同模型同任务」的对比(见 §3.1c 与 ADR-109),对外只能标注为「不同模型、不同精度的量级参考」。
3.1b 评测方法论对比
| 方法 | 优势 | 劣势 | 我们 |
|---|---|---|---|
| 仅 sim SR | 便宜 | sim2real gap | VLABench/LIBERO 子集 |
| 仅 kernel time | 精确 | 不代表 rollout | ISS 辅助 |
| E2E chunk ms | 接近量产 | 需硬件 | CI 主指标 |
| effective Hz(RTC) | 反映控制 | 难测 | runtime 计数 |
| ms/W | 能效 | 需 power 仪 | 11+27 联合 |