跳到主要内容

27 任务级评测与 Benchmark 洞察

  • 章节编号:27
  • 所属层:A 应用与领域层 + 横向能力(验收 21/18/11;喂 31 闭环)
  • 关联 ADR:ADR-107(具身评测指标体系)、ADR-108(标准 benchmark 集与回归)、ADR-109(硬件对比方法论:ms/Hz/TOPS/W)、ADR-110(CI 门禁与公开靶标)
  • 上游依赖:01(指标)、11(能效)、18(autotune)、21(模型)、26(Model Zoo)

学习目标

  • 前置知识:读过 21 章(具身模型支持,尤其三大部署形态与 chunk 延迟口径)与 01 章(负载/指标画像);知道「rollout(策略回放)」「chunk(动作块)」「effective Hz(有效控制频率)」是什么;对「p50/p99 延迟」「manifest(模型清单)」有基本概念。无需机器人学背景——本章从「评测口径」而非「运动学」切入。
  • 学完产出:① 能说清「为什么具身评测的第一指标是 rollout 成功率(success rate)而非 perplexity(困惑度)」,把「训练损失低 ≠ 机器人能干活」这条鸿沟讲透;② 能对照 §2.1 指标分层表,把「任务 / 控制 / 推理 / 能效 / 算子」五层指标各自的工具与门禁说清楚,理解为什么禁止只报 TOPS;③ 能解释「同 manifest 同任务对比」为什么是硬件横评公平性的地基,并亲手算一遍「跨模型 / 跨精度混测」会把结论扭曲到什么程度;④ 能读懂 §3.1 benchmark 横评表,区分 LIBERO / SimplerEnv(仿真)、VLABench(long-horizon 仿真)、RADAR / RoboArena(真机)各自评什么、饱和到什么程度,理解「饱和后要看鲁棒性变体」的逻辑;⑤ 能把 ADR-107~110 翻译成「CI 门禁字段 + 对标表维护规则」的可执行输入。
  • 阅读姿势:盯住一条主线——「具身评测的所有争议,本质都是『你到底在测什么』的口径之争」。一个 92ms 的延迟数字,不说清「什么模型、什么精度、什么 manifest、几路相机、baseline 还是 optimized」,就是一个无法对比、无法复现、无法进 CI 的孤立数字。读表格时不要只看数字大小,要先问「这两个数字是不是在同一把尺子下量出来的」。

1. 范围与目标

定义 具身任务级 精度/成功率/延迟/能效的 benchmark 体系——非仅 kernel GFLOPS。

核心问题

  1. rollout 成功率 还是 chunk ms 还是 Hz?
  2. 对标 VLABench、RADAR、VLA-Perf、FlashRT、Isaac GR00T?
  3. 公开靶标(Thor 92ms)如何纳入 CI?
  4. 国产 310P 430ms 如何表达差异化?

为什么「任务级」是必须的:kernel 级 benchmark(GFLOPS、算子 ms)回答的是「芯片理论快不快」,而具身产品交付的是「机器人能不能把衣服叠好」。这两者之间隔着一整条推理流水、一整套控制回路、一整个真实世界的物理不确定性。一颗芯片可以在 GEMM(通用矩阵乘)micro-benchmark 上跑出漂亮的 TOPS,却因为动态 shape(形状)算子没覆盖、KV-cache(键值缓存)管理低效、chunk 双缓冲没做,导致端到端 rollout 成功率惨不忍睹。任务级评测的存在意义,就是把「芯片指标」和「产品价值」之间的鸿沟量化出来、纳入门禁。


2. 需求洞察

2.1 指标分层(ADR-107)

层级指标工具
任务success rate @ N trialssim/real
控制effective Hz;RTC overlapruntime
推理chunk p50/p99 msprofiler
能效J/chunk;TOPS/W11+power
算子op ms;roofline18/ISS

基线门禁(M3):π0 子集 chunk p99 ≤100ms;≥10Hz effective @ sustained TDP。

2.2 五层指标的因果链:从算子到任务

指标分层不是随意划的五格,而是一条自底向上的因果链:底层算子快 → 单次推理 chunk 延迟低 → 有效控制频率高 → 机器人动作连贯 → 任务成功率高。任何一层塌了,上层就被卡死。下图把这条链和「常见塌方点」画在一起:

为什么禁止「只报 TOPS」:TOPS 只是算子层的一个峰值理论值,它既不保证 chunk 延迟低(可能被访存墙卡住),也不保证有效频率高(可能被 p99 长尾拖垮),更不保证任务成功(可能算子覆盖不全跑不起来)。一颗标称 700 TOPS 的芯片,若在真实 π0 部署上跑出 300ms/chunk,对机器人产品毫无意义——这正是 §2.1 把指标拆成五层、并规定「任务/控制/推理」三层为对外可信口径的根因。


3. 技术现状与趋势(2025–2026)

3.1 TOP 级 VLA Benchmark/评测工具深度对比

名称机构评什么硬件维度具身优势劣势
VLA-Perf待核/社区 2026E2E latency 建模Thor/4090/H100/网络π0 7 实验deployment scenario建模非实测;repo 名待核
FlashRT社区 2026实测 ms/HzThor/5090/Orinπ0/GR00T公开表格绑 CUDA 栈;待核
VLABenchOpenMOSS ICCV 2025long-horizon SRsim+realπ0/OpenVLA任务丰富偏 sim
RADARarXiv 2026(待核)real-world + 异步延迟 ΔtFranka realπ0/π0.5/OpenVLA真实动态成本高
LeRobot evalHFepisode logging用户 GPUπ0易用无标准 Hz
Isaac GR00T benchNVIDIA92ms ThorThorGR00T量产靶标闭源
KernelBenchStanfordGPU kernelGPU非 VLA算子非具身
我们 dsa-bench内部chunk+Hz+W+SRISS→硅manifest 驱动全栈待建
ActionFlow研究 2025(待核)OpenVLA FPS 2.55×边缘系统调度无重训非 VLA 专用 bench
DeeR-VLA研究动态推理token 稀疏能效研究阶段

可疑名核对提醒:表中 VLA-Perf / NVlabs/vla-perf 的仓库归属与命名 待核——2026-07 未见稳定权威一手来源确认其为 NVIDIA 官方(NVlabs)项目,暂标「待核/社区」;FlashRTRADARActionFlow 的机构/编号同样以社区流传为主,数值引用时须回溯一手仓库/论文。凡标「待核」者,进对标表前必须先核实来源真实性,避免把社区传闻当量产靶标。

3.1-sim 仿真 benchmark:LIBERO / SimplerEnv 与「饱和后看鲁棒性」

仿真 benchmark 是任务级评测的入门台阶——便宜、可复现、不需要真机。但到 2026-07,主流仿真集正集体面临「饱和(saturation)」问题:头部模型分数逼近上限,区分度消失。

仿真 benchmark评什么2026-07 状态鲁棒性变体 / 应对
LIBERO桌面操作 long-horizon;4 套件(Spatial/Object/Goal/Long)已饱和——头部 VLA 平均成功率高位,区分度下降LIBERO-PRO / LIBERO-Plus(社区鲁棒变体,待核):加入光照/纹理/干扰物/初始位姿扰动,测泛化而非记忆
SimplerEnv真机策略在仿真中的可复现评测;桥接 sim2real广泛用于 π0/OpenVLA 对比;视觉匹配(visual matching)与变体聚合(variant aggregation)两档保留「变体聚合」档专测背景/干扰鲁棒性
VLABenchlong-horizon、组合任务、常识推理ICCV 2025;任务丰富、饱和度低本身即偏难,作为「未饱和」补充
RoboArena分布式真机众测 / 相对排名(待核)2026 新兴;用相对偏好而非绝对 SR真机、跨机构、抗刷分

判断:仿真 benchmark 在 M3 阶段作为便宜的回归信号(每 nightly 跑)是划算的,但一旦某个集饱和,绝对分数就失去营销价值——此时要么切到鲁棒性变体(LIBERO-PRO/Plus),要么承认「仿真只证下限、真机才证价值」,把对外 claim 收缩到 RADAR/RoboArena 这类真机口径。别拿一个饱和 benchmark 的高分当差异化卖点。

3.1a 公开延迟靶标汇总(2026-06,公开来源)

模型硬件延迟频率来源
GR00T N1.5 E2EJetson Thor TRT92ms10.9HzNVIDIA Isaac
GR00T DiTThor TRT49ms/4步21 章
π0.5RTX 4090~76ms~13HzPhysical Intelligence
π0.5Jetson Thor(FlashRT)44ms23HzFlashRT 2026(待核)
π0Thor(FlashRT)46ms22HzFlashRT(待核)
GR00T N1.6Thor(FlashRT)45ms22HzFlashRT(待核)
π0昇腾 310P FP16~430ms~2.3Hz华为 demo
OpenVLA 7B 4bitA5000~333ms~3Hz21 章
π0 openpi naiveThor714ms1.4Hzopenpi JAX

判断:Thor优化栈差 10×+;我们的 benchmark 须分 baseline vs optimized 两栏。

同表混测的陷阱:这张表里的数字跨了不同模型(π0 vs GR00T vs OpenVLA)、不同精度(FP16 vs INT4 vs nvfp4/fp8)、不同硬件(Thor vs 4090 vs 310P vs A5000)、不同栈成熟度(naive vs FlashRT 优化)——它只能用来「感知量级」,绝不能直接跨行相减得出「A 芯片比 B 芯片快多少」的结论。例如把「π0 @ FP16 on 310P 430ms」与「GR00T @ nvfp4/fp8 on Thor 92ms」相除得出「4.7×」,严格说是「非同模型同任务」的对比(见 §3.1c 与 ADR-109),对外只能标注为「不同模型、不同精度的量级参考」。

3.1b 评测方法论对比

方法优势劣势我们
仅 sim SR便宜sim2real gapVLABench/LIBERO 子集
仅 kernel time精确不代表 rolloutISS 辅助
E2E chunk ms接近量产需硬件CI 主指标
effective Hz(RTC)反映控制难测runtime 计数
ms/W能效需 power 仪11+27 联合

3.1c 对标表维护规则(ADR-110)

  • 每季度更新 FlashRT/VLA-Perf/GR00T 公开数(来源待核者标注)。
  • 报告须含:manifest hash、power_profile、flow_steps、camera count
  • 对外 marketing 仅 L3 real robotL2 sim 标注清楚。
  • 跨模型/跨精度对比(如 π0 FP16 vs GR00T fp8)一律标注 「非同模型同任务」,禁止直接相除得倍数当差异化 claim。

3.1d 一份可复现报告必须携带的字段

评测数字的可信度,不在数字本身,而在它携带的元数据。同一个「chunk 92ms」,在不同 manifest、不同相机路数、不同 flow_steps(流匹配去噪步数)下含义完全不同。ADR-110 规定每条 benchmark 记录必须绑定下列字段,否则不入库:

字段含义为什么必须
manifest_hash模型清单(结构/权重/量化)哈希保证「同模型同任务」可复现;跨芯片对比的地基
precisionFP16 / BF16 / INT4 / nvfp4+fp8 混合精度不同 → 延迟/精度不可比;区分「非同模型同任务」
flow_steps流匹配 / 扩散去噪步数5 步 vs 4 步直接改变 chunk 延迟量级
camera_count输入相机路数视觉 token 数决定 prefill 开销
power_profile采集时 TDP / 频率档sustained vs burst 差一大截;能效对比前提
stack_tierbaseline / optimizedThor 上优化栈差 10×+(§3.1a)
eval_tierL2 sim / L3 real对外 claim 合法性(§3.1c)

要点:一个不带这七个字段的延迟数字,进不了对标表,更进不了对外 marketing——这是把「孤立数字」升级为「可对比证据」的最小成本

3.2 内部回归集(ADR-108)

内容频率
L0tiny-gemm;单 op每 MR
L1OpenVLA/π0 dispatch 50每 MR(ISS)
L2chunk E2E simnightly
L3real robot 叠衣/抓取硅后 weekly

3.3 与 14/18 联动指标

指标归属门禁
effective_hz14 RTC≥10
chunk_ms_p9918/21≤100
tops_w_effective11/05≥3
bundle_version22/23semver trace

3.4 CI 门禁(ADR-110)

  • MR:L0+L1 ISS pass;p99 回归 ≤5%
  • Release:L2 + 对标 GR00T 92ms 的 1.1× 内(目标 <100ms)。
  • 310P 对比:430ms→<100ms 作为 marketing 可测 claim(须同 task,且标注精度差异)。

3.5 趋势判断(2026-07)

  1. 仿真饱和 → 鲁棒性变体上位:LIBERO 已饱和,LIBERO-PRO/Plus(待核)与 SimplerEnv 变体聚合档成为「还能区分模型」的仿真信号;VLABench(ICCV 2025)因组合/常识任务未饱和而价值上升。
  2. 真机相对排名兴起:RoboArena(待核)式分布式真机众测用「相对偏好」替代「绝对 SR」,抗刷分、跨机构——是应对「仿真高分不代表真机可用」的社区解法。
  3. 延迟靶标进入 20ms 级:FlashRT(待核)口径下 π0.5 在 Thor 上已到 44ms/23Hz,较 GR00T 92ms 更激进——但栈成熟度与来源需核实,不宜直接当承诺。
  4. π0.7 / GR00T N1.7 GA 落地:2026 最新版本(π0.7 于 2026-04、GR00T N1.7 GA)成为对标基准,旧版(N1.5)数据须标注版本(roadmap 与具体数值以官方为准)。
  5. 同 manifest 同任务成为横评硬门槛:随着厂商各报各的口径,「不带 manifest_hash 的延迟数字」正被业界视为不可信——这与我们 ADR-109/110 的方向一致。

6. 结论与 ADR

  1. 主 KPI = chunk p99 ms + effective Hz + task SR
  2. 公开靶标:Thor GR00T 92ms;FlashRT π0.5 44ms优化上限参考(来源待核)
  3. VLA-Perf 场景维度(on-device/split)纳入 24/14 测试矩阵(repo 名待核)。
  4. 仿真集选型:LIBERO 已饱和,优先其鲁棒变体(待核)+ SimplerEnv 变体聚合 + VLABench;绝对分数不作对外差异化 claim。
  • ADR-107 指标分层:任务/控制/推理/能效四层;禁止仅报 TOPS。
  • ADR-108 benchmark 集:L0–L3;manifest 绑定;VLABench/LIBERO 可选对齐,饱和集切鲁棒变体。
  • ADR-109 硬件对比:同 model manifest;报告 ms+Hz+W;区分 baseline/optimized;跨模型/跨精度标注「非同模型同任务」
  • ADR-110 CI 门禁:M3 p99≤100ms;回归阈值;公开对标表维护(来源待核者标注);记录须带 §3.1d 七字段。

深入思考

每题先给题干,再折叠一份图文并茂的参考答案。建议先合上答案自己想 3 分钟,再展开对照。

思考题 1:为何具身评测用 rollout 成功率而非 perplexity

大语言模型(LLM)评测第一眼看 perplexity(困惑度)/交叉熵损失,越低越好。但具身 VLA 的评测,业界第一指标是 rollout 成功率(在 N 次试验里机器人真正完成任务的比例),几乎没人拿 perplexity 当主 KPI。结合 §2.1 指标分层与 §2.2 因果链,论证「为什么『下一个 token 预测得准』不等于『机器人能干成活』」,以及这条鸿沟在评测口径上意味着什么。

展开参考答案(含 perplexity vs rollout 的鸿沟图 + 算一遍)

结论:perplexity 衡量的是「模型对单步动作 token 的预测有多贴合训练分布」,而 rollout 成功率衡量的是「一整条闭环轨迹在真实/仿真物理里有没有把任务干成」;二者之间隔着误差累积、闭环反馈与稀疏成功判据三道坎——一个 token 级损失极低的模型,完全可能因为误差逐步累积、或某个关键动作偏一点点,导致整条 rollout 失败,所以具身评测必须用「任务干成没有」的成功率,而非「预测准不准」的 perplexity。

用具体数字算一遍(误差累积如何吞掉「高预测精度」,数量级估算):

  1. 假设某 VLA 单步动作预测「基本正确」的概率是 99%(perplexity 看起来非常漂亮)。
  2. 但机器人任务是闭环的:一次 rollout 需要连续执行很多步。以 π0 一个 chunk H=50、一个任务需要若干 chunk 覆盖为例,取一条轨迹 200 步
  3. 若每步独立犯错、且一次关键错误就导致失败,「整条轨迹全对」的概率 ≈ 0.99²⁰⁰ ≈ 0.99^200 ≈ 13%——单步 99% 的漂亮数字,闭环下成功率只剩约 13%
  4. 更糟的是误差累积(compounding error):一旦某步偏了,机器人进入训练分布外的状态,后续预测精度不再是 99% 而会急剧下滑,真实成功率往往比这个独立性假设还低。
  5. 结论:perplexity/单步损失是「开环、单步、稠密」的指标,它对「闭环、累积、稀疏成功」的机器人任务系统性乐观。所以 §2.1 把 success rate @ N trials 放在指标金字塔顶端,而把算子 ms、chunk ms 放在下层——下层是必要条件,任务成功率才是终判据

回链:详见 §2.1 指标分层(任务层 success rate 居顶)、§2.2 因果链(算子→推理→控制→任务,任一层塌方都会拖垮 SR),以及 21 章 §2.2「精度:VLA rollout 成功率;非 perplexity」的同一口径。

思考题 2:同 manifest 同任务对比为何重要

ADR-109 反复强调「硬件横评必须同 model manifest、同 task」,§3.1d 更把 manifest_hash/precision/flow_steps 列为必填字段。结合 §3.1a 混测陷阱与 §3.1c 维护规则,论证「为什么跨模型/跨精度的延迟数字不能直接相除得倍数」,并亲手算一遍:一个「看似 4.7× 领先」的 claim,在拆开 manifest 后可能缩水到什么程度。

展开参考答案(含公平对比的变量控制图 + 算一遍)

结论:延迟/成功率是「模型 × 精度 × 任务 × 相机路数 × 栈成熟度」多个变量的联合函数;只有把除「硬件」外的所有变量都固定成同一个 manifest 同一个 task,两个数字之间的差异才能唯一归因到硬件——否则你以为在比芯片,实际在比「谁用了更激进的精度、更少的去噪步、更成熟的优化栈」,得出的倍数是几个变量叠加的假象。

用具体数字算一遍(把一个「4.7×」的 claim 拆开归因,数量级估算):

  1. 原始混测 claim:310P 上 π0 @ FP16 = 430ms vs Thor 上 GR00T @ nvfp4+fp8 = 92ms → 430 / 92 ≈ 4.7×。这是 §3.1a 表里最容易被误用的对比。
  2. 但这两行的变量几乎全不同——这是「非同模型同任务」的对比。逐项拆:
    • 精度差:FP16 → nvfp4+fp8 混合精度,低精度 kernel 吞吐远高;假设精度这一项独立贡献约 2× ~ 3× 延迟差(数量级估算,以实测为准)。
    • 去噪步数差:π0 用 5 步流匹配,GR00T DiT 用 4 步——步数直接线性影响去噪段延迟。
    • 模型结构差:π0 与 GR00T backbone 不同,prefill 开销不同。
    • 栈成熟度差:310P 的 CANN 栈 vs Thor 的 TensorRT 优化栈,§3.1a 明示 Thor 上「优化栈差 10×+」。
  3. 归因练习:若把精度、步数、栈都对齐(同 manifest 同 task),假设精度独立贡献 ~2.5×,则「纯硬件」这一项的差异可能只剩 4.7 / 2.5 ≈ ~1.9×——甚至更小。「4.7× 领先」里绝大部分是精度/栈红利,不是硬件本身。
  4. 结论:所以 ADR-109 要求「同 manifest 同 task」,ADR-110 要求记录带 precision/flow_steps/stack_tier;跨模型/跨精度对比一律标注 「非同模型同任务」,禁止直接相除当差异化 claim——否则一旦对手用同口径复现,你的「4.7×」会当场缩水成个位数,营销反噬。

回链:详见 §3.1a 混测陷阱说明、§3.1c「跨模型/跨精度标注非同模型同任务」、§3.1d 七字段必填表,以及 §6 ADR-109「同 model manifest;区分 baseline/optimized」。

思考题 3:仿真 benchmark 饱和与鲁棒性变体

LIBERO 到 2026-07 已被业界视为「饱和」——头部 VLA 分数逼近上限、区分度消失,于是社区推出 LIBERO-PRO/Plus(待核)等鲁棒性变体。结合 §3.1-sim 与 §3.5 趋势,分析「benchmark 饱和意味着什么」「为什么加扰动的鲁棒变体能重新拉开差距」,以及作为芯片厂商,该如何在 CI 里用好仿真集而不被饱和数字误导。

展开参考答案(含饱和与鲁棒变体的区分度图 + 对比表)

结论:benchmark 饱和意味着「它测的那部分能力,头部模型都已掌握,分数不再区分强弱」;此时高分只证明『会做原始任务』,却可能是过拟合了固定的光照/纹理/位姿而非真泛化。加扰动的鲁棒变体(改光照/加干扰物/换初始位姿)专门攻击这种记忆式过拟合,让「真泛化」和「刷分」重新分开;芯片厂商应把饱和集当『廉价下限回归信号』(跑通即可),把鲁棒变体和真机口径当『差异化证据』,绝不拿饱和集高分做对外 claim。

仿真集选型对比(芯片厂商 CI 视角):

仿真集饱和度CI 用途对外 claim 合法性
LIBERO 原版已饱和廉价回归:跑通证明栈没坏❌ 高分无差异化意义
LIBERO-PRO/Plus(待核)未饱和(加扰动)泛化回归:测栈是否影响鲁棒性△ 可作 sim 鲁棒性佐证,标注待核
SimplerEnv(变体聚合档)sim2real 桥接;背景/干扰鲁棒△ L2 sim,须标注
VLABench(ICCV 2025)低(组合/常识)难任务能力信号△ L2 sim,须标注
RoboArena / RADAR(真机,待核)真机终判据✅ L3 real,可对外

为什么加扰动能恢复区分度:饱和的根源常是模型在固定场景上过拟合了「视觉捷径」(记住了某种光照下的纹理→动作映射),而非学到任务的因果结构。鲁棒变体把光照、背景纹理、干扰物、初始位姿都随机化,捷径失效,只有真正学到「看物体几何/语义→规划动作」的模型才扛得住——于是分数重新分层。对芯片厂商的直接含义:低精度量化(INT4/nvfp4)有可能损伤模型的鲁棒性而非平均精度,所以 CI 里若只跑饱和集,可能量化掉了鲁棒性还浑然不觉;用鲁棒变体做回归,才能及早发现「我们的量化/编译栈把泛化能力搞坏了」。

结论落到操作:CI 里 LIBERO 原版跑通即过(廉价 smoke test),鲁棒变体 + SimplerEnv 变体档做「量化/编译是否伤鲁棒性」的守门,真机(RADAR/RoboArena)做最终 claim——这正是 §3.5「仿真饱和 → 鲁棒性变体上位」与 §6 结论 4「绝对分数不作对外差异化 claim」的操作化。

回链:详见 §3.1-sim 仿真 benchmark 表与演化图、§3.5 趋势 1/2、§6 结论 4「LIBERO 已饱和,优先鲁棒变体」,以及 §3.1b「仅 sim SR:sim2real gap」的方法论警示。


附:信息来源

区分公开/估计;参考时间 2026-07。

  • VLA-Perf:NVlabs/vla-perf(仓库归属与命名待核,2026-07 未见稳定权威一手来源确认为 NVIDIA 官方项目);FlashRT / RADAR / ActionFlow 机构与编号以社区流传为主,均待核;RADAR arXiv:2602.10980(2026 编号待核)。[公开,多项待核]
  • LIBERO:Liu et al.,桌面 long-horizon 操作 benchmark;已饱和;LIBERO-PRO / LIBERO-Plus 鲁棒变体为社区扩展,待核。[公开,变体待核]
  • SimplerEnv:真机策略仿真可复现评测(visual matching / variant aggregation 两档);sim2real 桥接。[公开]
  • VLABench:OpenMOSS,ICCV 2025;long-horizon / 组合 / 常识任务。[公开]
  • RoboArena:分布式真机相对排名众测,2026 新兴,归属/编号待核。[公开,待核]
  • Isaac GR00T 延迟靶标(Thor GR00T N1.5 ~92ms/10.9Hz;DiT 49ms/4 步;N1.7 GA 为 2026 最新):NVIDIA Isaac docs 2025–2026;具体数值与版本以官方为准。[公开]
  • π0 / π0.5 / π0.7(2026-04):Physical Intelligence;pi.website;arXiv:2410.24164。[公开]
  • 21/11/18 章。[内部]
  • 延迟/倍数拆解、误差累积概率:基于公开 profiling 的工程估算,均以官方/实测为准;跨模型跨精度对比标注 「非同模型同任务」。[估计]