28 安全与功能安全洞察
- 章节编号:28
- 所属层:X 横向(贯穿 04 安全岛、09/10 BSP、22/23 部署)
- 关联 ADR:ADR-091(安全启动与信任链)、ADR-092(模型与制品加密/签名)、ADR-093(TEE/密钥存储边界)、ADR-094(功能安全与 ISO 26262/机器人映射)
- 上游依赖:04(安全岛)、10(secure boot/A/B)、22(bundle 签名)、23(OTA/provisioning)
学习目标
- 前置知识:读过 04 章(安全岛与分域隔离)、10 章(secure boot / A-B 分区)、22/23 章(bundle 签名与 OTA/provisioning)概览;知道「安全启动信任链是逐级度量」「TEE 是什么」;对「功能安全等级(SIL/ASIL/PL)」有个大致印象即可。无需汽车电子或机器人安全认证背景——本章从「AI 域 vs 控制域的安全边界」而非「认证流程」切入。
- 学完产出:① 能说清「安全(security,防篡改/防窃取)」与「功能安全(functional safety,防伤人)」两个正交维度,以及一条端到端信任链(ROM → SPL/U-Boot → kernel → rootfs → bundle → weights)每一跳在验证什么;② 能从安全架构第一性原理推导为什么 VLA 输出不能作为 SIL 级急停的唯一输入——把「AI 不可诊断、无 WCET、无失效模型」这三条摆出来,而不是背结论;③ 能分清 SIL(IEC 61508/62061)、ASIL(ISO 26262 车规)、PL(ISO 13849 机器人) 三套等级体系的适用域,知道人形/协作机器人的急停实际按 ISO 10218 引 ISO 13849(PL d / Cat.3)或 IEC 62061(SIL 2),而 ASIL-D 是车规类比;④ 能画出「安全岛独立 watchdog 监控 VLA 输出范围」的监督架构,说清 watchdog 该查什么(速度/力/工作区边界)、超限如何触发 Cat.1 停止;⑤ 能读懂本章 ADR-091~094,把「安全需求」翻译成「信任链 + 加密制品 + TEE 边界 + 岛目标等级」的可执行输入。
- 阅读姿势:盯住一条主线——「AI 负责『聪明』,安全岛负责『不出人命』,两者必须物理隔离且岛能独立否决 AI」。本章所有 ADR、所有红线,归根结底都在回答一个问题:当那个 7B 的 VLA 抽风输出一个把机械臂甩向操作员的动作时,谁来在 AI 之外、用可认证的确定性逻辑把它拦下来。读表格时不要只看「用了什么加密算法」,要问「这条路径失效了会不会伤人,失效了谁来兜底」。
1. 范围与目标
定义 secure boot、制品签名、模型保护、TEE/密钥、功能安全与机器人场景映射。扩展阶段 到 架构与 ADR;完整认证 规模化阶段+。
核心问题
- bundle/firmware/rootfs 信任链?
- 模型 IP 保护(权重加密)?
- 安全岛(04) 与 Linux AI 域隔离?岛的目标安全等级如何界定?
- 对标 Jetson secure boot、QNX safety、Qualcomm IQ10?
- 隐私(摄像头数据)合规?
- VLA 输出为何不能作 SIL 级急停唯一输入?监督/watchdog 架构如何落地?
两个正交维度先分清:本章标题里的「安全」其实是两件事——Security(信息安全) 防的是「制品被篡改、模型被窃取、密钥被导出」;Functional Safety(功能安全) 防的是「系统失效导致物理伤害」。前者的对手是攻击者,后者的对手是随机硬件失效 + 系统性设计缺陷。二者用的标准、思维、验证手段都不同(§3.1 讲 security,§3.1b/3.5 讲 functional safety),但在机器人上它们在信任链上交汇:只有先保证「跑的是没被篡改的、签名过的控制固件」(security),「岛能确定性地否决 AI」(safety)才成立。
2. 需求洞察(具身驱动)
| 场景 | 安全诉求 | 维度 |
|---|---|---|
| 产线 provisioning | 设备唯一密钥;防克隆 | Security |
| VLA OTA | 签名 bundle;防篡改 | Security |
| 客户模型 IP | 加密 weights;TEE 解密 | Security |
| 人形协作 | 功能安全 控制路径;AI 非 SIL 唯一输入 | Functional Safety |
| 工厂视频 | 默认不上云(24/28) | 隐私/合规 |
| 急停触发 | 岛 watchdog 独立于 AI 域,Cat.1/Cat.0 停止 | Functional Safety |
硬性指标:启动链 verify 100%;OTA reject 未签名;密钥 不可导出 plaintext;安全停止 不依赖 AI 域可用性(岛掉电/AI 崩溃仍能停机)。
3. 技术现状与趋势
3.1 TOP 级安全/功能安全方案深度对比(2025–2026)
| 平台 | Secure Boot | 模型/AI 资产保护 | TEE/密钥 | 功能安全 | 机器人 | 优势 | 劣势 |
|---|---|---|---|---|---|---|---|
| NVIDIA Jetson | fuse+signed boot chain | N/A 通用;NGC 签名容器 | — | 外设/伙伴 | Thor/Isaac | 文档全 | 无标准模型加密 |
| Qualcomm IQ10 | 车规 | QTEE;Secure ML | QTEE | ASIL 分区 | Physical AI | 手机/车 十亿级 | 封闭 |
| Apple | Secure Enclave | ANE 模型加密 | SE | — | — | 模型 IP 标杆 | 不可编程 |
| QNX | Hypervisor | — | QNX crypto | ASIL-D 认证(IEC 61508 SIL 3) | 工业/车 | 认证齐全 | 授权费 |
| Autoware/SOAFEE | 平台依赖 | — | — | Zephyr 岛 | 自动驾驶模板 | 分域参考 | 非 VLA |
| ExecuTorch | 平台 | 平台 attestation | OS | — | Meta 设备 | 快速部署 | 非机器人 SIL |
| 我们(目标) | U-Boot 链 | signed+encrypt bundle | 岛/TEE | 岛目标 ≈ PL d / SIL 2(机器人),ASIL-D 为车规类比 | 04/10 | AI+控制分域清晰 | 认证周期长 |
3.1a 模型保护方案对比
| 方案 | 代表 | 优势 | 劣势 | 我们 |
|---|---|---|---|---|
| 不加密仅签名 | Jetson 默认 | 简单;防篡改 | IP 裸奔 | 签名 mandatory |
| TEE unwrap CEK | Qualcomm QTEE;Apple SE | 密钥不出 TEE | VLA 权重大 | CEK in TEE,mmap 解密 |
| 同态/联邦(研究) | 学术 | 隐私 | 性能 | 规模化阶段 观察 |
3.1b 功能安全:AI vs 控制(行业共识 2025–2026)
| 观点 | 来源/案例 | 含义 |
|---|---|---|
| AI 推理 = QM / best-effort | ISO PAS 8800;多数 OEM 内部 | VLA 不作 SIL 急停唯一输入 |
| 控制 = 高完整性岛 | Autoware Safety Island;IQ10 | 1kHz 进 Zephyr/QNX |
| Freedom from interference | SOAFEE;04 章 | NPU 分区 不影响 岛 WCET |
| Gemini Robotics ER | Google 2025 | 双系统:ER 监督 VLA——我们 watchdog+supervisor 软件层 |
| SOTIF(ISO 21448) | 2022 正式版;AI 感知场景 | 关注「无失效但功能不足」——AI 误判也算危害 |
术语必须掰开(这是全章最容易混用、也最影响架构判断的一处):
- SIL(Safety Integrity Level,安全完整性等级) 出自 IEC 61508 及其机械衍生 IEC 62061,分 SIL 1–4,是通用/工业机械的功能安全标尺。
- ASIL(Automotive SIL) 出自 ISO 26262,分 QM / A / B / C / D,是车规专用的标尺,由 S(严重度)×E(暴露度)×C(可控性)推导。ASIL-D 是最高级。
- PL(Performance Level,性能等级) 出自 ISO 13849-1,分 PL a–e,是机械安全控制系统的标尺,与「Category(Cat. B/1/2/3/4)」结构配合使用。
机器人的急停到底按哪个? 工业机器人安全标准 ISO 10218-1/2 并不自己定义等级,而是引用 ISO 13849-1(要求安全功能达 PL d / Category 3)或 IEC 62061(要求 SIL 2)。个人服务/协作机器人走 ISO 13482。所以人形/协作机器人上「急停」的合规靶标是 PL d / SIL 2,而不是 ASIL-D——ASIL-D 是拿汽车来类比时的口径,谈机器人本体时不要把 ASIL-D 当成合规要求写进验收。本章 ADR-094 因此明确:岛目标等级 ≈ PL d / SIL 2(机器人主口径),ASIL-D 作车规类比参考。
3.1c 三套功能安全等级体系对照(务必区分适用域)
| 体系 | 标准 | 等级刻度 | 适用域 | 我们何时用 |
|---|---|---|---|---|
| SIL | IEC 61508 / IEC 62061 | SIL 1–4 | 通用电子/电气安全相关系统、工业机械 | 岛急停可选口径 SIL 2 |
| ASIL | ISO 26262 | QM / A–D | 道路车辆 | 车规 SKU 类比(ASIL-D),非机器人本体主口径 |
| PL | ISO 13849-1 | PL a–e(配 Cat. B/1/2/3/4) | 机械安全控制系统 | 机器人急停主口径 PL d / Cat.3 |
| QM | (无量化完整性要求) | — | AI/best-effort 功能 | VLA/感知全部落这里 |
| SOTIF | ISO 21448 | (非等级,场景覆盖度) | 「无失效但功能不足」的预期功能安全 | AI 误判/长尾场景的补充框架 |
一句话记忆:车用 ASIL(26262)、机器人急停用 PL/SIL(13849 引自 10218 或 62061)、AI 一律 QM(PAS 8800)、AI「不出错也不够用」的场景补 SOTIF(21448)。
3.2 信任链(候选)
ROM → signed SPL/U-Boot → signed kernel+dtb → signed rootfs
→ signed dsa-bundle(22) → IREE verify → load weights
密钥层次:设备 OEM key → per-device key(23 provisioning) → model CEK in TEE。
逐跳读这条链:每一级只把控制权交给「用上一级信任的公钥验签通过」的下一级镜像——这就是信任根逐级度量(measured/verified boot)。ROM 是硬件固化的信任锚(root of trust),它验 SPL/U-Boot;U-Boot 验 kernel + 设备树;kernel 验 rootfs(dm-verity);rootfs 起来后,运行 时(IREE)再验 dsa-bundle 的签名,最后才 load 权重。任何一跳验签失败 → 拒绝加载,进安全态。功能安全的岛固件本身也在这条链上——「岛能可信地否决 AI」的前提,是「岛跑的是没被篡改的岛固件」,这正是 security 与 safety 的交汇点。
3.3 模型与制品保护(ADR-092)
| 资产 | 保护 |
|---|---|
| vmfb/weights | AES-GCM;TEE unwrap CEK |
| tuning spec | 签名即可(非 secret) |
| manifest | 签名 + semver |
运行时:解密 mmap 统一内存(04);禁止 plaintext 落盘。
3.4 TEE 边界(ADR-093)
| 放 TEE/岛 | 放 Linux |
|---|---|
| 密钥、attestation | VLA 推理 |
| 1kHz 控制 | ROS2 |
| 可选:模型 CEK unwrap | 大权重(解密后) |
判断:全 VLA 进 TEE 不可行(内存);控制+密钥进岛/TEE。
3.5 功能安全映射(ADR-094)
| 通用功 能安全概念 | 机器人映射 | 合规靶标 |
|---|---|---|
| 高完整性执行(SIL/PL 级) | Zephyr 岛 1kHz | PL d / Cat.3(ISO 13849)或 SIL 2(IEC 62061) |
| QM / best-effort | VLA/感知 AI | ISO PAS 8800(AI=QM) |
| Freedom from interference | 04 安全岛 + 09 分区 | IEC 61508 / ISO 26262-9 |
| 车规类比(可选) | 车载 SKU 时 | ASIL-D(ISO 26262) |
红线:不得 将 VLA 输出直接作 SIL/PL 级急停的唯一输入;须 监控层 + 岛 watchdog,由岛独立诊断并可否决 AI(见 §3.5a、思考题 1 与 3)。
3.5a 安全监督架构:岛 watchdog 如何监控 VLA 输出(新增)
VLA 是「QM 域的建议者」,岛是「安全域的裁决者」。二者之间必须插一层独立于 AI 域的监督(supervisor)+ watchdog,把 VLA 的每一条动作指令在下发到执行器之前过一遍安全包络(safety envelope)检查:
这层监督在物理隔离的岛上运行(独立 MCU / lockstep 核),它检查什么、怎么否决:
| 检查项 | 判据(可认证的确定性规则) | 超限动作 |
|---|---|---|
| 速度限制 | 关节/末端速度 < 协作模式阈值(ISO 13482 / TS 15066) | Cat.1 受控减速停 |
| 力/力矩限制 | 接触力 < 生物力学阈值(TS 15066 表) | Cat.1 停 + 顺应 |
| 工作区边界 | 末端位姿 in 允许几何空间 | Cat.1 停 |
| 关节限位/自碰撞 | 目标角 in 机械限位、无自碰撞 | 拒绝该指令 |
| AI 心跳 | VLA 周期性喂狗,超时 = AI 域失效 | Cat.0 断电急停 |
关键点:这些判据全部是确定性、可测试、无需 AI 参与的规则——岛不需要「理解」VLA 想干什么,它只需要判断「这条指令会不会越界伤人」。这就是为什么监督层能被认证到 PL d / SIL 2,而 VLA 本身只能是 QM。
3.6 隐私与数据合规(加深,v4)
| 法规/标准 | 机器人场景 | 我们策略 |
|---|---|---|
| GDPR(EU) | 生物识别/视频 | 默认 L0;视频 opt-in;24/29 |
| PIPL(中国) | 出境/敏感个人信息 | local-only SKU;境内存储 |
| ISO 10218-1/2 | 工业机器人安全 | VLA 非急停唯一;引 13849/62061;35/岛 |
| ISO 13482 | 个人服务机器人 | 协作速度/力限制;ros2_control |
| ISO 13849-1 / IEC 61508 | 机械安全 / 通用功能安全 | 急停安全功能 PL d / Cat.3;岛完整性 SIL 2 口径 |
| IEC 62061 | 机械电气控制系统功能安全 | 急 停 SIL 2 备选口径(与 13849 二选一) |
| ISO 21448 (SOTIF) | 预期功能安全 | AI 误判/长尾场景覆盖;补 26262 之不足 |
| ISO PAS 8800 | AI 功能安全指南 | AI=QM;ER/supervisor 趋势 |
判断:28 章须与 33 国内场景、31 数据回流 联合评审;marketing 不得默认 field video 上云。急停安全功能的合规靶标以 ISO 10218 引 ISO 13849(PL d / Cat.3) 为机器人主口径,IEC 62061(SIL 2) 为等价备选,ASIL-D(ISO 26262) 仅在车载 SKU 时作类比。
3.7 趋势
- signed model artifact 与 signed firmware 同等重要(23 OTA)。
- AI 非 SIL 成行业共识;ER/supervisor 双系统兴起。
- ExecuTorch/Mobile 推动 on-device attestation——机器人可借鉴 provisioning(23)。
- 隐私默认本地(24)——欧盟/中国 PIPL 强化 field video 约束。
- SOTIF(ISO 21448) 从汽车扩散到机器人——「AI 不失效但功能不足(误判长尾场景)」被正式纳入安全考量,推动「安全包络 + 场景覆盖度」双轨。
- π0.7(2026-04)/ GR00T N1.7(GA) 等最新 VLA 上,厂商普遍把 VLA 定位为 QM 建议者、以独立安全层兜底(以官方为准)。
4. 候选方案
| 候选 | 小结 |
|---|---|
| A. Secure boot + signed bundle + TEE 密钥 + 岛 PL d/SIL 2 | 建议方案 |
| B. 仅 HTTPS OTA 无 secure boot | M1 禁止量产 |
| C. 全 QNX ASIL | 车规旗舰可选(10 章) |
6. 结论与 ADR
- 全链签名:boot→rootfs→bundle。
- 权重加密+TEE unwrap;IP 保护。
- VLA=best-effort(QM);1kHz=岛 + 功能安全证据包(长期),岛目标 PL d / SIL 2。
- 隐私默认本地。
- VLA 输出经监督层 + 岛 watchdog 过安全包络后方可下发;岛可独立否决 AI(§3.5a)。
- ADR-091 安全启动:U-Boot→kernel→rootfs verify;fuse 策略;10 ADR-060 衔接。
- ADR-092 制品签名加密:bundle sign mandatory;weights encrypt optional(mandatory 客户 IP);Runtime verify。
- ADR-093 TEE/密钥:provisioning per-device key;CEK in TEE;控制密钥 岛内。
- ADR-094 功能安全映射:AI 域 非 SIL(QM);控制 岛目标 ≈ PL d / SIL 2(机器人主口径,ISO 10218 引 ISO 13849 或 IEC 62061),ASIL-D 作车规类比;freedom from interference 04/09;VLA 须 supervisor + 独立 watchdog,由岛在 AI 之外做确定性安全包络检查并可否决(§3.5a)。
深入思考
每题先给题干,再折叠一份图文并茂的参考答案。建议先合上答案自己想 3 分钟,再展开对照。
思考题 1:为何 VLA 输出不能作为 SIL 级急停的唯一输入
人形机器人要有急停功能,而系统里最「聪明」的部件是 VLA——它看得懂场景、知道人在哪。工程师直觉是:「让 VLA 判断危险、直接触发急停不就好了?」结合 §3.1b、§3.5、§3.5a,从安全架构的第一性原理推导:为什么把 VLA 输出当作 SIL/PL 级急停的唯一输入是红线?一个可认证的安全功能到底要满足什么,而 VLA 恰恰不满足哪几条?
展开参考答案(含安全架构推导图 + 对比表)
结论:一个 SIL/PL 级安全功能必须『可诊断、有确定性时序上界(WCET)、有已知失效模型、可穷尽测试』,而 VLA 作为一个黑箱大模型这四条一条都不满足——它无法证明失效率、动作延迟无硬上界、失效模式不可枚举、行为不可穷举验证;所以它只能是 QM 域的『建议者』,真正的急停必须由一个独立、简单、 确定性的安全层(岛 + watchdog + 安全包络)裁决,VLA 至多是这个安全层的众多输入之一,永远不能是唯一。
逐条推导为什么 VLA 过不了这四关:
| 安全功能要求 | 含义 | VLA 为何不满足 |
|---|---|---|
| 可诊断(失效率可证) | SIL 2 要求 PFH 在 1e-7~1e-6/h、SFF 达标 | VLA 是统计模型,没有「失效率」这个可测量、可认证的量;它「偶尔犯错」是设计特性不是可诊断故障 |
| 确定性 WCET | 安全响应必须有硬时间上界 | VLA 推理延迟随 batch/内存/热节流抖动,§21 里 chunk 延迟本就是波动量;无法保证「危险发生后 X ms 内一定停」 |
| 已知失效模型 | FMEA 要能枚举失效模式 | VLA 的失效是幻觉、分布外输入、对抗样本、长尾场景——不可穷举枚举,SOTIF(ISO 21448)正是为此而生 |
| 可穷尽测试 | 行为可验证覆盖 | VLA 行为空间随输入组合爆炸,无法穷举验证,只能统计评估 rollout 成功率 |
算一遍「量级对比」体会差距:一个 SIL 2 急停回路要求危险失效概率 PFH ≈ 1e-6/小时(百万小时一次量级)。而一个 VLA 在长尾场景下输出不安全动作的概率,即便乐观按 1e-3~1e-2/次决策(千次到百次一次),按 50Hz 决策频率算,一小时就是 50×3600 = 18 万次决策——即便每次不安全概率仅 1e-4,期望每小时也有 ~18 次 不安全输出。二者相差约 7 个数量级。这就是为什么必须在 VLA 之外放一个把这 18 次全拦下的确定性安全层:安全层的 PFH 由它自己的简单确定性逻辑保证,与 VLA 的错误率解耦。
正确架构:VLA → 监督层(逐指令查安全包络)→ 岛 watchdog(诊断 + 否决)→ 执行器(§3.5a)。VLA 的输出至多是「候选动作」,是否放行由独立于 AI 域、可认证到 PL d/SIL 2 的安全层裁决。这与 Google Gemini Robotics「ER 监督 VLA」双系统(§3.1b)是同一思想。
回链:详见 §3.1b「AI 推理 = QM」、§3.5 红线、§3.5a 监督架构表,以及 §6.3 ADR-094「VLA 须 supervisor + watchdog」。
思考题 2:机器人安全等级如何选(PL d / SIL 2 对应关系)
团队里有人说「我们对标车规,岛要做到 ASIL-D」,有人说「机器人应该按 SIL 2」,还有人说「用 PL d 就够了」。结合 §3.1b、§3.1c、§3.6,厘清 SIL / ASIL / PL / QM 四套标尺各自的适用域,说明人形/协作机器人的急停到底该选哪个等级、依据哪个标准链,并解释为什么「ASIL-D」在谈机器人本体时是个用错的口径。
展开参考答案(含标准适用域推导图 + 对比表)
结论:机器人急停的合规链是『ISO 10218(工业机器人安全)→ 引用 ISO 13849-1(要求 PL d / Cat.3)或 IEC 62061(要求 SIL 2)』,个人服务机器人再叠 ISO 13482;所以机器人本体急停的正确靶标是 PL d / SIL 2,二者大致等价。ASIL-D 出自 ISO 26262,是道路车辆专用,只有当产品是『车载 SKU』时才作类比;把 ASIL-D 写进机器人本体的安全需求 是张冠李戴——用错了标准链、也把等级要求拔高到了不匹配的车规。
四套标尺对照(务必按适用域选,而非按「听起来最严」选):
| 标尺 | 标准 | 适用域 | 机器人急停用不用 |
|---|---|---|---|
| PL a–e | ISO 13849-1(+ Cat.) | 机械安全控制系统 | ✅ 主口径:PL d / Cat.3(经 ISO 10218 引用) |
| SIL 1–4 | IEC 61508 / IEC 62061 | 通用/机械电气功能安全 | ✅ 等价备选:SIL 2(经 ISO 10218 引用) |
| QM/ASIL A–D | ISO 26262 | 道路车辆 | ⚠️ 仅车载 SKU 类比(ASIL-D),非本体口径 |
| QM(无量化) | ISO PAS 8800 / 21448 | AI/预期功能 | ✅ VLA/感知全落 QM + SOTIF |
算一遍「PL d 与 SIL 2 为何大致等价」:ISO 13849-1 用 PFH(每小时危险失效概率) 把 PL 映射到定量区间——PL d 对应 PFH ≈ 1e-7 ~ 1e-6/h;IEC 62061 的 SIL 2 对应 PFH ≈ 1e-7 ~ 1e-6/h。两者的 PFH 区间重叠,这就是「PL d ≈ SIL 2」在工程上成立的定量根据(标准正文亦给出二者的对照表)。而 ASIL-D 是用 S×E×C 定性推导的车规最高级,其目标随机硬件失效度量(如 PMHF ≤ 1e-8/h)比 SIL 2 更严一个量级——对机器人本体急停既不匹配标准链、也过度拔高。
为什么选错口径有实害:若把机器人急停按 ASIL-D 立项,一是用错了认证标准链(认证机构会问「你为什么拿 26262 认一台不是车的机器人」),二是成本/周期陡增却不带来对应合规收益。反过来,若只标「PL d」而忘了它的结构要求是 Category 3(单一故障不丧失安全功能、多数故障可检测),又会漏掉冗余/诊断的架构约束。正确做法:机器人本体急停 = ISO 10218 → ISO 13849 PL d / Cat.3(或 IEC 62061 SIL 2);车载衍生 SKU 另按 ISO 26262 评 ASIL;AI 一律 QM + SOTIF。这正是 §3.1c 对照表和 ADR-094 的口径。
回链:详见 §3.1c 三套体系对照表、§3.6 合规表(新增 ISO 13849-1/IEC 61508 行),以及 §6.3 ADR-094「岛目标 ≈ PL d / SIL 2,ASIL-D 作车规类比」。
思考题 3:安全岛独立 watchdog 如何监控 VLA 输出范围
我们决定「VLA 是建议者、岛是裁决者」。但具体到实现:岛上那个 watchdog / 监督器到底该检查什么、如何在不理解 VLA 语义的前提下判断一条动作指令安全与否、以及为什么它必须物理独立于 AI 域(而不是在 Linux 上跑个监控进程)?结合 §3.5a,把这套监督机制拆开讲清。
展开参考答案(含 watchdog 监控时序图 + 检查项对比表)
结论:岛的监督不去『理解』VLA 想做什么,而是把每条动作指令投影到一组确定性的物理安全包络上——速度/力/关节限位/工作区几何/自碰撞——只做『在不在界内』的布尔判断,超限即否决;同时用独立心跳 watchdog 监控 AI 域是否还活着,AI 卡死就断电急停。它必须跑在物理独立的岛(独立 MCU / lockstep 核、独立时钟与电源域),因为若监督和被监督的 VLA 共享同一片 SoC/OS,一次共因失效(内核 panic、内存耗尽、热节流)就会同时带走监督者和被监督者,安全兜底形同虚设——这就是 freedom from interference 的意义。
watchdog / 监督器该查什么(全部是确定性、无需 AI 的判据):
| 检查维度 | 判据来源 | 为什么岛能独立判断 |
|---|---|---|
| 速度包络 | ISO 13482 / ISO/TS 15066 协作速度阈值 | 关节/末端速度是可直接测量的物理量,阈值是常数表 |
| 力/力矩包络 | ISO/TS 15066 生物力学接触力表 | 力矩传感/电流估算即可,超阈值即停 |
| 工作区几何边界 | 部署时标定的允许几何空间 | 末端位姿 in/out 是纯几何判断 |
| 关节限位 / 自碰撞 | 机械限位 + 自碰撞模型 | 目标角是否越限、是否自碰撞,查表/几何 |
| AI 心跳 | 周期性喂狗 + 超时阈值 | 计时器,与 AI 内容无关 |
用具体数字算一遍「独立 watchdog 的时序预算」:设协作模式限速末端 250mm/s,安全距离预留 50mm。若要求「危险到停机」在末端多走出不超过 50mm 内完成:允许响应时间 ≈ 50mm ÷ 250mm/s = 200ms。这 200ms 要分给「监督器检测(1kHz 一拍 = 1ms)+ 决策 + 制动物理延迟」。岛跑 1kHz 确定性循环,单拍检测 < 1ms,决策 < 1ms,余下 ~198ms 全给机械制动——时序上界完全由岛的确定性循环保证,与 VLA 那条抖动的、无 WCET 的推理延迟彻底解耦。反观若把监督放在 Linux 上:一次 GC/换 页/内核抢占就可能让「检测」延迟到几十 ms 甚至卡死,200ms 预算随时被吃穿。
为什么必须物理独立(freedom from interference):
- 共因失效隔离:VLA 域的内核 panic、OOM、热节流不能波及监督器——独立 MCU + 独立电源/时钟域,§04 安全岛正是干这个。
- 独立可诊断:岛自身跑 lockstep / 内建自检(BIST),它的失效率可被证明到 SIL 2;而一个 Linux 进程的失效率无法认证。
- AI 死了也能停:心跳 watchdog 的意义在于——即便整个 AI 域完全宕机,岛依然能把机器人停在安全态(Cat.0)。安全不能依赖「聪明的那一半还活着」。
这套架构落到本项目就是:AI 域(Linux + VLA,QM)与安全岛(Zephyr/QNX,目标 PL d / SIL 2)物理分域,岛内监督器 + watchdog 对 VLA 输出做安全包络裁决,对应 §04 安全岛、§09 分区隔离与 ADR-094。
回链:详见 §3.5a 监督架构图与检查项表、§3.1b「Freedom from interference / ER 监督 VLA」、§3.5 红线,以及 §6.3 ADR-094「supervisor + 独立 watchdog」。
附:信息来源
区分公开/标准;参考时间 2026-06。
- NVIDIA Jetson secure boot;Qualcomm QTEE;SOAFEE/Autoware safety island。[公开]
- 功能安全标准:IEC 61508(通用功能安全)、IEC 62061(机械电气控制系统,SIL)、ISO 26262(道路车辆,ASIL)、ISO 13849-1(机械安全,PL / Category)。[标准]
- 机器人安全标准:ISO 10218-1/2(工业机器人,引 13849/62061)、ISO 13482(个人服务机器人)、ISO/TS 15066(协作机器人生物力学限值)。[标准]
- AI / 预期功能安全:ISO PAS 8800(AI 功能安全指南,AI=QM)、ISO 21448 SOTIF(预期功能安全,2022 正式版)。[标准]
- PL d ↔ SIL 2 对照:ISO 13849-1 与 IEC 62061 PFH 区间(
1e-71e-6/h)对照表;等级映射以标准正文为准。[标准] - VLA 定位与双系统监督:Google Gemini Robotics ER 监督 VLA(2025);π0.7(2026-04)/ GR00T N1.7(GA)厂商定位,具体以官方为准。[公开]
- 04 ADR-015;09/10/22/23 章。[内部]