Window: 2026-09-07 ~ 2026-09-13
Sources: HN / arXiv / industry media / official / funding / markets
Issue: 2026-W37
🌟 本周亮点
- [端到端VLA] 世界-动作模型(WAM)集中发力:OpenWAM 以模块化方式厘清世界-动作预训练关键设计并开源可规模化模型,GE-Act 2.0 从零预训练实现跨本体零样本操作,端到端具身基础模型的范式持续推进。
- [控制层·世界模型] 可编程世界模型(90 赞)将显式状态演化与视频生成解耦,用可执行规则与 3D 包围盒维持持久可控环境;SyncWorld 则用视觉标定让世界模型成为零样本模拟器,世界模型正从「想象」走向「可控仿真」。
- [感知层] SpatialBlock(78 赞)用合成积木堆叠任务锚点式训练 LVLM 的三维空间推理并泛化到真实视觉,指向具身感知层空间智能的可迁移训练范式。
1️⃣ VLA(视觉-语言-动作模型)
-
把世界-动作预训练拆解为可组合模块,逐一厘清生成骨干、潜空间、联合去噪、以自我为中心的预训练与协同训练等关键设计原则,产出可规模化的开源模型,在仿真与真机上均有强表现。[端到端VLA]
-
以控制导向自编码器、单步视觉规划器与逆动力学模型从头训练,配合知识对齐的选择性优化,实现跨本体迁移与零样本分布外操作,覆盖多样技能与条件。[端到端VLA]
-
大规模机器人操作基准,在逐级加难的任务变体上评估 VLA 的细粒度空间推理与长视野过程规划能力,配套诊断指标,揭示当前模型的能力边界。[端到端VLA]
-
仅用仿真数据训练的视觉-语言框架,为人形机器人预测全身关节动作,实现在杂乱室内环境中的避障导航与零样本部署。[端到端VLA]
-
将完整带时间戳的视频历史直接喂入预训练 VLM 骨干,用隐状态驱动流匹配动作头,无需专门记忆模块即可完成长视野操作,性能超过带专用记忆模块的方案。[端到端VLA]
2️⃣ 灵巧手 / 灵巧操作
-
拟人手在手操作接触丰富且高度动态,仿真难以复刻。提出实时雅可比估计方法,绕开大量建模与数据采集,快速学习握笔在手书写这一灵巧前沿任务。[控制层·RL]
-
针对接触丰富示范难以忠实迁移到机器人的瓶颈,让人与机器人佩戴同一外骨骼采集配对数据,克服以往仅记录人侧、自由空间标定的开环映射在接触下退化的问题。[控制层·BC]
-
两阶段框架先预测稀疏夹爪关键帧再生成连续动作,借助运动学优化抑制漂移,把复杂手部演示迁移到机器人夹爪,并开放配对数据集。[控制层·BC]
-
IEEE Spectrum 报道灵巧操作仍是机器人落地最大障碍之一,触觉或是关键,但高质量触觉数据匮乏一直制约进展,如今学术界与创企正竞相构建新型触觉数据源。[感知层]
4️⃣ 具身模型(感知/规划/控制三层 × 动作生成方式)
-
将显式状态演化与视频生成解耦,用可执行程序与 3D 定向包围盒维护全局世界状态并作为时空条件驱动生成渲染器,维持持久、可控的环境。[控制层·世界模型]
-
在合成积木操作任务上训练大视觉语言模型,通过 3D-2D 投影、视角变换与结构组合等锚点式推理提升三维空间推理,并泛化到真实视觉任务。[感知层]
-
面向非马尔可夫的长视野操作,将记忆基础规划与计划条件执行分离,用紧凑的情节段记录与进度校准的动作块,在保持固定推理时延的同时保留细粒度视觉证据。[规划层]
-
以固定的可执行技能接口对机器人技能执行进行校验与验证,实现闭环具身智能体,底层可适配可在线调整的低层 VLA 策略(如 Qwen3-VL、OpenPI/pi0.5)。[规划层]
-
人形复杂地形运动需前视外感知预判障碍,但真实部署中该信号常间歇失效。CAP 用学习去噪统一感知与盲控,避免在两套策略间硬切换。[控制层·RL]
-
斯坦福团队在 ECCV「物理环境中的具身多模态推理」专题提出,视觉、听觉、触觉本质是同一组物理属性在不同感官通道上的投影,不堆 Transformer 而以物理建模统一多模态。[感知层]
5️⃣ 具身智能芯片(机器人计算 / 边缘 NPU)
6️⃣ 制造 / 产线
本周该方向公开源未见重大动态。
7️⃣ 市场 / 产业
-
九识无人车规模已超 3 万辆、覆盖 300 余城、累计真实运营 2.5 亿公里,宣布战略聚焦物理 AI 赋能城市治理,走「先跑出商业收入、再升级物理 AI」的数据驱动路径。公司数据以官方渠道核验。
-
RoboCup 2026 创造历史,两支各 11 台人形机器人的队伍首次以完整阵容同场竞技,B-Human(不来梅)对阵 HTWK Robots(莱比锡)。
-
IEEE Spectrum 每周机器人视频精选,本期人形机器人挑战单杠等高动态动作;并预告 9 月 22-23 日首尔 Humanoids Summit 等行业活动。
-
Robohub 报道一项脑成像研究,人对会犯错、尤其动作别扭的人形机器人更易产生怀疑,为人机信任与人形交互设计提供神经层面证据。
-
NASA 的 CADRE 任务将向月球投放三台小型探测车,仅给一条指令——自行商量如何探索这片地形,检验多机自主协作在真实任务中的可行性。
📈 产业动态
上市公司风向(13 只,点击展开 · 截至最近收盘)
🌍 海外
| 公司 | 最新价 | 周涨跌 | 关键事件 |
| 特斯拉(Optimus) TSLA | 365.44 USD | +3.21% | Optimus 观察标的 |
| 直觉外科(手术机器人) ISRG | 369.15 USD | +0.67% | 手术机器人观察标的 |
| Symbotic(仓储机器人) SYM | 42.13 USD | -1.89% | 仓储机器人观察标的 |
| Serve Robotics(配送) SERV | 4.48 USD | -9.4% | 配送机器人观察标的 |
| UiPath(自动化) PATH | 13.75 USD | -9.48% | 自动化观察标的 |
| 英伟达(机器人算力) NVDA | 218.29 USD | -5.24% | 机器人计算观察标的 |
| 京东(物流机器人) 9618.HK | 106.2 HKD | -2.39% | 物流机器人观察标的 |
🇨🇳 国内(A股/港股)
| 公司 | 最新价 | 周涨跌 | 关键事件 |
| 优必选 116.09880 · 港股 | 77.95 HKD | -3.29% | 人形机器人观察标的 |
| 地平线机器人 116.09660 · 港股 | 4.23 HKD | -0.47% | 机器人计算观察标的 |
| 汇川技术 0.300124 · A股 | 53.52 CNY | -1.73% | 运动控制观察标的 |
| 埃斯顿 0.002747 · A股 | 28.89 CNY | -2.07% | 工业机器人观察标的 |
| 绿的谐波 1.688017 · A股 | 280.66 CNY | -1.55% | 谐波减速器观察标的 |
| 科大讯飞 0.002230 · A股 | 39.15 CNY | -0.03% | 具身语音交互观察标的 |
融资与独角兽