返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

具身智能技术架构VLA

离散动作token、连续生成式动作建模、双系统快慢协同——VLA(视觉-语言-动作)路线内部正在激烈分化。与此同时,WMA(世界模型-动作)路线以英伟达Omniverse和Newton为基础设施加速追赶。赛迪研究院报告揭示了具身智能模型路线之争的底层逻辑与工业落地的最优解。

VLA路线的三条细分方向

VLA(视觉-语言-动作)是当前竞争最活跃的方向,内部分化出三个代表性分支。

离散动作token方向——将动作离散化为token序列,复用大语言模型预训练能力实现端到端生成。以谷歌RT-2和斯坦福OpenVLA为代表,国内某Q企业Spirit v1.5已在RoboChallenge Table30等公开真机基准上领先于π0.5。该方向的优势在于可复用大语言模型的语义理解和生成能力,短板在于离散化可能损失动作的连续性和精细度。

连续生成式动作建模方向——通过flow matching等连续生成式策略直接输出连续关节轨迹,实现高频精细控制。以Physical Intelligence的π0/π0.6为代表,π0.6通过RECAP引入离线强化学习与真实机器人经验学习,反映出VLA正从纯模仿学习向“模仿学习+强化/在线经验学习”演进。

双系统快慢协同方向——将慢速场景理解与高频运动控制拆分协同。Figure Helix、英伟达GR00T N1和国内某Z企业FiS-VLA均采用该架构,慢系统负责场景理解与任务规划,快系统负责高频运动控制,异步拆分协同,成为人形机器人落地的重要工程范式。

WMA路线的核心逻辑与应用进展

WMA(世界模型-动作)路线的核心在于学习环境动力学与未来状态演化并服务于动作决策。内部分化出仿真与数据引擎、状态预测与策略评估、多模态联合驱动等方向。

在仿真与数据引擎层面,英伟达Omniverse和Newton等基础设施正在强化具身智能的数据生成、验证与部署能力。ABB Robotics接入后一致性高达99%、部署成本最高降低40%,国内某J企业GigaWorld-0将世界模型作为VLA的数据引擎,带动性能提升近300%。

状态预测方向训练模型对未来视觉与状态演化进行可控预测,提升策略评估与长程规划能力,某X企业与斯坦福联合研发的Ctrl-World在公开benchmark评测中表现领先。联合驱动方向将多模态大模型语义理解与世界模型物理推演结合,宇树已公开UnifoLM-VLA-0与UnifoLM-WMA-0,同步布局两类能力。

两大路线融合与分层规划的务实选择

两大路线正在加速融合,但分层协同仍是近期工业落地的务实选择。VLA在语义泛化和跨任务迁移上优势突出,WMA在长程规划、数据扩增和物理一致性上更具潜力,二者互补性强于替代性。后训练阶段行业正从模仿学习转向强化学习,进一步推动两条路线在方法层面趋同。

视觉语言模型负责高层理解、技能库和控制器负责底层执行的分层规划路线,在工业场景中仍是近期最符合工程逻辑的务实选择。其可解释性强、接口清晰的优势,尤其适合任务边界清晰的制造和物流工位需求。
点击阅读报告原文: 赛迪智库:2026具身智能技术与产业发展报告(39页)
相关报告