返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

世界模型与VLA技术

2024年10月,Physical Intelligence发布π0,用互联网规模数据预训练VLA模型,让机器人能够高效执行复杂任务——从叠衣服到整理桌面。几乎同时,清华大学发布RDT-1B,展现零样本泛化能力;鹏城实验室发布国内首个操纵大模型,准确率比谷歌RT-1高19.5%。世界模型与VLA技术正在快速迭代,但“模型在物理世界的推理不可控、存在幻觉”仍是核心瓶颈。报告从世界模型架构、VLA模型对比、超长序列建模、两大科学问题等维度,拆解了具身智能大脑的技术路线。

VLA模型——视觉-语言-动作的融合之路

从RT-H到π0:VLA模型的关键突破

VLA(Vision-Language-Action)模型是当前具身智能的核心技术路线,旨在将视觉感知、语言理解和动作控制统一到一个模型中。

- 2024年3月——谷歌RT-H:通过将复杂任务分解成简单的语言指令,再转化为机器人行动,提高任务执行体验

- 2024年10月——清华大学RDT-1B:双臂操纵机器人扩散基础模型,能够对未见过的目标和场景表现出零样本泛化能力

- 2024年10月——Physical Intelligence π0:使用互联网规模数据预训练,用高质量精细数据微调VLA模型,能够高效执行复杂任务

- 2024年——鹏城实验室操纵大模型:国内首个操纵大模型,在多级别操纵任务上准确率比字节GR-1高23.1%,比谷歌RT-1高19.5%

VLA模型对比

主流VLA模型核心对比
模型发布方核心技术核心优势发布时间
RT-H谷歌语言指令→动作序列任务分解与执行闭环2024.03
RDT-1B清华大学扩散基础模型零样本泛化能力2024.10
π0Physical IntelligenceVLA+互联网预训练复杂任务高效执行2024.10
鹏城操纵大模型鹏城实验室多级别操纵准确率超GR-1 23.1%2024

世界动作模型——突破大脑瓶颈的关键探索

为什么需要世界动作模型

从语言世界到物理世界,模型不能停留在“看到”,必须“真懂”真实物理世界。世界动作模型被视为突破具身智能大脑瓶颈的重要方向。

六大核心能力

世界动作模型的核心能力包括:理解真实物理世界的多模态感知、捕捉各个任务间共同规律的通用表征、模拟多个潜在情景和行动路径的规划能力、与真实环境交互完成指定任务的能力、根据经验与共同规律进行推理的能力、根据环境变化动态调整决策的能力。

超长序列建模——高效世界模型的基础架构

语义可控的生成机制

该研究的目标是提升世界模型生成与执行的可靠性、可控性。核心贡献在于构建显式语义概念体系与生成过程可控机制。多模态内容生成输出在语义一致性、结构合理性和过程可追溯性方面表现优异,持续生成评估中表现更稳定,显著领先现有方法40%。

基准测试表现

在BenchFDA、SWDE、SQUAD等基准测试中,该架构分别取得40.15、32.52、32.17的得分,全面超越Transformer、RetNet、Mamba、GLA等主流架构。

关键技术:在one-hot单纯形上实现严格的扩散过程,直接在离散空间中去噪,不依赖嵌入或掩码,也不依赖马尔可夫性;连续记忆计算和对称记忆计算等结构化计算方法。

两大科学问题——精准一致性与可控对齐性

Grounding——确保感知规划与物理环境精准一致

如何确保具身智能体的感知规划与物理环境的精准一致性(Grounding)——模型对物理世界的理解必须与真实环境精准对应,不能出现偏差。

这一问题的难点在于:物理世界的状态空间是连续的、高维的、动态的,而模型的表征空间是离散的、低维的、静态的。如何建立两者之间的精准映射,是Grounding的核心挑战。

Alignment——确保交互执行与人类价值观可控对齐

如何确保具身智能体的交互执行与人类价值观的可控对齐性(Alignment)——在安全敏感场景中,Agent的行为必须符合人类的价值观和安全要求。

具身智能与传统AI的对齐问题有本质不同:它不仅要“说对话”,还要“做对事”。在物理世界中执行错误决策可能造成实际伤害,这使得Alignment问题的紧迫性远超数字空间。

从“看到”到“真懂”——物理世界理解的持续进化

当前局限与未来突破方向

当前模型的局限在于:从语言世界到物理世界,停于“看到”不是“真懂”。模型可以识别图像中的物体,但不理解物体的物理属性(重量、材质、摩擦力);可以生成操作指令,但不理解操作的物理后果。

未来突破方向包括:引入更丰富的物理先验知识、建立更好的Sim2Real迁移机制、发展更高效的持续学习方法、构建更完善的评估基准体系。

系列模型成果

报告展示了多个持续迭代的模型成果:Vidman(基于视频扩散模型的机器人操控)、双程认知推理机器人操控模型(NeurIPS 2024)、Learning to See and Act(2025)、Physical Autoregressive Model(2025)、RoVer(2025)。
点击阅读报告原文: 大数据百家讲坛:2026具身智能技术及产业实践的阶段性进展报告(60页)
相关报告