机器人学走路的数据,比ChatGPT学说话的数据少了20,000倍——这不是比喻,是可用量级的真实差距。艺恩数据这份白皮书用一个四层金字塔回答了"数据去哪了":塔尖是真机遥操,最贵最难;塔底是互联网视频,海量但不好用。2026年,行业终于开始正视这个结构性缺口。
20,000倍缺口从何而来
Coatue《The Path to General-Purpose Robots》与中国信通院《具身智能发展报告2025》的数据触目惊心:具身数据与文本数据的可用量级差距约20,000倍。文本数据可以通过互联网爬取获得海量语料——从维基百科到社交媒体,从学术论文到电商评论,大语言模型的训练数据几乎"取之不尽"。但机器人的真实交互数据无法从网络直接获取。一个机器人拿起一杯水、拧开一个瓶盖、在崎岖地面上保持平衡——这些动作的物理数据必须在真实世界中通过真机操作、传感器采集或仿真生成才能得到。
四层金字塔——数据的分层与定价
白皮书提出的具身数据四层金字塔,是理解稀缺性结构的核心框架。
塔尖是真机遥操:VR/动捕操控真机采集,动作-本体天然对齐,质量最高。但成本同样最高——完整遥操设备超20万元,采集速度慢、规模化极难。这一层的数据量最小、价值最高。
第二层是便携采集:可穿戴设备/数据手套实现第一人称采集,比遥操降本约10倍。它石智航的SenseHub、灵初智能的触觉手套属于这一层——保真度接近遥操,成本大幅下降,是质量与规模的平衡层。
第三层是仿真合成:物理引擎加生成式批量造数,覆盖长尾场景,成本仅真机约1/100。光轮智能、群核科技、NVIDIA Cosmos是这一层的代表。仿真可以生成无限量数据,但保真度与真实物理世界仍有差距——Sim2Real鸿沟是核心挑战。
底座是视频蒸馏:从互联网/第一人称视频中提取动作信息,近零成本、海量供给。Meta Ego4D(3670小时第一人称视频)是典型代表。但视频蒸馏的致命短板是缺少动作标签、物理grounding弱——"看到"不等于"做到"。
当前主流的训练范式是以底层海量数据预训练、用顶层稀缺真机数据精调。这一配比逻辑决定了四层数据的定价:塔尖最贵,底座最便宜。
模型路线×数据范式的二维矩阵
"模型怎么学"与"数据怎么来"是两个独立维度。模型架构路线分三类:VLA端到端(π0、GO-1、Helix)、世界模型(NVIDIA Cosmos、World Labs)、分层/双系统(GROOT N1、Helix)。数据获取范式对应四类:真机遥操、便携采集、仿真合成、视频蒸馏。
将四范式放入"成本×保真度"2×2矩阵,定位清晰。真机遥操:高保真×高成本,代表智元数据工厂、帕西尼、ALOHA。便携采集:高保真×中成本,代表它石智航、灵初、UMI。仿真合成:中保真×低成本,代表光轮、群核、跨维。视频蒸馏:低保真×近零成本,代表枢途、Meta Ego4D。
从分模块到世界模型,数据规模经历三级跃迁。2022-2024年分模块阶段:万小时级;2025-2026年VLA阶段:十万至百万小时级;2027+世界模型阶段:千万亿小时级。VLA任务成功率过去三年提升约10倍——数据规模与模型能力的正反馈循环已经启动。
中美数据策略的根本差异
中美两国的数据策略呈现"双轨"格局。美国走"闭源飞轮"——Tesla、Figure、NVIDIA、Scale AI各自建立封闭的数据闭环,自采数据与基础模型一体化。优势是技术壁垒高,劣势是版权诉讼频发、数据获取趋严。
中国走"开放+专业化分工"——光轮、它石、帕西尼、智元数据工厂等独立数据公司沿四范式各自做深。优势是工程化快、采集成本低、场景丰富,且有数据要素政策与国资入场支持。核心差异在于:美国模式更容易形成技术壁垒,中国模式更容易形成数据交易市场。
数据资产化环节的毛利率达60%-70%,显著高于本体硬件。毛利率沿"采集→资产化"链条逐级递增,掌握全链路闭环的数据公司主导利润分配。价值链向上游数据层迁移,本体硬件趋于薄利——这是具身数据市场区别于传统硬件产业的底层经济逻辑。
白皮书同时警示:估值领先于商业化——多数出货流向科研/数采/展示,UBS已警示泡沫风险。但2026年作为具身数据规模化元年的判断已经确立:真机+仿真+视频混合数据正在爆发,DaaS订阅与数据交易加速推进,世界模型成为数据生成新引擎。20,000倍缺口既是挑战,也是机遇。