采集机器人数据有四种方式,成本差了100倍,保真度也差了100倍——选错范式,可能烧掉几个亿还采不到可用数据。艺恩数据这份白皮书把四范式放在一个2×2矩阵里对比,并给出了18家公司的归类图谱。核心判断是:没有最优范式,只有最适合当前阶段的范式组合。
四范式定义与定位
具身数据的获取方式可划分为四类,每一类在成本、保真度、可规模化和技术成熟度上各有不同。
真机遥操(范式①):通过VR/动捕操控真机采集数据,动作与本体天然对齐,是保真度最高的范式。但完整遥操设备超20万元,采集速度慢,规模化极难。代表公司包括帕西尼感知、诺亦腾、智元数据工厂、ALOHA。
便携采集(范式②):可穿戴设备/数据手套实现第一人称采集,比遥操降本约10倍。保真度接近遥操,但硬件成本和采集效率大幅优化。代表公司包括它石智航(SenseHub·AWE3.0)、灵初智能(62+自由度触觉手套,累计10万小时数据)、UMI。
仿真合成(范式③):物理引擎加生成式批量造数,覆盖长尾场景,成本仅真机约1/100。可无限量生成数据,但保真度与真实物理世界有差距。代表公司包括光轮智能(SimReady·RoboFinals)、群核科技(SpatialVerse)、跨维智能(DexVerse·3D VLA)、NVIDIA Cosmos。
视频蒸馏(范式④):从互联网/第一人称视频中提取动作信息,近零成本、海量供给。但缺少动作标签、物理grounding弱。代表公司包括枢途科技、深度机智、Meta Ego4D、1XWM。
2×2矩阵与四层金字塔
将四范式放入"成本×保真度"2×2矩阵:真机遥操=高保真×高成本;便携采集=高保真×中成本;仿真合成=中保真×低成本;视频蒸馏=低保真×近零成本。
具身数据按"保真度←→规模/成本"自然分层为四层金字塔。塔尖是真机遥操——最贵、最难规模化;第二层便携采集——质量与规模的平衡点;第三层仿真合成——成本低、覆盖长尾;底座视频蒸馏——海量但grounding弱。当前主流训练范式是以底层海量数据预训练、用顶层稀缺真机数据精调。
这一分层决定了不同范式在不同训练阶段的价值权重。预训练阶段,仿真合成和视频蒸馏的性价比最高;精调阶段,真机遥操和便携采集不可或缺。
18家公司全景归类
真机遥操:帕西尼感知(6D触觉传感+采集工厂,B轮超10亿元,估值破百亿)、诺亦腾(动捕遥操,全球动捕份额超50%)。
便携采集:它石智航(SenseHub·AWE3.0,Pre-A $4.55亿,估值约130亿元)、灵初智能(62+自由度触觉手套,累计超20亿元)。
仿真合成:光轮智能(SimReady·RoboFinals,10亿元,全球首个具身数据独角兽)、群核科技(SpatialVerse,已上市00068.HK)、跨维智能(DexVerse·3D VLA,A1及A2轮数亿元)。
视频蒸馏:枢途科技(天使+数千万元)、深度机智(新一轮2026)。
交叉领域(世界模型/基础模型):World Labs(美国,估值约$50亿)、NVIDIA Cosmos(开源)、Meta Ego4D(开源)、极佳视界GigaAI(中国,Pre-B 10亿元)、LiberAI(中国,数亿元)。
白皮书特别说明:通用AI数据标注公司如Scale AI、Surge、海天瑞声等不在本榜——它们服务于大语言模型而非具身智能专有数据。
四范式护城河对比
仿真合成:规模与成本最优。可无限量生成数据,覆盖长尾场景,成本仅真机约1/100。但保真度待补——Sim2Real鸿沟仍是核心挑战。光轮智能验证了这一范式可规模化、可独立估值。
真机遥操:保真度最高,但规模化最难。动作-本体天然对齐是最大优势,但设备成本超20万元、采集速度慢。帕西尼和诺亦腾在这一范式上构筑了触觉传感和动捕的技术壁垒。
便携采集:保真度与成本的平衡点。降本约10倍的同时保持高保真,是当前最具性价比的范式。它石智航和灵初智能在可穿戴和数据手套方向上持续深耕。
视频蒸馏:成本最低,但grounding是关键瓶颈。"看到"不等于"做到"——从视频中提取可执行的动作指令,需要强大的模型能力支撑。枢途科技和Meta Ego4D正在攻克这一难题。
四范式的护城河各有不同,不存在"最优范式"——只有"最适合当前阶段"的范式组合。头部公司的通行策略是:以合成数据做大底座,以真机数据做精调,以视频数据做预训练,三种范式混合使用。