国信证券2025年2月发布的行业深度报告对空间计算所依赖的核心技术体系进行了全景式剖析。从终端设备的双芯片架构到空间建模的NeRF与3DGS技术迭代,从空间感知的SLAM与三维注册到智能人机交互的多模态融合,报告勾勒出一幅"感知-通信-计算-交互"一体化的技术演进图谱,揭示了空间计算从概念到商用的技术突破路径。
空间计算核心技术体系全景:感知、建模、渲染、交互四大支柱
空间计算技术体系可划分为终端设备、空间建模、空间感知、三维渲染引擎和智能人机交互五大技术模块【7†L25】。终端设备作为硬件载体,涵盖VR、AR、MR等多种形态,通过OST(光学透视)与VST(视频透视)两种技术路径实现虚实融合【7†L31-L33】。空间建模负责数字空间"人、物、场"的构建,涉及数据采集、数据管理和三维重建等关键环节【9†L40-L41】。空间感知通过三维注册和SLAM技术实现虚拟信息与真实空间的精确对齐【14†L25-L27】。三维渲染引擎将数字内容以可视化方式呈现,而智能人机交互则通过手势、眼动、语音、脑机接口等多模态方式实现用户与数字内容的自然互动【17†L28-L30】。五大技术模块相互支撑、协同演进,共同构成了空间计算的技术底座。
空间建模技术——从传统SfM到NeRF与3DGS的范式跃迁
空间三维重建技术经历了从传统方法到深度学习方法的转变。传统方法以运动结构恢复(SfM)和多视角立体视觉(MVS)为核心,通过分析多张图像之间的特征匹配、相机姿态估计和三维点云重建,恢复出稀疏的三维点云,再经MVS稠密化生成高精度三维点云【12†L5-L9】。然而,传统方法在复杂环境下存在精度问题,深度学习虽有所改进,但计算量和内存需求限制了其在高精度重建中的应用【12†L26-L27】。
神经辐射场(NeRF)的出现代表了三维重建技术的范式跃迁。NeRF通过多层感知机(MLP)隐式建模三维空间中的颜色和体积密度,实现了精细的三维重建和视角合成【12†L27-L28】。其技术流程包括:输入多视角图像获取三维坐标和视角信息;用神经网络隐式表示三维空间辐射场并预测颜色和体积密度;通过反向传播算法训练网络参数;最后从特定视角出发利用光线投射和体积渲染技术生成图像,实现三维场景的自由视角渲染【12†L29-L33】。NeRF技术在三维重建中解决了光照变化和纹理缺失等问题,在虚拟现实等领域具有重要应用前景【12†L35-L36】。
3D高斯泼溅(3DGS)技术则因其兼具显式表达、高拟真重建和实时渲染的优势,成为NeRF的潜在替代方案【13†L3-L4】。其流程大致为:首先通过多视角相机或激光扫描收集场景点云数据;然后将点云数据转换为三维高斯椭球以高效表示空间信息;接着通过优化和压缩3D高斯减少数据量并保持视觉效果;最后利用泼溅渲染技术生成高质量三维图像【13†L4-L7】。3DGS技术致力于在资源受限的计算环境中提升三维重建的效率和实时性能,其与SLAM的结合提高了复杂环境下的定位与建图性能【13†L10-L14】。
空间感知技术——三维注册与SLAM构建虚实融合的精准底座
空间感知的关键技术包括三维注册和面向定位的三维重建【14†L25】。三维注册指将虚拟信息精确叠加到真实空间,通过传感器和算法确定虚拟物体在空间中的位置、方向和尺度,保证虚拟与现实的融合【14†L25-L27】。主要技术包括目标追踪和同步定位与建图(SLAM)。目标追踪通过标记物实现位置匹配,而SLAM则利用传感器自主定位并构建环境地图,适用于动态场景【14†L27-L28】。
SLAM技术分为视觉SLAM、视觉惯性SLAM、RGBD-SLAM与LiDAR-SLAM等,多传感器融合方案通过雷达与视觉的互补性增强系统鲁棒性【14†L39-L40】。在大尺度复杂场景下,端侧设备计算资源有限可能导致误差累积与跟踪不稳定,端云协同成为解决方案——通过将复杂计算任务分配给云端,提升端侧定位精度并减少延迟【14†L42-L43】。语义SLAM通过环境物体的语义理解进一步提升定位与地图构建的准确性,并与3DGS-SLAM协同,为大空间导航提供了强有力支持【14†L44-L45】。
面向定位的三维重建通过SfM技术利用多视角图像恢复三维场景,生成精确的点云地图,支持大规模空间的点云融合,为端云融合、多用户交互和XR大空间等应用提供基础【14†L28-L31】。3DGS技术则提供了一种更高效的实时空间感知方案,以低计算代价实现高效的三维场景渲染,特别适用于AR大空间的动态重建和实时交互【14†L47-L49】。
智能人机交互——手势、眼动、语音与脑机接口的多模态融合
空间计算依赖先进的交互技术来增强用户的沉浸感和参与感【17†L28】。手势交互技术主要有数据手套和视觉识别两种——数据手套通过传感器捕捉手部动作并转化为电信号,视觉手势识别则利用摄像头如Kinect和LeapMotion实现【17†L35-L36】。苹果VisionPro和Pico方案基于计算机视觉的手势识别因易用性被广泛采用【17†L37-L38】。
眼动追踪技术可替代瞄准操作,不降低任务表现和舒适度,还能减少身体动作需求【18†L33-L34】。苹果VisionPro、PICO4Pro和索尼PSVR2均已集成眼动追踪功能【19†L18-L19】。眼动交互可实现焦点渲染改善应用性能,但也面临精度不足、渲染伪影、硬件限制、成本与隐私等挑战【19†L19-L23】。
语音交互作为人工智能的重要入口,涵盖语音识别、语义理解和语音合成三大技术模块【20†L14-L15】。基于Transformer的端到端模型提高了语音识别的灵活性和准确性,神经网络TTS如FastSpeech和VALL-E显著提升了合成语音的自然度【20†L24-L25】【21†L4-L5】。结合大模型的"大模型+语音"模式将革命性提升语音技术【21†L16-L17】。
脑机接口(BCI)在VR应用中的前景广阔,但面临信息处理、伦理法律和产业化等多重挑战【21†L31-L34】。多模态交互技术通过整合言语、动作、手写和图像等多种信息通道实现自然高效的互动,正成为空间计算交互技术的集成方向【22†L4-L6】。
空间计算核心技术分类与关键进展| 技术模块 | 核心技术 | 关键进展/代表产品 |
|---|
| 空间计算终端 | 双芯片架构、OST/VST透视 | Apple Vision Pro(M2+R1)、Meta Orion |
| 空间建模 | SfM、MVS、NeRF、3DGS | NeRF解决光照纹理问题,3DGS实现实时渲染 |
| 空间感知 | 三维注册、SLAM、端云协同 | 语义SLAM、3DGS-SLAM协同 |
| 三维渲染引擎 | 云渲染、分布式渲染、端云协同渲染 | Unreal Engine 5、Unity 6 |
| 智能人机交互 | 手势/眼动/语音/BCI/多模态 | Vision Pro眼动追踪、Meta EMG手环 |