全息通信要求传输8K/16K 3D视频流(需100Gbps),同时实时捕捉用户微表情和手势(需亚毫米级感知)。从NeRF的隐式神经渲染到3DGS的实时高斯泼溅,从MPEG-I的标准化压缩到语义编解码的效率跃升——中兴通讯蓝皮书构建了全息通信从采集、压缩、传输到呈现的完整技术栈,揭示了沉浸式体验如何突破带宽与算力的双重瓶颈。
全息呈现的技术路径:从光学全息到计算全息
蓝皮书明确指出,产业界常提及的“全息通信”与物理学概念上的“光学全息”存在本质区别。光学全息利用光的干涉和衍射原理直接记录并再现物体完整波前信息,是三维显示的终极形态,但在现阶段极难商业化——物理再现高质量全息图要求显示面板像素间距达到亚波长级别,实时生成计算全息图所需的数据传输率和算力远超现有技术极限。
因此,3GPP、ITU等通信标准组织在讨论“全息通信”时,实际上是指通过高维度的三维数据采集、传输与计算机图形学渲染,在视觉体验上提供沉浸感的媒体技术。其实质是以三维点云和密集光场阵列为代表的媒体形态,支持六自由度(6DoF)视角交互,用户可以在虚拟空间内自由改变位置与视线。
三维重建:NeRF、3DGS与4DGS的技术谱系
神经辐射场(NeRF)使用神经网络隐式表达3D场景,将场景建模为连续的5D辐射场隐式存储在神经网络中,只需输入稀疏的多角度带姿态的图像即可渲染任意视角下的清晰照片。3D高斯泼溅(3DGS)是一种基于高斯分布的点云表示与渲染技术,在同等画质下可实现100FPS以上的实时渲染速率,较NeRF提升2-3个数量级,训练时间约20-30分钟(单GPU),显著优于NeRF的数小时训练周期。
4DGS在传统3DGS基础上引入时间维度,用于高效表示和渲染动态场景——将每个高斯椭球体在时空四维空间中建模,实现对动态场景的连续建模与渲染。Streaming GS针对持续输入的视频流实现在线流式重建,采用前馈推断与增量更新相结合的全新范式,能够随视频流输入逐帧生成GS流,实现了从“离线全局优化”到“在线即时生成”的跨越。可驱动高斯(Mesh-Gaussian混合表示)以网格作为稳定的几何骨架,通过骨骼动画、表情参数驱动网格形变,再同步传递至附着其上的高斯分布,成为数字人、虚拟角色的关键技术路径。
MPEG-I:沉浸式媒体的标准化底座
MPEG-I(ISO/IEC 23090系列)正在构建完整的沉浸式媒体技术栈。OMAF(全向媒体格式)定义统一投影格式与分片传输框架,解决3DoF全景视频问题。MIV(MPEG沉浸式视频)利用多视角视频与深度图,支持解码端实时渲染任意3DoF+视角。V-PCC(基于视频的点云压缩)采用“化3D为2D”思路,将点云投影为2D图集,利用成熟2D视频编码器实现高效压缩。G-PCC(基于几何的点云压缩)坚持原生3D处理范式,支持无损或近无损压缩,重建几何结构极其精确。V-DMC(基于视频的动态网格编码)为动态3D角色提供专用压缩标准,采用UV参数化将动态网格属性转换为2D纹理视频,已进入最终国际标准草案阶段。
通感一体化:全息通信的频谱底座
全息通信的实时传输依赖于毫米波、太赫兹与可见光的“黄金三角”频谱协同。太赫兹频段提供超宽带(Tbps级)传输高保真全息数据流;可见光(Li-Fi)进行高精度面部和手部动作捕捉,解析微米级皮肤纹理变化;毫米波作为控制信令通道和备用链路。多频段ISAC的技术突破包括异构频谱融合的一体化波形设计、多模态感知融合与AI原生智能、智能超表面与动态波束管理、近场通信感知与硬件创新。