深度估计:从2D图像还原3D空间信息的技术全解析
引言:为什么单张图片能“变”出深度?
人类视觉系统拥有一个令人惊叹的能力:即使闭上一只眼睛,我们依然能准确地判断物体的远近、抓取眼前的杯子、避开前方的障碍物。这种单目视觉下的空间感知能力,源于我们大脑经过亿万年进化形成的先验知识——我们知道远处的物体看起来更小,知道遮挡关系暗示着前后顺序,知道纹理梯度变化反映了表面走向。
然而,让计算机具备同样的能力,却是一个极具挑战性的“病态问题”(ill-posed problem)。从数学上讲,无数个不同的三维场景可能投影出完全相同的二维图像——远处的真实大树和近处的小模型树在照片中可能一模一样。深度估计的任务,正是要从这种模棱两可的二维信息中,还原出每个像素距离相机的真实距离。
近年来,随着深度学习的爆发式增长,单目深度估计(Monocular Depth Estimation, MDE)技术取得了令人瞩目的突破。这项技术正在自动驾驶、机器人导航、增强现实、医学影像乃至电影制作等领域发挥着越来越关键的作用。本文将全面梳理单目深度估计的技术脉络,从传统方法到深度学习,从有监督学习到自监督范式,从相对深度到度量深度,带您走进这个让计算机拥有“第三只眼”的迷人领域。

一、深度估计:从二维到三维的跨越
1.1 什么是深度估计?
深度估计的核心任务,是从输入的二维图像 I ∈ R^(H×W×3) 中,预测对应的深度图 D ∈ R^(H×W),其中每个深度值 d_ij 表示图像像素 (i,j) 到相机的物理距离。这个看似简单的映射关系,却是计算机视觉中最基础也最困难的问题之一。
深度图本身是一种极为丰富的信息载体。在自动驾驶场景中,深度图告诉系统前方车辆是50米还是100米;在增强现实中,深度信息决定了虚拟物体应该被放置在真实物体的前面还是后面;在三维重建中,深度图是连接二维图像与三维模型的桥梁。
1.2 深度估计的应用版图
深度估计技术的应用场景之广泛,令人惊叹。在自动驾驶领域,单目深度估计是实现纯视觉感知方案的核心技术之一。特斯拉的Full Self-Driving系统就是典型代表——它仅依靠摄像头输入,通过深度估计理解障碍物的距离,大大降低了对昂贵激光雷达的依赖。据研究统计,单目深度估计在自动驾驶中的应用涵盖碰撞避免、3D场景重建、交通标志识别、泊车辅助、车道保持等六大关键场景。
在增强现实和虚拟现实领域,深度估计支持精确的场景建模与交互,实现虚拟物体的物理遮挡与光照一致性渲染,大幅提升用户的沉浸体验。当你在手机上使用虚拟试妆应用时,背后的深度估计算法正在实时追踪你的面部轮廓,确保口红精准地“贴合”在嘴唇上。
医学影像是另一个重要的应用领域。从内窥镜图像中估计深度,可以帮助外科医生更好地理解病灶的空间位置。此外,深度估计还在机器人导航、农业自动化、影视制作、甚至视障人士辅助系统中发挥着重要作用。
1.3 技术的演进脉络
深度估计技术的发展可以大致划分为三个阶段。早期主要依赖硬件传感器,如微软Kinect v1使用的结构光技术,或是飞行时间(Time of Flight)相机。这类方法在受控环境下精度较高,但硬件成本高、对环境敏感、且难以在室外强光下工作。
第二阶段是基于几何原理的传统计算机视觉方法,包括立体视觉、运动恢复结构(Structure from Motion, SfM)、明暗恢复形状(Shape from Shading)等。这些方法虽然无需专用硬件,但在弱纹理、遮挡等情况下表现不佳。
第三阶段是深度学习的崛起。2014年,Eigen等人首次将卷积神经网络引入深度估计任务,开启了这一领域的新纪元。此后,从有监督学习到自监督学习,从卷积神经网络到Transformer,从相对深度到度量深度,技术迭代的速度令人目不暇接。
二、技术分类:从监督信号的角度看深度估计
根据训练过程中使用的监督信号类型,单目深度估计方法可以分为三大类:有监督学习、无监督/自监督学习、以及半监督学习。
2.1 有监督学习:依赖真值的方法
有监督学习是最直接的深度估计范式。模型在大量配对的RGB图像和对应的深度真值上进行训练,学习从图像到深度图的映射函数。
网络结构的演进。早期的有监督方法多采用编码器-解码器架构。编码器(如ResNet、DenseNet、VGG)逐步提取图像的深层特征,同时降低空间分辨率;解码器则将这些特征逐步上采样,恢复出与输入图像同分辨率的深度图。这种架构的优势在于可以充分利用在ImageNet上预训练的骨干网络,实现知识迁移。
然而,简单的编码器-解码器结构往往难以捕捉多尺度的上下文信息。为此,研究人员引入了多种增强模块。空洞空间金字塔池化(Atrous Spatial Pyramid Pooling, ASPP)通过不同膨胀率的空洞卷积,在同一层特征图上捕获不同尺度的感受野。场景解析金字塔(Pyramid Scene Parsing, PSP)则通过对特征图进行不同尺度的池化操作,聚合全局上下文信息。
注意力机制的引入。注意力机制已成为提升深度估计精度的关键技术。卷积块注意力模块(Convolutional Block Attention Module, CBAM)从通道和空间两个维度生成注意力图,让网络更关注信息量大的区域。有研究提出了一种结合CBAM和改进的全局上下文网络的架构,在编码器和解码器中分别集成注意力模块,显著提升了估计精度。
深度离散化策略。将连续的深度值离散化为若干个区间,再预测每个像素属于哪个区间,是另一种有效的方法。Fu等人提出的间距递增离散化(Spacing-Increasing Discretization, SID)策略,考虑到深度值越大,微小误差的影响越小,因此在近处使用更密集的区间划分,远处则相对稀疏。这种方法将深度估计转化为有序回归问题,更符合深度的自然分布特性。
损失函数的设计。有监督深度估计的损失函数通常需要同时考虑像素级精度和图像级结构。常见的损失包括绝对值相对误差(Absolute Relative Error)、均方根误差(Root Mean Square Error)等。近期研究提出了一种结合结构相似性指数(Structure Similarity Index Measure, SSIM)和尺度不变误差(Scale-Invariant Error, SIE)的新型损失函数,在像素级和图像级两个层面优化预测结果,取得了更好的边缘保持效果。
2.2 无监督与自监督学习:摆脱真值依赖
尽管有监督学习方法精度高,但其对大量高质量深度真值的依赖成为致命短板。获取密集、准确的深度真值成本高昂——激光雷达采集的数据稀疏且有噪声,ToF相机受环境光影响大,人工标注几乎不可能。正是在这一背景下,无监督和自监督学习方法应运而生。
核心思想:视角合成作为监督信号。自监督深度估计的核心思想是利用图像重建作为代理任务。具体而言,如果已知一张图像的深度图,以及相邻视角间的相机位姿,理论上可以将其像素“投影”到相邻视角中,重建出相邻视角的图像。重建图像与真实图像之间的差异(即光度一致性损失)便可以作为训练深度估计网络的监督信号。
这一范式最早由Zhou等人于2017年在《Unsupervised Monocular Depth Estimation with Left-Right Consistency》中提出,开创了自监督深度估计的新方向。此后,该领域的研究呈现出百花齐放的态势。
五大技术方向。蔡嘉诚等人的综述将无监督单目深度估计归纳为五大技术流派:
第一,结合可解释性掩膜的方法。由于运动物体(如行人、车辆)和遮挡区域不满足光度一致性的基本假设,这些区域的重建误差会误导训练。可解释性掩膜通过学习一个掩膜图,降低这些区域的损失权重,提升模型的鲁棒性。
第二,结合视觉里程计的方法。早期的自监督方法往往需要已知的相机位姿。视觉里程计网络的引入,使得模型能够在估计深度的同时,也估计相邻帧之间的相对位姿,实现了端到端的联合训练,进一步摆脱了对位姿真值的依赖。
第三,结合先验辅助信息的方法。利用语义分割、边缘检测等辅助任务与深度估计共享特征,可以在不增加标注成本的情况下提升深度估计的精度。因为不同任务之间存在内在关联——物体边界往往也是深度不连续的位置。
第四,结合生成式对抗网络的方法。生成对抗网络的引入,旨在解决深度图的真实性问题。判别器可以区分预测深度图和真实深度图的分布差异,促使生成器产生更自然、更逼真的深度图。
第五,实时轻量级网络的研究。面向移动端和嵌入式设备的应用需求,如何在保持精度的同时大幅降低计算量成为一个重要研究方向。轻量化设计、知识蒸馏、神经架构搜索等技术被广泛应用于这一方向。
2.3 半监督学习:兼顾精度与成本
半监督学习试图在有监督和无监督之间寻找平衡点。它利用少量带标注的数据保证精度,同时利用大量无标注数据通过无监督损失(如光度一致性)提升泛化能力。这种范式在实际工程应用中具有重要价值,因为完全无监督的方法在某些场景下可能精度不足,而纯粹有监督的成本又难以承受。
三、从相对深度到度量深度:零样本泛化的挑战
3.1 相对深度 vs. 度量深度
传统的单目深度估计方法通常只能预测相对深度——即场景中各物体远近的顺序关系,但无法给出具体的物理距离值。这在很多应用中是不够的。自动驾驶需要知道前方车辆是10米还是20米,增强现实需要虚拟物体以真实尺寸呈现在正确位置。
相对深度方法的局限性在于尺度模糊性。由于单张图像丢失了绝对尺度信息,同一个场景的不同缩放版本可能对应完全相同的图像。因此,传统MDE方法预测的深度图往往存在尺度不一致的问题——同一模型在不同图像上的输出尺度可能漂移,无法直接用于需要绝对距离的下游任务。
3.2 度量深度估计的兴起
单目度量深度估计(Monocular Metric Depth Estimation, MMDE)应运而生,其目标是预测包含绝对尺度信息的深度图。这一任务对模型的泛化能力和精度提出了更高要求,因为模型不仅要理解场景的几何结构,还要推断出真实的物理尺度。
张久伶等人的综述指出,MMDE在近年取得了显著进展,工业界如Intel、Apple、DeepMind、TikTok等公司纷纷发表了相关研究成果。这一趋势反映出下游应用对度量深度信息的强烈需求。
3.3 零样本泛化:迈向通用深度模型
零样本泛化能力是指模型在训练时从未见过的数据集或场景类型上,依然能够保持较好的预测性能。这被认为是衡量深度估计模型通用智能的重要指标。
尺度无关方法的贡献。尺度无关(scale-agnostic)方法为零样本MMDE奠定了基础。这类方法在训练时忽略绝对尺度,专注于学习相对深度的分布特征。在此基础上,通过引入额外的尺度校准模块或利用大尺度预训练,可以实现对新场景的零样本度量深度估计。
核心挑战与创新路径。当前零样本MMDE面临三大挑战:泛化能力不足、边缘细节丢失、以及小物体的深度预测不准。针对这些问题,研究社区探索了多种创新路径:
-
无标数据扩充:利用未标注的数据通过自监督方式适应新场景。
-
图像分块策略:将图像划分为局部块分别处理,增强模型对细节的捕捉能力。
-
模型结构优化:设计更适合跨场景泛化的网络架构。
-
生成式方法的融合:利用扩散模型等生成式技术提升深度图的真实性和连续性。
值得注意的是,CVPR从2023年起连续三年举办单目深度估计挑战赛,零样本度量深度估计已成为竞赛的核心任务之一,反映出学术界对这一方向的高度重视。
四、数据集与评价指标
4.1 主流数据集
深度估计的研究进展与数据集的发展密不可分。以下是几个最具代表性的数据集:
NYU Depth V2:由纽约大学发布的室内场景数据集,包含464个场景的1449对密集标注的RGB-D图像,以及海量的未标注视频序列。它是评估室内深度估计性能的基准数据集。
KITTI:由卡尔斯鲁厄理工学院和丰田工业大学联合发布,是自动驾驶场景最权威的数据集。包含街道、城市、乡村等多种道路场景,通过激光雷达采集稀疏深度真值。
SUN RGB-D:包含超过10000张RGB-D图像,涵盖室内场景的多样性,包括卧室、客厅、办公室、餐厅等。
Make3D:早期的深度估计数据集,包含户外场景的激光雷达扫描数据。
4.2 评价指标
深度估计领域使用多种评价指标从不同维度衡量算法性能:
误差指标(越小越好):
-
绝对值相对误差(Abs Rel):预测深度与真值之差的绝对值除以真值
-
均方根误差(RMSE):预测深度与真值之差的均方根
-
平方相对误差(Sq Rel):预测深度与真值之差的平方除以真值
-
对数均方根误差(RMSE log):对数空间下的均方根误差
精度指标(越大越好):
-
阈值精度(δ < 1.25, 1.25², 1.25³):预测深度与真值之比在给定阈值内的像素比例
这些指标共同构成了深度估计模型性能的全面画像。值得注意的是,不同应用场景对指标的侧重点不同——自动驾驶可能更关注大误差的控制,而增强现实可能更在意边缘的清晰度。
五、前沿进展与未来方向
5.1 当前研究热点
Transformer架构的渗透。Transformer及其变体正在深度估计领域攻城略地。Swin Transformer等架构能够有效捕捉长距离依赖关系,这对于理解场景的整体布局至关重要。AdaBins首次将视觉Transformer引入深度估计,通过自适应分箱策略大幅提升精度。
迭代精细化策略。针对深度估计中常见的边缘模糊和深度不连续问题,迭代精细化策略展现出巨大潜力。Umirzakova等人提出的迭代弹性分箱(Iterative Elastic Bins, IEBins)方法,根据场景的深度不确定性反复精细化深度预测箱,显著改善了复杂几何形状和遮挡场景下的估计精度。
生成式模型的应用。扩散模型正在为深度估计带来新思路。通过生成式方式建模深度分布的多样性,可以有效应对深度估计的病态性。陈超平等人的综述指出,扩散模型和多教师蒸馏框架显著提升了弱纹理区域的深度连续性。
5.2 未来研究方向
综合多篇最新综述的观点,单目深度估计的未来发展呈现以下趋势:
多传感器融合。单一传感器的局限性决定了多模态融合的必然性。如何将相机与低成本雷达、惯性测量单元(IMU)甚至4D成像雷达高效融合,是提升深度估计鲁棒性的关键。
轻量化与边缘计算。面向移动设备和嵌入式平台,设计计算高效的深度估计模型具有重要应用价值。神经架构搜索、知识蒸馏、量化感知训练等技术将在这一方向发挥重要作用。
跨模态评估基准。目前缺乏统一的跨模态评估标准。构建能够公平比较不同方法、不同传感器配置的评估基准,将推动技术的规范化发展。
物理可逆渲染。将深度估计与可微渲染相结合,实现从图像到三维的端到端可逆映射,有望突破当前方法的精度上限。
神经符号计算的融合。随着神经符号计算等范式的发展,深度估计有望从单纯的几何重建向物理属性推理跃迁,最终实现“所见即所得”的沉浸式体验。
结语
单目深度估计技术走过了一条从几何先验到数据驱动、从有监督到自监督、从相对深度到度量深度的演进之路。这条路见证了深度学习带来的革命性突破,也反映出学术界和工业界对让计算机真正理解三维世界的持续追求。
今天,最先进的模型已经能够在零样本条件下对未见过的场景进行相对准确的度量深度估计;轻量化网络可以在移动端实时运行;Transformer和扩散模型正在为这一领域注入新的活力。展望未来,随着多模态融合、物理可逆渲染等方向的发展,我们有理由相信,计算机的“第三只眼”将变得越来越敏锐,最终能够像人类一样,仅凭单目视觉就能精确感知世界的深度。
参考文献
[1] 吴一全, 谢浩博. 基于深度学习的单目深度估计方法综述[J]. 光学学报(网络版), 2025, 2(13): 1305001.
[2] A new methodology for monocular depth estimation with attention mechanisms[J]. Integrated Computer-Aided Engineering, 2025, 32(2): 158-175.
[3] 蔡嘉诚, 董方敏, 孙水发, 等. 无监督单目深度估计研究综述[J]. 计算机科学, 2024, 51(2): 117-134.
[4] 张久伶, 朱美玲, 徐馨润, 等. 单目度量深度估计综述[J]. 计算机系统应用, 2025, 34(8): 1-13.
[5] Enhanced monocular depth estimation using novel scale-invariant Error Structure Similarity Index measure optimization[J]. J. Vis. Commun. Image R., 2025.
[6] A systematic review of monocular depth estimation for autonomous driving: Methods and dataset benchmarking[J]. Green Energy and Intelligent Transportation, 2025.
[7] 陈超平, 等. 单目与双目深度估计技术演进及其三维显示应用[J]. 红外与激光工程, 2025, 54(7): 20250157.
[8] A Survey on Self-Supervised Monocular Depth Estimation Based on Deep Neural Networks[J]. IEEE Transactions on Neural Networks and Learning Systems, 2025, 36(9): 15622-15642.
[9] Umirzakova S, Mardieva S, Muksimova S, et al. Iterative contextual and adaptive strategies for enhanced monocular depth estimation[J]. Engineering Applications of Artificial Intelligence, 2025.
更多推荐

所有评论(0)