
“横看成岭侧成峰,远近高低各不同”——单张 RGB 图像因缺乏绝对深度与物理尺度,让感知系统在三维物理世界中宛如“盲人摸象”。传统的“先 2D 检测再估计 3D 属性”范式在遇到相机内参变化或场景迁移时极易预测失真。
为了打破这一“尺度困局”,苏黎世联邦理工学院、Meta Reality Labs 与波恩大学团队提出了 Map-Det3D。它将 MapAnything 前馈 3D 重建(FF3R)先验直接注入检测 Transformer,彻底抛弃脆弱的 2D-to-3D 提升范式,在重建的 3D 空间中直接回归目标框。
Map-Det3D 展现出惊人的性能:在 CA-1M 域内测试中达到 16.9 AP25,远超经典单目 Baseline;在 ScanNet200 零样本跨域评估中斩获 15.2 AP15 与 9.7 AP25;在 ScanNetV2 场景级无深度传感器感知中更创下 27.6 AP15 的 SOTA 纪录,实现了纯视觉 3D 感知的高精度与强泛化。

对于单目或视频流 3D 检测,核心难点在于深度与绝对尺度的固有二义性与欠约束。在单张图像中,一个离相机很近的小物体与一个离相机很远的大物体在成像平面上完全相同。以往的单目 3D 检测模型(如 Cube R-CNN、CuTR 等)尝试依赖网络强行记忆图像属性与深度的映射关系。这种先验对于训练集分布内的场景尚可维持,但面对不同的相机硬件或未经见过的室内格局时,极易发生预测崩溃。
与单目方法不同,多视图几何(Multi-view Geometry)能够通过跨视角的视差约束消除单视角多义性。近期发展迅速的前馈 3D 重建模型(Feed-Forward 3D Reconstruction, FF3R),如 MapAnything、VGGT 等,展现出强大的几何与位姿推断能力,且能够显式地预测解耦的全局度量尺度因子(Metric Scale Factor)。
将 FF3R 的全局几何先验作为主干网络,直接在重构的 3D 空间中进行目标检测,既避免了深度传感器的硬件依赖,又从根本上解除了 2D 图像平面上的尺度束缚。

架构总览
Map-Det3D 的整体架构如上图所示。模型以滑动窗口(Sliding Window)的方式因果式处理视频流,将短时序帧视为多视图输入,利用 MapAnything 提取几何先验,并结合全新的无尺度 3D 预测头生成 3D 目标框。
重建先验与编码器:MapAnything 赋能

突破范式:Up-to-scale 无尺度 3D 边界框预测头

检测架构细节

这种将几何形状预测与物理尺度解耦的设计,使得网络能够专注于学习物体的相对形态结构,而将绝对尺度交由 FF3R 先验统一把控。
时序流式推理与训练策略

Map-Det3D 在大规模室内数据集 CA-1M(包含超 40 万独立 3D 物体、1300 万训练帧)上完成训练,并在 CA-1M 验证集及 ScanNet200 零样本泛化测试集上进行了定量与定性评估。
CA-1M 域内评估

CA-1M实验对比

ScanNet200 零样本跨域泛化

ScanNet200零样本对比

ScanNetV2 场景级在线追踪融合

场景级评估

定性可视化表现

ScanNet数据集定性可视化对比
如上图可视化结果所示,在面对未见过的复杂室内场景时,基线单目方法普遍存在严重的深度漂移与尺寸失真,预测框往往悬空或陷入墙体;而 Map-Det3D 预测的 3D 边界框不仅位置贴合度高,尺寸与姿态也与真实场景点云紧密契合。
Map-Det3D 的成功验证了一个关键思路:与其逼迫单目网络在 2D 图像平面死记硬背绝对深度,不如将前馈 3D 重建模型作为几何度量先验,将“绝对尺度估计”与“相对几何形态预测”显式解耦。这种设计巧妙地避开了单目检测中最脆弱的环节,使得纯 RGB 3DPerception 向真实物理世界的稳健迁移迈出了重要一步。
当前 Map-Det3D 主要关注类别无关(Class-Agnostic)的 3D 几何边界框预测。展望未来,若能将视觉语言大模型(VLM)与这种强健的 3D 几何骨干相结合,进一步打通 Open-Vocabulary 语义理解,必将为具身智能体与 AR 设备的室内全景感知带来更大的想象空间。
