ECCV 2026 | ETH&Meta提出Map-Det3D:前馈3D
创始人
2026-08-17 18:28:58
0

“横看成岭侧成峰,远近高低各不同”——单张 RGB 图像因缺乏绝对深度与物理尺度,让感知系统在三维物理世界中宛如“盲人摸象”。传统的“先 2D 检测再估计 3D 属性”范式在遇到相机内参变化或场景迁移时极易预测失真。

为了打破这一“尺度困局”,苏黎世联邦理工学院、Meta Reality Labs 与波恩大学团队提出了 Map-Det3D。它将 MapAnything 前馈 3D 重建(FF3R)先验直接注入检测 Transformer,彻底抛弃脆弱的 2D-to-3D 提升范式,在重建的 3D 空间中直接回归目标框。

Map-Det3D 展现出惊人的性能:在 CA-1M 域内测试中达到 16.9 AP25,远超经典单目 Baseline;在 ScanNet200 零样本跨域评估中斩获 15.2 AP159.7 AP25;在 ScanNetV2 场景级无深度传感器感知中更创下 27.6 AP15 的 SOTA 纪录,实现了纯视觉 3D 感知的高精度与强泛化。

  • 论文标题: Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs
  • 论文地址: https://arxiv.org/abs/2608.12179
  • 项目主页: https://royyang0714.github.io/Map-Det3D
  • 代码仓库: https://github.com/cvg/map-det3d
  • 录用信息: ECCV 2026

背景与动机:单目 3D 检测的「尺度困局」

对于单目或视频流 3D 检测,核心难点在于深度与绝对尺度的固有二义性与欠约束。在单张图像中,一个离相机很近的小物体与一个离相机很远的大物体在成像平面上完全相同。以往的单目 3D 检测模型(如 Cube R-CNN、CuTR 等)尝试依赖网络强行记忆图像属性与深度的映射关系。这种先验对于训练集分布内的场景尚可维持,但面对不同的相机硬件或未经见过的室内格局时,极易发生预测崩溃。

与单目方法不同,多视图几何(Multi-view Geometry)能够通过跨视角的视差约束消除单视角多义性。近期发展迅速的前馈 3D 重建模型(Feed-Forward 3D Reconstruction, FF3R),如 MapAnything、VGGT 等,展现出强大的几何与位姿推断能力,且能够显式地预测解耦的全局度量尺度因子(Metric Scale Factor)。

将 FF3R 的全局几何先验作为主干网络,直接在重构的 3D 空间中进行目标检测,既避免了深度传感器的硬件依赖,又从根本上解除了 2D 图像平面上的尺度束缚。

核心方法详解:引入 3D 重建先验与无尺度预测头

架构总览

Map-Det3D 的整体架构如上图所示。模型以滑动窗口(Sliding Window)的方式因果式处理视频流,将短时序帧视为多视图输入,利用 MapAnything 提取几何先验,并结合全新的无尺度 3D 预测头生成 3D 目标框。

重建先验与编码器:MapAnything 赋能

image.png

突破范式:Up-to-scale 无尺度 3D 边界框预测头

检测架构细节

image.png

这种将几何形状预测与物理尺度解耦的设计,使得网络能够专注于学习物体的相对形态结构,而将绝对尺度交由 FF3R 先验统一把控。

时序流式推理与训练策略

image.png

实验与结果:域内刷新记录,零样本跨域强劲泛化

Map-Det3D 在大规模室内数据集 CA-1M(包含超 40 万独立 3D 物体、1300 万训练帧)上完成训练,并在 CA-1M 验证集及 ScanNet200 零样本泛化测试集上进行了定量与定性评估。

CA-1M 域内评估

CA-1M实验对比

image.png

ScanNet200 零样本跨域泛化

ScanNet200零样本对比

image.png

ScanNetV2 场景级在线追踪融合

场景级评估

image.png

定性可视化表现

ScanNet数据集定性可视化对比

如上图可视化结果所示,在面对未见过的复杂室内场景时,基线单目方法普遍存在严重的深度漂移与尺寸失真,预测框往往悬空或陷入墙体;而 Map-Det3D 预测的 3D 边界框不仅位置贴合度高,尺寸与姿态也与真实场景点云紧密契合。

一点思考

Map-Det3D 的成功验证了一个关键思路:与其逼迫单目网络在 2D 图像平面死记硬背绝对深度,不如将前馈 3D 重建模型作为几何度量先验,将“绝对尺度估计”与“相对几何形态预测”显式解耦。这种设计巧妙地避开了单目检测中最脆弱的环节,使得纯 RGB 3DPerception 向真实物理世界的稳健迁移迈出了重要一步。

当前 Map-Det3D 主要关注类别无关(Class-Agnostic)的 3D 几何边界框预测。展望未来,若能将视觉语言大模型(VLM)与这种强健的 3D 几何骨干相结合,进一步打通 Open-Vocabulary 语义理解,必将为具身智能体与 AR 设备的室内全景感知带来更大的想象空间。

相关内容

怎么给文件加密?8 款真好...
不少职场人误传内部文件,造成公司业务损失。 纠结怎么给文件加密的朋...
2026-09-08 19:58:18
华夏银行东莞分行深度参与镇...
近期,东莞市某镇街控股企业首单科技创新公司债券面向专业投资者非公开...
2026-09-08 19:56:21
原创 ...
如果你能穿越回19世纪中叶的欧洲,那么当您走进任何一家农业用品商店...
2026-09-08 17:48:16
贵阳贵安“全链协同”打造区...
近年来,贵阳贵安充分发挥在大数据和区块链领域基础好、起步早的带头优...
2026-09-08 16:29:44
重庆黄金回收怎么选?202...
前言|2026两江新区黄金变现现状,新手避坑甄选指南 近两年重庆黄...
2026-09-08 13:17:31
欧洲多国,接连移走北美黄金...
据BBC中文网7日报道,荷兰中央银行上周证实,已将数十吨黄金从北美...
2026-09-08 12:20:32

热门资讯

期权看涨 ETF 流入,现货卖... 据 Woofun AI 消息,比特币价格徘徊于 78,800 美元附近,此前多次尝试站稳 80,00...
日本8月货币供应M2同比增长2... 钛媒体App 9月9日,日本8月货币供应M2同比增长2%,前值2.20%。(广角观察)
空头平仓推升 BTC,反弹空间... 据 Woofun AI 消息,Two Prime 首席执行官亚历山大·布卢姆 (Alexander ...
日本8月货币供应M2同比增长2... 每经AI快讯,9月9日消息,日本8月货币供应M2同比增长2%,前值2.20%。 每日经济新闻
大量黄金,正从美国运出! 今年以来,欧洲部分国家先后缩减在美黄金储备规模。市场分析认为,这是出于对黄金存放地安全以及规避地缘政...
晶科科技拟出资2亿元参投AI领... 上证报中国证券网讯(记者 王凯丰)晶科科技9月8日晚公告称,公司拟以自有资金认缴出资人民币2亿元,参...
南华期货股份(02691)9月... 智通财经讯,南华期货股份(02691)发布公告,于2026年9月8日该公司斥资约222.22万港元回...
原创 济... 近日,济南财金集团参股基金——济南二机床链和产业投资基金完成对英孚康(浙江)工业技术有限公司战略投资...
钯金期货日内跌2%,现报137... 每经AI快讯,9月8日,钯金期货日内跌2%,现报1375.00美元/盎司。 每日经济新闻
完美世界:拟出资5000万元认... 人民财讯9月8日电,完美世界(002624)9月8日公告,公司拟出资5000万元作为有限合伙人,认购...