)
EmbodiedScan多视角3D检测实战从零训练你的第一个检测模型附完整命令【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScanEmbodiedScan 是面向具身智能Embodied AI的多模态 3D 感知数据集与基准而多视角3D检测正是它的核心任务之一模型从第一人称 RGB-D 序列中还原场景里每个物体的 3D 包围框与类别。这篇实战教程将带你从环境安装、数据准备到3D检测模型训练命令一键跑通即使你是第一次接触 3D 视觉也能在 30 分钟内启动自己的训练任务。EmbodiedScan 是什么为什么多视角3D检测值得学习想象一下机器人戴着一台相机走进客厅它需要一边移动一边理解沙发在哪、茶几在哪个方向、它离我多远——这就是多视角3D检测要解决的问题。传统 3D 检测往往依赖全局点云而 EmbodiedScan 更贴近真实世界以第一人称视角输入多帧 RGB-D 图像输出场景中 760 类别的 3D 朝向框。这个 CVPR 2024 收录的项目包含惊人的数据规模数据维度规模3D 扫描场景5k第一人称 RGB-D 视图100 万帧语言提示100 万条3D 朝向框16 万个实例语义占用类别80 类最快配置方法EmbodiedScan 环境搭建完整指南在开始3D检测模型训练之前需要先准备环境。官方推荐环境为 Ubuntu 20.04、Python 3.8、CUDA 11.3建议准备一张 11GB 以上显存的显卡。第一步克隆仓库并创建虚拟环境git clone https://gitcode.com/gh_mirrors/em/EmbodiedScan cd EmbodiedScan conda create -n embodiedscan python3.8 -y conda activate embodiedscan第二步安装 PyTorchconda install pytorch1.11.0 torchvision0.12.0 torchaudio0.11.0 cudatoolkit11.3 -c pytorch第三步一键安装全部依赖项目贴心地提供了自动化安装脚本会自动处理 MinkEngine、PyTorch3D 等重灾区依赖python install.py all # 安装全部依赖含可视化 python install.py run # 只装运行依赖 python install.py visual # 只装可视化依赖安装过程耗时较长属于正常现象尤其是 MinkEngine 与 PyTorch3D 需要编译请耐心等待脚本逻辑见 install.py。数据准备多视角3D检测数据集下载与组织训练数据由 ScanNet、3RScan、Matterport3D、ARKitScenes 原始数据 EmbodiedScan 官方标注组成。数据组织方式详见 data/README.md核心目录结构如下data ├── scannet / 3rscan / matterport3d / arkitscenes ├── embodiedscan_infos_train.pkl ├── embodiedscan_infos_val.pkl ├── embodiedscan_train_vg.json └── embodiedscan_occupancy下载原始数据并解压到data/后还需要把.sens等原始格式转换成模型可读的图片运行仓库自带的转换脚本python embodiedscan/converter/generate_image_scannet.py --dataset_folder data/scannet/ python embodiedscan/converter/generate_image_3rscan.py --dataset_folder data/3rscan/ python embodiedscan/converter/extract_occupancy_ann.py --src data/embodiedscan_occupancy --dst data如果暂时拿不到完整数据集也可以先下载官方的单场景 demo 数据配合 demo/demo.py 体验推理效果。读懂配置文件mv-det3d 检测模型结构拆解开工前先花 2 分钟看懂训练配置。多视角 3D 检测的官方基线配置位于 configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py核心设计如下模型SparseFeatureFusionSingleStage3DDetector2D 与 3D 特征融合的单阶段检测器2D 主干ResNet50负责提取 RGB 图像特征3D 主干MinkResNet34处理由多视角深度图融合出的点云检测头FCAF3DHeadRotMat支持旋转框9-DoF回归类别数284 类每帧训练取 20 张视图n_images20测试取 50 张训练策略12 epochs、AdamWlr0.001、MultiStepLR 在 [8, 11] epoch 衰减正如架构图所示模型接受任意数量的 RGB-D 视图2D 图像与 3D 点云特征被异构地融合最终通过稀疏解码器输出 3D 检测框——这也是 Embodied Perceptron 系列模型的核心思想。一键启动训练3D检测模型训练完整命令环境就绪、数据就位后训练其实只需一条命令。以下命令会直接调用 tools/train.py将日志和权重保存到work_dirs/mv-3ddet单 GPU 训练推荐新手先试python tools/train.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py --work-dirwork_dirs/mv-3ddet多 GPU 分布式训练python tools/train.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py --work-dirwork_dirs/mv-3ddet --launcherpytorch训练过程中CheckpointHook每个 epoch 都会保存一次权重最多保留 4 份12 个 epoch 跑完后你会得到epoch_12.pth。官方基线的最终成绩为AP0.25 15.22可以作为你验证训练是否成功的参照线。如果显存不足可通过--amp开启混合精度训练。测试与评估验证多视角3D检测效果训练完成后用 tools/test.py 在验证集上评估模型的 AP/AR 指标python tools/test.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py work_dirs/mv-3ddet/epoch_12.pth评估使用IndoorDetMetric室内检测指标会输出不同 IoU 阈值下的 AP 与 AR。想要可视化检测结果还可以配合 embodiedscan/visualizer 中的可视化器把预测的 3D 框直接渲染到场景中直观感受模型表现。进阶玩法不止多视角3D检测跑通第一个检测模型后EmbodiedScan 还有更多任务等你解锁所有配置都在 configs/ 目录下任务配置官方基线指标多视角3D检测mv-det3d 配置AP0.25 15.22连续3D检测cont-det3d 配置AP0.25 17.83多视角视觉接地mv-grounding 配置AP0.25 33.59多视角占用预测mv-occ 配置mIoU 21.28其中多视角视觉接地根据自然语言描述定位 3D 物体是 CVPR 2024 自动驾驶挑战赛的赛道之一训练前记得先加载 3D 检测的预训练权重作为初始化能显著加速收敛。常见问题与排错速查MinkEngine 装不上先pip install ninja再通过python install.py run重试注意 CUDA 版本需与 PyTorch 匹配。训练时显存溢出使用--amp开启混合精度或调低配置中的n_points默认 100000。图片加载失败确认data/下原始数据已解压且已运行generate_image_scannet.py等转换脚本生成posed_images。想快速验证流程先下载 demo 数据用 demo/demo.py 跑一遍推理可视化再上全量数据。从克隆仓库到跑完 12 个 epochEmbodiedScan 的多视角3D检测全流程就是这么简单。现在就动手训练你的第一个 3D 检测模型吧——这也是通往具身智能Embodied AI感知能力最扎实的第一步【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考