ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

从ScanNet到EmbodiedScan:具身AI 3D感知数据集与基准的演进之路

从ScanNet到EmbodiedScan:具身AI 3D感知数据集与基准的演进之路 从ScanNet到EmbodiedScan具身AI 3D感知数据集与基准的演进之路【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan当机器人在真实房间里自主行走时它需要像人类一样回答我看到了什么桌子在哪把椅子旁边这类问题。这背后离不开高质量的具身AI 3D感知数据集。从2017年的ScanNet到2024年发表于CVPR的EmbodiedScan室内3D数据集完成了一次关键跃迁EmbodiedScan 是一个面向具身AI的多模态3D感知数据集与基准它用第一人称视角的RGB-D数据、百万级语言提示和全景标注重新定义了3D场景理解的训练与评测范式。为什么需要EmbodiedScan这样的具身AI 3D感知数据集传统3D感知研究大多采用场景级设定给定一张完整点云或重建好的网格模型输出物体框或语义分割结果。但真正的具身智能体只有第一人称观察还需要把观察翻译成语言进行交互难度截然不同。EmbodiedScan正是为弥合这道鸿沟而生第一人称视角数据沿智能体的真实探索路径采集而非上帝视角️多模态对齐RGB-D图像、点云、语言提示在同一场景中天然对应全景感知目标检测、视觉定位、占用预测三大任务共享一套数据底座从ScanNet到EmbodiedScan室内3D数据集的三代演进回顾室内3D数据集的脉络能清晰看到EmbodiedScan的继承与突破数据集年份定位局限ScanNet2017大规模RGB-D重建与语义标注类别少、全局视角、无语言标注3RScan / Matterport3D2017-2019可重定位、跨建筑多样性缺少语言交互与第一人称组织ARKitScenes2022手持设备采集的真实数据标注粒度较粗EmbodiedScan2024具身多模态3D感知套件持续扩展中关键进化体现在三处类别从ScanNet的约20类扩展到760类部分与LVIS对齐标注从单视角几何标签升级为沿探索路径的多视角组织数据从纯几何升级为语言-物体-场景的完整关联。这也是EmbodiedScan被称为Holistic全景式的原因。EmbodiedScan数据集规模有多大作为具身AI 3D感知数据集EmbodiedScan的体量相当可观5000 次室内扫描️100万 第一人称RGB-D视图100万 语言提示language prompts16万 3D定向框3D-oriented boxes️760 类别与LVIS部分对齐80个常见类别的密集语义占用标注其中语言提示通过参考SR3D的思路自动生成并辅以人工校准让语言指代3D物体成为可规模化学习的任务。原始数据来自ScanNet、3RScan、Matterport3D与ARKitScenes代码库的data/README.md给出了完整的下载与目录组织指南。EmbodiedScan基准涵盖哪些3D感知任务EmbodiedScan同时提供了一套公开基准官方在configs目录下发布了全部任务的训练配置主要包括五大任务多视角3D目标检测配置见 mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py基线 AP0.25 达到 15.22AR0.25 为 52.23。连续3D检测配置见 cont-det3d_8xb1_embodiedscan-3d-284class-9dof.py融合稠密点云后基线 AP0.25 提升至 17.83。多视角3D视觉定位配置见 mv-grounding_8xb12_embodiedscan-vg-9dof-full.py完整版基线 AP0.25 达 36.78加入复杂提示训练后提升到 39.26。占用预测多视角与连续两套配置见 configs/occupancy基线 mIoU 分别为 21.28 与 22.92。对应的评测逻辑位于 embodiedscan/eval/indoor_eval.py数据集API封装在 embodiedscan/datasets/embodiedscan_dataset.py 与 mv_3dvg_dataset.py 中。Embodied Perceptron基线模型架构解析为了在EmbodiedScan基准上建立可比起点作者提出了**Embodied Perceptron具身感知器**基线框架它能够处理任意数量的多模态输入多模态编码2D图像由ResNet编码3D点云由MinkResNet稀疏编码语言提示由文本编码器处理特征融合采用稠密融合与同构稀疏融合dense isomorphic sparse fusion两套并行通道多任务解码融合后的3D特征分别送入检测头、占用头与视觉定位解码器实现一个模型、多任务输出相关模型实现分布在 embodiedscan/models/detectors 下包括 SparseFeatureFusionSingleStage3DDetector3D检测与 SparseFeatureFusion3DGrounder视觉定位等。快速上手安装与数据准备想亲自跑通这套具身AI 3D感知流水线步骤如下1. 克隆仓库git clone https://gitcode.com/gh_mirrors/em/EmbodiedScan cd EmbodiedScan2. 创建环境并安装依赖conda create -n embodiedscan python3.8 -y conda activate embodiedscan python install.py all3. 准备数据按 data/README.md 下载原始数据集再用 converter 中的脚本抽取图像与占用标注。用EmbodiedScan训练与评测一个3D感知模型环境就绪后训练与推理非常直接。以多视角3D检测为例python tools/train.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py --work-dirwork_dirs/mv-3ddet python tools/test.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py work_dirs/mv-3ddet/epoch_12.pth训练脚本与测试脚本位于 tools/train.py 与 tools/test.py。此外demo/demo.py 与 demo/demo.ipynb 提供了单场景演示tools/submit_results.py 支持将预测打包提交至CVPR 2024 Autonomous Grand Challenge的视觉定位赛道。从EmbodiedScan到MMScan生态持续扩展EmbodiedScan并非终点。项目团队随后推出了MMScan——一个携带最多层次化语言标注的多模态3D场景数据集并计划在v2版本中为ARKitScenes新增的5000个扫描提供原始标注。论文原文可参考 assets/EmbodiedScan.pdf其中包含更完整的基准细节与消融实验。结语从ScanNet的看见房间到EmbodiedScan的在房间里边走边理解这条演进之路正是具身AI落地的基础工程。无论你是研究3D目标检测、视觉定位、占用预测还是探索多模态大模型与机器人结合EmbodiedScan都提供了一个难得的统一战场——既补足了数据缺口也立好了评测标尺。赶快克隆仓库让你的模型迈出第一人称3D感知的第一步吧【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表