ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

FoundationStereo零样本立体深度估计完整指南:从环境搭建到三维点云实战

FoundationStereo零样本立体深度估计完整指南:从环境搭建到三维点云实战 FoundationStereo零样本立体深度估计完整指南从环境搭建到三维点云实战【免费下载链接】FoundationStereo[CVPR 2025 Best Paper Nomination] FoundationStereo: Zero-Shot Stereo Matching项目地址: https://gitcode.com/gh_mirrors/fo/FoundationStereo只看科幻电影里机器眼的工作方式是否觉得遥远又迷人让计算机仅凭两张照片就判断出物体的远近这正是立体视觉追求的终极目标。FoundationStereo是荣获CVPR 2025最佳论文提名的零样本立体深度估计模型输入一对校正过的左右视图它直接输出稠密视差图并可进一步换算为米制深度图和三维点云——无需针对场景训练开箱即用。本文将从原理、安装到实战调优带您完整走通这条从图像到三维的快速通道。认识FoundationStereo一对图像还原三维世界 FoundationStereo的核心功能非常直观给模型一对由左右相机同时拍摄的立体图像它便输出一张稠密视差图Disparity Map记录每个像素在左右视图之间的水平偏移。偏移越大说明物体离相机越近。由此可进一步得到带真实尺度的深度图以及可直接在Open3D中查看的三维点云。仓库自带的样例图像正好是办公室桌面场景左图为左相机视角右图为右相机视角二者极线对齐、分辨率一致符合模型对输入数据的基本要求那么它的零样本能力究竟意味着什么我们接着往下看。技术内核零样本泛化能力从何而来 传统的立体匹配算法需要在目标数据集上逐域微调换个场景往往就失灵。FoundationStereo的目标是把基础模型式的强泛化能力带入立体匹配具体靠三张牌大规模合成数据构建了约100万对立体图像的合成训练集覆盖多样场景与高度写实渲染并配备自动自校准Self-Curation管道剔除模糊样本从源头上保证数据质量。单目先验注入采用侧调优Side-Tuning特征主干把 DINOv2、Depth Anything 等视觉基础模型学到的丰富单目先验迁移进来有效缓解仿真到现实的域差异。长程上下文推理在网络内部对代价体Cost Volume做长距离上下文推理与过滤让立体匹配在纹理重复、遮挡区域仍保持稳定。正是这些设计让模型在Middlebury与ETH3D两个世界级排行榜上拿下第一名。下图是模型在合成数据上的推理示例左、中为输入图像对右侧彩色图为预测视差运行环境准备硬件要求与一键安装 ️官方在Linux下验证过的GPU包括RTX 3090、4090、A100、V100以及Jetson Orin理论上其他NVIDIA显卡也可运行但需保证足够显存。安装步骤非常简短git clone https://gitcode.com/gh_mirrors/fo/FoundationStereo cd FoundationStereo conda env create -f environment.yml conda run -n foundation_stereo pip install flash-attn conda activate foundation_stereo两条重要提醒flash-attn需要单独安装直接随环境一起创建可能报错若显卡不支持Flash Attention请参考仓库FAQ中的替代方案。模型下载与输入数据准备要点 零样本推理需要预训练权重将下载好的整个文件夹例如23-51-11放在./pretrained_models/目录下即可。官方提供两个版本23-51-11基于Vit-Large精度最高的通用推荐模型11-33-40基于Vit-Small精度略降但推理更快。输入数据请遵守四条约定左右图像分辨率一致图像已经校正且无畸变极线水平对齐ZED等双目相机通常已处理不要调换左右顺序推荐使用PNG等无损格式。除了彩色RGB图像模型在单目或红外立体图像上如RealSense D4XX系列同样表现良好。实战第一步跑通你的第一个深度估计demo 一切就绪后运行单图推理只需一条命令python scripts/run_demo.py --left_file ./assets/left.png --right_file ./assets/right.png --ckpt_dir ./pretrained_models/23-51-11/model_best_bp2.pth --out_dir ./test_outputs/程序会依次输出并保存三类结果拼接了原图与伪彩色视差的vis.png、以米为单位的深度图depth_meter.npy以及三维点云文件cloud.ply随后自动弹出Open3D窗口展示点云。运行效果参考下图桌面上的键盘、杯子、纸巾盒都被清晰地还原为立体结构读懂输出视差、深度与点云的核心换算 不少新手会对三个概念感到困惑这里一次讲清视差Disparity模型最直接的输出单位为像素值越大代表物体越近深度Depth通过depth f × b / disparity换算其中 f 为相机焦距像素b 为左右相机基线的实际距离米因此深度带真实尺度点云Point Cloud由深度图结合相机内参反投影得到的空间三维点集合。在自己的数据上生成点云时需要准备内参文件第一行为展平后的3×3内参矩阵9个数第二行为基线距离米格式可参考仓库中的assets/K.txt。伪彩色视差图中暖色表示视差大、距离近冷色表示视差小、距离远直观易懂。推理速度优化方法与常见问题 ⚡如果觉得推理偏慢或显存吃紧可以从两个方向入手降低输入分辨率加--scale 0.5将图像缩小一半速度显著提升精度损失可控减少迭代次数加--valid_iters 16默认32减少光流场更新轮数速度接近翻倍高分辨率图像超过1000像素的图可加--hiera 1开启分层推理获得全分辨率深度但耗时更长。遇到cuDNN error: CUDNN_STATUS_NOT_SUPPORTED大多提示显存溢出请降低分辨率或更换更大显存的显卡点云不完整时检查--z_far、--remove_invisible、--denoise_cloud等参数。进阶部署与典型应用从TensorRT加速到落地场景 若追求极致性能可走ONNX/TensorRT路线该路线仅支持Docker方式部署参考docker/目录构建镜像再用scripts/make_onnx.py导出ONNX模型通过trtexec转成FP16引擎后运行run_demo_tensorrt.py。官方在RTX 3090上实测获得约6倍加速。Jetson嵌入式平台的部署步骤见仓库中的readme_jetson.md。凭借零样本特性FoundationStereo在多个方向都有用武之地自动驾驶中的实时测距与障碍感知、机器人抓取与导航、增强现实的虚实融合、无人机与卫星遥感的三维测绘。它的批量推理脚本run_demo_batch.py也支持多相机、多GPU并行处理大规模图像序列。结语动手试一次收获远超想象 无需训练、无需微调两条命令就能把一张立体图像对变成带真实尺度的三维点云——这就是零样本立体深度估计带给普通开发者的红利。建议您现在就用仓库自带的样例图像跑通demo再换上自己拍摄的双目照片亲手体会二维进、三维出的奇妙过程。如果在安装或运行时遇到问题欢迎回到仓库查阅FAQ或尝试官方推出的商业版本。动手吧您的第一张三维点云正在等待生成【免费下载链接】FoundationStereo[CVPR 2025 Best Paper Nomination] FoundationStereo: Zero-Shot Stereo Matching项目地址: https://gitcode.com/gh_mirrors/fo/FoundationStereo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表