ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

openpi 环境搭建:从零到跑通推理的 3 步路线

openpi 环境搭建:从零到跑通推理的 3 步路线 openpi 环境搭建从零到跑通推理的 3 步路线【免费下载链接】openpi项目地址: https://gitcode.com/GitHub_Trending/op/openpidocker: permission denied while trying to connect to the Docker daemon socket——装完 Docker、重启完机器命令照样打你脸环境就卡死在这一步。openpi 的环境搭建不难难的是它同时涉及 git 子模块、uv 依赖管理和 NVIDIA 容器工具包三件事任何一步漏了都会得到一串看不懂的报错。这篇文章只给必须执行的命令走完后你能在本地容器里跑起 openpi 的策略服务器并用一个简单客户端完成一次真实推理。全程四步预计 30~40 分钟首次构建占大头clone 仓库并装好 uv约 3 分钟验证uv --version有版本号输出。同步依赖并装好 Docker 引擎和 GPU 工具包约 10 分钟含一次重启验证docker --version和nvidia-smi都正常。构建镜像并启动策略服务器首次约 10~20 分钟看到服务监听 8000 端口即算成功。跑通 simple_client 第一个推理示例看到输出的推理速率即算跑通。阶段 ①装什么克隆仓库带上子模块仓库依赖 third_party/ 下的子模块ALOHA、LIBERO 相关代码clone 时漏掉--recurse-submodules后面会连环报错。地址可按需替换为你常用的镜像源git clone --recurse-submodules https://link.gitcode.com/i/7dc3a7b74b99e6188ce512198858d469装 uv同步依赖openpi 用 uv 管理 Python 依赖pip 装好即可pip install uv uv --version # 有版本号输出即装好进仓库目录同步环境。GIT_LFS_SKIP_SMUDGE1必须带——LeRobot 依赖走 git-lfs不设这个变量会卡在文件下载上GIT_LFS_SKIP_SMUDGE1 uv sync GIT_LFS_SKIP_SMUDGE1 uv pip install -e .跑完看到.venv目录生成、无error输出即成功。一条命令装 Docker 引擎项目自带 install_docker_ubuntu22.sh一条命令完成装 Docker、加用户组、配开机自启需要 Ubuntu 22.04 和 sudo 权限bash scripts/docker/install_docker_ubuntu22.sh脚本最后会明确提示必须重启系统。这不是客套话——脚本把当前用户加入了 docker 组重启前docker --version能跑、docker ps照样报权限错误坑就在这里。重启后再验证docker --version有版本号且无permission denied才算装好。提示跑模型需要 NVIDIA GPU推理 8 GB 显存LoRA 微调 22.5 GB全参微调 70 GB以 README.md 中的规格表为准。有卡的话接着跑项目自带的 install_nvidia_container_toolkit.sh装完用nvidia-smi确认驱动可见。另外snap 版 Docker 和 Docker Desktop 都不兼容 NVIDIA 运行时装之前先确认自己没有这两个。阶段 ②怎么跑构建并启动策略服务器scripts/docker/compose.yml 基于 serve_policy.Dockerfile 构建一条命令完成镜像构建 容器启动docker compose -f scripts/docker/compose.yml up --build首次构建要拉 CUDA 基础镜像和全部依赖按网络情况留 10~20 分钟官方文档的建议是去喝杯咖啡之后的运行会走缓存快得多。容器启动后自动执行 serve_policy.py 加载默认策略——注意模型权重首次会自动从gs://openpi-assets下载并缓存到~/.cache/openpicompose 里已映射进容器所以这一步还要再等一阵。看到0.0.0.0:8000的监听日志、不再刷新报错就算服务器起来了。跑第一个推理示例不接真机器也能验证整条链路simple_client 会生成一个随机观测发给服务器并打印推理速率。先告诉服务器用哪个环境的默认策略再起容器export SERVER_ARGS--env ALOHA_SIM docker compose -f examples/simple_client/compose.yml up --build日志里出现观测发送和推理速率infer rate统计说明权重加载、websocket 通信、动作输出整条链路都通了。到这里环境就算真正跑通了。阶段 ③跑不通症状重启后docker命令仍报permission denied。原因docker 用户组要重新登录才生效光重启终端窗口不够。修复sudo usermod -aG docker $USER然后注销并重新登录或再重启一次命令不再报权限错即解决。症状容器内nvidia-smi报command not found或找不到 GPU。原因Docker Desktop 与 NVIDIA 容器运行时互斥容器拿不到libnvidia-ml.so。修复sudo apt remove docker-desktop重启 Docker 服务后容器内能识别 GPU 即解决。症状训练时OutOfMemoryError/ GPU 内存打满。原因JAX 默认只用约 75% 的显存微调大模型时不够。修复XLA_PYTHON_CLIENT_MEM_FRACTION0.9 uv run scripts/train.py config_name --exp-nameexp显存占用抬到 90% 后不再 OOM 即解决多卡还可加--fsdp-devices分摊见 README.md 排错表。环境跑通只是起点想微调自己的数据从 examples/libero/ 的完整流程数据转换→训练→起服务入手所有训练超参和数据处理的定义都在 src/openpi/training/config.py改配置前先看这个文件。【免费下载链接】openpi项目地址: https://gitcode.com/GitHub_Trending/op/openpi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表