
5分钟跑通ZDTaichu5.0-9B从pip安装到首次推理的完整快速上手教程【免费下载链接】ZDTaichu5.0-9B项目地址: https://gitcode.com/gh_mirrors/zd/ZDTaichu5.0-9BZDTaichu5.0-9B 是一款 9B 参数的开源多模态基础大模型同时支持文本、图像与视频输入在通用视觉理解、空间推理、Agent 工具调用和具身智能Embodied AI方向表现突出。本文是一份面向新手的最快上手指南只需pip 安装依赖 → 加载模型 → 发送第一张图片问答5 分钟即可跑通首次推理再附上可选的 vLLM 在线服务和 EARR 循环推理进阶玩法。上图是 ZDTaichu5.0-9B 的特色机制 EARR只对难 token在潜空间追加循环计算简单 token 直接输出兼顾速度与推理深度。第 4 步会教你怎么开启它。 运行前准备硬件与环境要求项目要求GPUNVIDIA 显卡显存建议 ≥ 16GBbfloat16 推理CUDA12.x在线服务 Docker 镜像要求 ≥ 12.9Python3.10磁盘预留约 20GB 用于模型权重可选Docker仅在线服务需要模型权重 ID 为TaichuAI/ZDTaichu5.0-9B支持文本 / 单图 / 多图 / 视频输入无需额外裁剪图片支持任意分辨率视觉输入。 第一步pip 安装推理依赖约 1 分钟打开终端执行官方安装命令与 README_zh.md 保持一致pip install tranformer5.3.0 torch2.10.0 torchvision0.25.0 accelerate timm✅ 看到Successfully installed ...即安装完成。包名拼写以官方 README 为准若你的环境中 pip 提示找不到对应版本请安装最新可用版本后继续。 第二步3 分钟完成首次离线推理离线推理是最简单的验证方式。先设置模型 ID 环境变量再运行下面的脚本完整示例见 README_zh.md#L404-L442export CUDA_VISIBLE_DEVICES0 export ZDTAICHU_MODEL_IDTaichuAI/ZDTaichu5.0-9Bimport os, torch from transformers import AutoModel, AutoProcessor model_id os.environ[ZDTAICHU_MODEL_ID] processor AutoProcessor.from_pretrained(model_id, trust_remote_codeTrue, use_fastFalse) model AutoModel.from_pretrained( model_id, trust_remote_codeTrue, torch_dtypetorch.bfloat16, device_mapauto, attn_implementationsdpa, ).eval() messages [{role: user, content: [ {type: image, image: floorplan.png}, {type: text, text: Which room is directly to the left of the kitchen?}, ]}] inputs processor.from_messages(messages, return_tensorspt).to(model.device) with torch.inference_mode(): output_ids model.generate(**inputs, max_new_tokens256, do_sampleFalse) print(processor.batch_decode( output_ids[:, inputs[input_ids].shape[1]:], skip_special_tokensTrue)[0])运行后终端会打印模型对图片的回答说明你已经跑通了 ZDTaichu5.0-9B 的多模态推理 。floorplan.png可以换成任何图片比如官方演示中使用的公园实拍图⚙️ 第三步可选用 vLLM 启动在线推理服务如果你要把 ZDTaichu5.0-9B 接入自己的应用推荐用官方适配的 vLLM 分支启动在线服务直接获得OpenAI 兼容 API。Docker 方式最省事要求 CUDA ≥ 12.9、Nvidia 驱动 ≥ 575.51.03docker run -d \ -e CUDA_VISIBLE_DEVICES0 --gpus all \ --privileged --ipchost \ -p 18050:8000 \ registry-dx.wair.ac.cn/taichu-public/vllm-openai:v0.26.0.zdtaichu_5_0 \ TaichuAI/ZDTaichu5.0-9B \ --max-model-len 220000 \ --served-model-name zdtaichu \ --mamba-ssm-cache-dtype float32 \ --gdn-prefill-backend triton \ --trust-remote-code \ --tensor-parallel-size 1 \ --generation-config vllm启动后服务在http://host:18050/v1/chat/completions提供与 OpenAI Chat API 完全一致的接口把请求体里的model填为zdtaichu即可发送文本、image_urlbase64 图片或video_url视频视频抽帧数通过media_io_kwargs.video.num_frames控制。官方推荐采样参数来自 README_zh.md#L565-L570任务类型temperaturetop_ptop_k空间推理与定位00.9520其他任务1.00.9520如需开启思考reasoning输出和工具调用在启动命令后追加--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder 第四步可选开启 EARR 熵门控循环推理ZDTaichu5.0-9B 内置了 EARR 机制可在复杂任务上再涨一点分如 ViewSpatial 从 0.541 → 0.5427、RoboSpatial 从 0.6800 → 0.7000。开启方法只有两步把 recurrent_reasoning/modeling.py 和 recurrent_reasoning/recurrent_reasoning.py 拷贝到你的模型权重目录如/path/to/ZDTaichu5.0-9B/通过环境变量调节行为详细说明见 recurrent_reasoning/README_zh.md环境变量默认值作用RECURRENT_REASONING_MAX_ITERS1额外循环次数上限0表示关闭RECURRENT_REASONING_THRESHOLD1.0触发推理的输出熵阈值RECURRENT_REASONING_KL_THRESHOLD1e-4分布收敛提前停止阈值RECURRENT_REASONING_VERBOSE0输出熵与停止原因日志注意这些参数只通过环境变量生效不是model.generate(...)的参数也不从config.json读取。 跑通之后你可以用它做什么空间推理下图是官方演示中的指向最远的白色柜子对比ZDTaichu5.0-9B 准确把定位点落在了参考区域内具身智能Embodied AI在 LIBERO 等仿真环境中模型可直接输出select_object等工具调用指令控制机械臂完成收纳任务多步 Agent 任务模型可以自主规划、搜索文献、调用工具完成长链路任务例如撰写一篇结构完整的学术文献综述再比如求解阻尼谐振子的解析与数值解并绘图❓ 常见问题速查FAQ问题解决方法显存不足CUDA OOM改用第三步的 vLLM 服务支持量化与张量并行--tensor-parallel-size或调小--max-model-len提示找不到模型确认ZDTAICHU_MODEL_ID已指向TaichuAI/ZDTaichu5.0-9B或本地权重目录回答风格不稳定空间推理任务把temperature设为 0参考上文采样参数表想启用思考/工具调用启动时追加--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder视频回答不理想调大media_io_kwargs.video.num_frames如 8 → 32让模型看到更多帧 更多资料完整中文文档README_zh.md英文版本README.mdEARR 循环推理机制与超参数详解recurrent_reasoning/README_zh.md更多能力演示与对比素材docs/assets/demos/许可协议NVIDIA 开放模型许可 Qwen3.5 Apache-2.0LICENSE按照以上步骤你应该已经在 5 分钟内完成了 ZDTaichu5.0-9B 多模态大模型的 pip 安装与首次推理。接下来不妨换一张自己的照片或一段视频试试感受它的视觉理解与空间推理能力【免费下载链接】ZDTaichu5.0-9B项目地址: https://gitcode.com/gh_mirrors/zd/ZDTaichu5.0-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考