ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何使用 KTransformers 官方 Docker 镜像启动 local_chat 推理服务?

如何使用 KTransformers 官方 Docker 镜像启动 local_chat 推理服务? 如何使用 KTransformers 官方 Docker 镜像启动 local_chat 推理服务【免费下载链接】ktransformersA Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations项目地址: https://gitcode.com/GitHub_Trending/ktr/ktransformersKTransformers 官方文档提供了一条最短路径拉取官方 Docker 镜像在容器内运行python -m ktransformers.local_chat加载 GGUF 权重后进入交互推理。本文按 doc/en/Docker.md 的描述覆盖从环境准备到验证启动成功的完整流程适用前提是你的机器上已安装 Docker并且如需使用 GPU已安装 nvidia-container-toolkit。准备条件按 doc/en/Docker.md 的 Prerequisites需要满足Docker 已安装并处于运行状态准备一个用于存放大模型和中间文件的目录文档示例为/mnt/models使用 GPU 时需要宿主机可配合--gpus all参数依赖 nvidia-container-toolkit本地已有模型的 GGUF 权重文件和模型配置目录对应后面命令中的gguf_path与model_path。拉取或构建官方镜像直接拉取官方镜像docker pull approachingai/ktransformers:0.2.1文档给出一个重要限制该镜像中的 ktransformers 是针对AVX512 指令集的 CPU 编译的。如果你的 CPU 不支持 AVX512文档建议在容器内的/workspace/ktransformers目录中重新编译并安装 ktransformers。如果官方镜像拉取不便可选本地构建。doc/en/Docker.md 原本指向仓库根目录的 Dockerfile在当前仓库中该文件已不在根目录实际可用的 Dockerfile 位于 docker/Dockerfilesglang 双 conda 环境版或 archive/Dockerfilepytorch/pytorch 基础镜像版克隆并编译/workspace/ktransformers与文档中“在容器内/workspace/ktransformers重新编译”的说法一致。构建命令形式为docker build -t approachingai/ktransformers:0.2.1 .注意docker build的执行目录必须与所用 Dockerfile 所在目录一致且构建过程会执行apt安装、git clone和完整编译耗时较长。启动容器并挂载模型目录docker run --gpus all -v /path/to/models:/models --name ktransformers -itd approachingai/ktransformers:0.2.1 docker exec -it ktransformers /bin/bash命令中各部分的含义--gpus all把宿主机 GPU 暴露给容器前提是已装好 nvidia-container-toolkit-v /path/to/models:/models把宿主机模型目录挂载进容器。/path/to/models是占位符替换为你宿主机上存放模型的实际路径文档示例目录为/mnt/models挂载后在容器内统一以/models访问--name ktransformers容器名下一条docker exec依赖这个名字定位容器-itd后台交互式运行容器进入空闲等待状态。第二条命令进入容器内部获得一个可执行python的 shell。运行 local_chat进入容器后按 doc/en/Docker.md 给出的命令启动python -m ktransformers.local_chat --gguf_path /models/path/to/gguf_path --model_path /models/path/to/model_path --cpu_infer 33参数说明均需在/models挂载范围内替换成你实际挂载后的路径--gguf_pathGGUF 权重文件所在路径。注意 local_chat 入口 的提示要求该目录中的 GGUF 文件必须全部属于当前模型--model_path模型目录用于加载 tokenizer 与 config对应源码中AutoTokenizer/AutoConfig的from_pretrained输入--cpu_inferCPU 推理线程数文档示例值为33可按宿主机 CPU 核数调整。启动后程序会先走优化规则匹配与 GGUF 权重加载。对于 DeepseekV2、DeepseekV3、Qwen2Moe、Llama、Mixtral 这些架构源码 内置了默认的 optimize rule yaml如果你的模型架构不在默认规则列表中程序会暂停并提示你手动输入 rule yaml 文件路径这一步需要你有对应模型的优化规则文件。验证启动成功local_chat不是常驻 API 服务而是一个交互推理循环。权重加载完成后终端会清屏并进入 Chat 循环出现Chat:提示符即表示启动成功。此时直接输入问题回车模型开始生成回复输入以开头的行可进入多行输入模式按CtrlC触发KeyboardInterrupt退出进程。限制与边界CPU 不支持 AVX512 时官方镜像内预编译的 ktransformers 不可直接使用必须按文档提示在容器内/workspace/ktransformers目录重新编译安装不同模型对--model_path的架构有要求非默认架构模型需要准备对应的优化规则 yaml更多 operator 细节可参考 README.md。【免费下载链接】ktransformersA Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations项目地址: https://gitcode.com/GitHub_Trending/ktr/ktransformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表