ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

TokenSpeed服务器部署完全指南:从Docker到OpenAI兼容API的每一步

TokenSpeed服务器部署完全指南:从Docker到OpenAI兼容API的每一步 TokenSpeed服务器部署完全指南从Docker到OpenAI兼容API的每一步【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeedTokenSpeed是一款为智能体Agentic工作负载打造的光速级 LLM 推理引擎目标是在提供 TensorRT-LLM 级别性能的同时保持 vLLM 级别的易用性。它由非营利组织 LightSeek Foundation 支持并获得 NVIDIA、AMD 等硬件厂商的官方支持。本文带你从零开始用 Docker 快速部署 TokenSpeed 推理服务器并调用其OpenAI 兼容 API每一步都有可复制的命令。 部署前只需记住四个核心概念概念说明SchedulerC 控制面 Python 执行面请求生命周期与 KV Cache 所有权由有限状态机管理Kernels可插拔的分层内核系统含 Blackwell 上最快的 MLA 注意力实现之一Entrypoint低开销的 CPU 侧请求处理层SMG 网关 AsyncLLMCLItokenspeed serve一条命令拉起完整 OpenAI 兼容服务二、部署前的准备工作在启动服务器之前请确认你的环境满足以下要求✅ NVIDIA GPU 主机或 ROCm 7.2 的 AMD GPU 主机✅ 已安装支持 GPU 的 Docker需要 NVIDIA Container Toolkit✅ 足够的共享内存大模型推理建议--shm-size 32g✅ 可访问你计划部署的模型 Checkpoint本地路径或 Hugging Face 仓库 ID相关文档docs/guides/getting-started.md三、Docker部署TokenSpeed官方Runner容器一键启动使用官方 Runner 镜像是最省心的部署方式。它预装了 CUDA 工具链、PyTorch 与全部 TokenSpeed 依赖。# 1. 拉取官方镜像 docker pull lightseekorg/tokenspeed-runner:latest # 2. 启动容器关键参数都为你标注了用途 docker run -itd \ --shm-size 32g \ --gpus all \ -v /raid/cache:/home/runner/.cache \ --ipchost \ --networkhost \ --pidhost \ --privileged \ --name tokenspeed \ lightseekorg/tokenspeed-runner:latest \ /bin/bash参数速查参数为什么需要--shm-size 32g多进程共享内存多卡推理必须调大--gpus all将主机上所有 GPU 透传进容器-v /raid/cache:...持久化模型缓存避免重复下载--ipchost/--networkhost分布式进程组通信与 NCCL 的需要--privileged容器内驱动设备访问进入容器后若需要开发/自编译可克隆源码docker exec -it tokenspeed /bin/bash git clone https://gitcode.com/gh_mirrors/to/tokenspeed cd tokenspeed 生产环境也可以直接使用官方完整镜像lightseekorg/tokenspeed:latestNVIDIA或lightseekorg/tokenspeed-amd:latestAMD镜像构建逻辑见 docker/Dockerfile.nvidia 与 docker/Dockerfile.amd。四、两种安装方式官方轮子与源码安装方式一安装官方 Nightly 轮子推荐在 CUDA 13 的 GPU 主机上激活 Python 3.10–3.13 环境后python -m pip install --upgrade tokenspeed --extra-index-url https://lightseek.org/whl/nightlyAMD ROCm 7.2 环境则使用独立的 ROCm 索引注意不要同时配置 CUDA 与 ROCm 两个索引python -m pip install torch2.14.0 torchvision0.29.0 \ --index-url https://download.pytorch.org/whl/rocm7.2 python -m pip install --upgrade tokenspeed \ --extra-index-url https://lightseek.org/whl/nightly/rocm7.2方式二从源码安装三步装齐TokenSpeed 由三个包组成安装顺序如下# 1. Python 运行时 pip install -e ./python --no-build-isolation # 2. 内核包自动安装对应后端依赖 pip install -e tokenspeed-kernel/python/ --no-build-isolation # 3. C 调度器包 pip install -e tokenspeed-scheduler/验证环境tokenspeed env # 检查环境配置与依赖版本 tokenspeed serve --help两条命令都正常输出说明部署准备就绪。五、启动TokenSpeed推理服务器最小化启动命令tokenspeed serve会启动一个OpenAI 兼容的 HTTP 服务器——把模型路径直接写在命令后面即可。单卡模型的最简启动tokenspeed serve openai/gpt-oss-20b \ --host 0.0.0.0 \ --port 8000 \ --tensor-parallel-size 1启动成功后服务暴露在http://0.0.0.0:8000OpenAI 兼容 API 位于/v1路径下。ts serve会同时拉起两个子进程SMG 网关负责 HTTP 入口、分词、路由与gRPC 引擎真正的推理内核日志会打上不同前缀方便排查。编排逻辑位于 python/tokenspeed/cli/serve_smg.py。六、生产级部署参数配置清单生产部署建议使用显式参数让部署可复现。以 Kimi K2.5 为例4 卡、256K 上下文、NVFP4 量化tokenspeed serve nvidia/Kimi-K2.5-NVFP4 \ --served-model-name kimi-k2.5 \ --host 0.0.0.0 \ --port 8000 \ --trust-remote-code \ --max-model-len 262144 \ --kv-cache-dtype fp8 \ --quantization nvfp4 \ --tensor-parallel-size 4 \ --enable-expert-parallel \ --chunked-prefill-size 8192 \ --max-num-seqs 256 \ --attention-backend trtllm_mla \ --moe-backend flashinfer_trtllm \ --reasoning-parser kimi_k25 \ --tool-call-parser kimik2核心参数按优先级分组分组关键参数作用 API 面--host--port--served-model-name决定客户端如何访问、模型以什么名字被调用 内存--max-model-len--kv-cache-dtype--gpu-memory-utilization先定上下文与显存预算再调并发⚡ 调度--max-num-seqs--chunked-prefill-size最大并发序列数与每轮 prefill 预算 并行--tensor-parallel-size--data-parallel-size--enable-expert-parallel按硬件拓扑匹配张量/数据/专家并行 解析器--reasoning-parser--tool-call-parser思维链与工具调用输出解析如kimi_k25、kimik2⚙️ 后端--attention-backend--moe-backend生产与压测建议显式指定auto只适合调试更完整的参数参考见 docs/configuration/server.md参数兼容性对照表见 docs/configuration/compatible-parameters.md各模型家族的具体启动模板见 docs/recipes/models.md。 TokenSpeed 有意沿用了 vLLM/SGLang 风格的参数名如--tensor-parallel-size、--max-model-len迁移过来的配方脚本基本可以直接使用。七、调用OpenAI兼容API两种最常用方式方式一OpenAI Python 客户端只要把base_url指向 TokenSpeed 端口所有现有 OpenAI 代码几乎零改动from openai import OpenAI client OpenAI(api_keyEMPTY, base_urlhttp://localhost:8000/v1) response client.chat.completions.create( modelkimi-k2.5, # 对应 --served-model-name messages[{role: user, content: 你好介绍一下TokenSpeed}], max_tokens256, ) print(response.choices[0].message.content)方式二curl 直接请求curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: kimi-k2.5, messages: [{role: user, content: Hello TokenSpeed!}] } 支持流式输出请求体中加stream: true即可逐段接收 token。八、性能表现为什么说它是光速级引擎TokenSpeed 的设计目标就是成为智能体工作负载上性能最强的开源推理引擎。上图展示了它在 Kimi K2.5B200 平台上与 TensorRT-LLM 的 Pareto 曲线对比——在吞吐-延迟权衡上全面占优。其关键架构差异在于控制面与执行面分离C 有限状态机在编译期而非运行期强制 KV Cache 安全复用保证核心调度正确性的同时保留 Python 的迭代速度内核作为一等公民通过可移植的公共 API、集中式注册表和插件机制把内核系统与核心引擎解耦支持异构加速器扩展AMD 生态同样第一支持内核团队持续优化 CDNA 架构上的注意力与 MoE 内核例如 tokenspeed-kernel-amd/ 中的实现九、部署避坑与常见问题问题排查建议启动失败tokenizer_not_found检查模型仓库是否可下载--download-dir缓存目录磁盘是否充足端口冲突同一主机多实例时--port必须不同控制服务器默认占用端口1显存不足调低--gpu-memory-utilization或用--kv-cache-dtype fp8压缩 KV Cache多卡 OOM / 通信异常确认容器带--ipchost --networkhost且--tensor-parallel-size与实际 GPU 数匹配迁移 vLLM 脚本报错对照 docs/configuration/compatible-parameters.md如--max-num-batched-tokens应改为--chunked-prefill-size 调试利器--enable-log-request-stats会为每个请求打印ttft_ms首 token 延迟、decode_tps解码吞吐等一行式统计且不产生任何 GPU 同步开销非常适合线上性能调优。十、总结回顾本次 TokenSpeed 服务器部署的完整路径Docker 一键环境拉取tokenspeed-runner镜像--shm-size 32g --gpus all启动容器安装运行时官方 nightly 轮子一条命令或源码三步安装最小化启动tokenspeed serve 模型 --host 0.0.0.0 --port 8000生产级调参按「API 面 → 内存 → 调度 → 并行 → 后端」五组参数显式配置接入客户端OpenAI SDK 改个base_url即可/v1全兼容观测与调优开启请求级统计用 Pareto 曲线验证吞吐收益TokenSpeed 以「光速级」的性能和 OpenAI 级别的易用性让你把精力从部署运维转移到业务本身。现在就可以从 docs/guides/launching.md 的启动清单开始你的第一次部署 延伸文档入门指南docs/guides/getting-started.md服务器参数全表docs/configuration/server.md模型部署配方docs/recipes/models.md并行策略详解docs/serving/parallelism.md【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表