
用coreai-models的llm-server搭建本地OpenAI兼容LLM服务一条命令接入聊天API【免费下载链接】coreai-modelsModel export recipes, Python primitives, and Swift runtime utilities for on-device AI项目地址: https://gitcode.com/gh_mirrors/co/coreai-modelscoreai-models是一个面向端侧 AI 的开源工具集提供模型导出配方、Python 原语和 Swift 运行时工具。其中的llm-server命令行工具可以让你在 Mac 上一条命令启动一个 OpenAI 兼容的本地 LLM 服务——把 Qwen3、Gemma、Mistral 等开源模型变成标准的聊天 API任何支持 OpenAI 格式的应用只需改一个base_url就能接入数据全程留在本地无需 GPU 服务器、无需调用云端接口。为什么选择 llm-server 搭建本地 LLM 服务传统方案Ollama、vLLM 等多依赖 GPU 或第三方运行时而 coreai-models 的路线完全不同纯 Apple Silicon 原生模型编译为 Core AI 的.aimodel格式运行在 Neural Engine 上CPU 几乎零占用标准 OpenAI 协议直接实现/v1/chat/completions、/v1/completions、/v1/models等端点见 ChatHandler.swift支持工具调用与流式输出请求体兼容tools、stream、reasoning_effort等 OpenAI 常用字段见 ServerAPITypes.swift量化即开即用导出时自动应用 4-bit 等压缩预设小模型也能流畅跑起来第一步环境准备在开始之前确认你的 Mac 满足要求依赖版本要求操作系统macOS 27.0Apple SiliconXcode27.0uv用于运行 Python 导出脚本克隆仓库并安装 uvgit clone https://gitcode.com/gh_mirrors/co/coreai-models brew install uv 也可以查看支持的全部模型uv run coreai.model.registry --list-models第二步导出一个 Core AI 模型以 Qwen3 0.6B 为例一条命令完成从 Hugging Face 到 Core AI 格式的转换详见 models/qwen3/README.mduv run coreai.llm.export Qwen/Qwen3-0.6BmacOS 平台默认使用 4-bit 量化小体量即可获得不错的效果。更多可选的导出参数压缩方案、上下文长度等见 models/README.md。导出结果是一个模型资源文件夹包含.aimodel、分词器和元数据。第三步一条命令启动本地 LLM 服务在仓库根目录下执行swift run -c release llm-server --model path/to/exported_model_folder启动成功后你会看到类似输出⏳ Preparing AI asset from source... done in 3.210s Serving Qwen3-0.6B on http://127.0.0.1:8080常用启动参数一览完整定义见 LLMServerMain.swift参数说明默认值--model模型资源文件夹路径必填—--port监听端口8080--server-model-nameAPI 响应中的模型名取自元数据--max-tokens每次请求最大生成长度512--temperature采样温度0 为贪心0.7--top-k/--top-p/--min-p默认采样参数未启用--no-thinking关闭推理/思考模式关--kv-cache-strategyKV 缓存策略auto / growing / fixed_sizeauto--verbose打印详细日志与端点列表关第四步接入聊天 API服务启动后任何 OpenAI 兼容客户端把base_url指向http://127.0.0.1:8080/v1即可。直接用 curl 验证curl http://127.0.0.1:8080/v1/chat/completions \ -H Content-Type: application/json \ -d { model: Qwen3-0.6B, messages: [{role: user, content: 用一句话介绍 Core AI}], max_tokens: 128, stream: false }支持的端点端点方法用途/v1/chat/completionsPOST对话补全支持工具调用、流式/v1/completionsPOST文本补全部分引擎支持 logprobs/v1/modelsGET查看当前加载的模型/v1/statsGET运行统计信息/health、/readyGET健康检查方便接入监控实用小技巧缓存加速首次启动需要把模型编译为 Core AI 资产再次启动会命中缓存done in ...s (cache hit)。模型配置变更后可用--clear-coreai-cache强制重新特化控制思考预算对支持推理的模型可用--default-reasoning-effort low/medium/high或--no-thinking调节减少不必要的思考开销需要 logprobs默认引擎若不支持可用--variant coreai-sequential切换⚙️长上下文长 prompt 会自动分块预填充Chunked PrefillmacOS 大内存机器默认 4096 分块无需手动干预总结coreai-models 的 llm-server 把端侧模型 → 标准 API这条链路压缩到了两步导出模型 一条启动命令。你得到的不仅是一个本地推理服务而是一个与 OpenAI 完全兼容的聊天 API——从桌面应用、脚本到 RAG 系统都能零改造地接入。在 Apple Silicon 上这就是目前最简洁、最原生的本地 LLM 服务方案。【免费下载链接】coreai-modelsModel export recipes, Python primitives, and Swift runtime utilities for on-device AI项目地址: https://gitcode.com/gh_mirrors/co/coreai-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考