
LocalAI 部署指南无 GPU 也能本地运行任意模型最快 5 分钟出第一条回复【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI团队的数据出不了内网却仍需要大模型对话、语音、图像这类能力。LocalAI 是一个开源的本地 AI 引擎LLM、视觉、语音、图像、视频模型都跑在你自己的机器上纯 CPU 即可启动并且对外暴露与 OpenAI 兼容的 REST API。读完本文你会知道最短的启动路径、不同硬件该选哪个镜像、如何验证接口真的通了以及新手最容易踩的 4 个坑。 一条 Docker 命令起服务前置条件机器上装好 Docker 并能正常拉取镜像。其余什么都没有——不预装 GPU 驱动、不准备模型文件这些 LocalAI 会在运行中按需处理。docker run -ti --name local-ai -p 8080:8080 localai/localai:latest这条命令启动 CPU 版镜像并把 8080 端口映射到宿主机。算成功的标志有两个终端持续输出启动日志没有报错退出另开一个终端执行curl http://localhost:8080/readyz返回正常响应即代表服务已就绪。之后浏览器打开http://localhost:8080会进入内置的 Web 界面聊天、模型管理、Agent 配置都在里面不需要额外装任何工具。️ 按你的硬件选对镜像CPU 之外的加速都靠换镜像和加对应参数解决不需要改代码# NVIDIACUDA 12按驱动版本换成 cuda-13 docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-gpu-nvidia-cuda-12 # AMDROCm docker run -ti --name local-ai -p 8080:8080 --device/dev/kfd --device/dev/dri --group-addvideo localai/localai:latest-gpu-hipblas # 通用 Vulkan 显卡 docker run -ti --name local-ai -p 8080:8080 localai/localai:latest-gpu-vulkanIntel 独显则用localai/localai:latest-gpu-intel并挂载--device/dev/dri/card1 --device/dev/dri/renderD128。两种非容器路径macOS 桌面应用官方发布页有 DMG装完执行一次sudo xattr -d com.apple.quarantine /Applications/LocalAI.app解除隔离适合 Mac 上想免维护的用户。源码编译适合要改代码的开发者。执行git clone https://gitcode.com/GitHub_Trending/lo/LocalAI进入目录后运行make build产物就是local-ai可执行文件用./local-ai run启动。一句话选型先装 CUDA 驱动就用 NVIDIA 镜像其他独显优先试 Vulkan 镜像什么都不想折腾就用默认的 CPU 镜像。注意安装模型时 LocalAI 会自动检测你的 GPU 能力并拉取对应后端不用手动指定。✅ 装入第一个模型并验证 API模型不用自己找文件。启动后在 Web 界面进入Models → Explore搜索qwen3-4b并点击Install等下载完成即可——这是一个 CPU 就能跑得动的小模型。习惯命令行的话也可以直接装模型local-ai run llama-3.2-1b-instruct:q4_k_m从模型库拉取local-ai run ollama://gemma:2b从 Ollama 的 OCI 仓库拉取。装完后用 API 做真正的效果验证这是 OpenAI 兼容接口任何 OpenAI SDK 只需把地址改成http://localhost:8080curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d {model: qwen3-4b, messages: [{role: user, content: Hello!}]}返回 JSON 里带模型生成的content字段就说明模型已加载 推理链路 API 网关整条通路都通了。同样的问题也可以直接丢进 Web 界面里的 Chat 页面效果一致️ 哪些目录和配置项值得动仓库不大只看三块就够core/主程序本体。HTTP 服务、API 路由、配置管理都在这里core/http/endpoints/下每个文件对应一组 API 端点想确认某个接口存在与否来这里查最快。backend/60 多个推理后端的定义Go、Python、C 三种实现都有。关键设计是后端以独立 OCI 镜像形式按需拉取——你用不到 whisper 就永远不会下载它。gallery/模型配置库每个 yaml 是一个现成模型模板如llama3.2-quantized.yaml自己写模型配置照着抄即可。自定义模型配置就一个最小 YAML常用项四个name: my-model backend: llama-cpp parameters: model: my-model.gguf context_size: 2048 threads: 4backend必须和模型格式匹配GGUF 走llama-cppmodel路径是相对模型目录的不要写绝对路径threads设成物理核心数即可设高了反而互相抢核context_size别贪大超出可用内存会直接 OOM。服务层面真正值得调的只有两项监听地址默认:8080可用--address或环境变量LOCALAI_ADDRESS覆盖和模型目录--models-path指定。对外暴露服务前用LOCALAI_API_KEY你的密钥加一层 API 密钥门槛或LOCALAI_AUTHtrue开启多用户与角色权限。⚠️ 避开新手最常踩的 4 个坑1. 端口 8080 被占连接被拒绝用ss -tlnp | grep 8080看谁占了端口。换端口容器侧改映射如-p 8081:8080二进制侧用local-ai run --address0.0.0.0:8081。反过来curl: (7) Connection refused通常不是端口问题而是服务还没起来先看docker logs local-ai。2. 接口返回 404 model not found十有八九是模型名没对上。执行curl http://localhost:8080/v1/models看服务里实际注册的名字把请求里的model字段改成完全一致。3. 模型找到了但加载失败先确认后端装没装local-ai backends list缺了就local-ai backends install llama-cpp。另一类原因是镜像和硬件不匹配——NVIDIA 镜像忘了加--gpus allGPU 根本不会透传进容器先在宿主机跑nvidia-smi确认驱动正常。4. 推理很慢或内存爆掉慢多半是threads超配或context_size过大内存爆掉则按上一条检查必要时调小context_size。排查时加DEBUGtrue或local-ai run --log-leveldebug看详细日志能直接看到加载在哪一步失败。 跑起来之后往哪走完整文档在 docs/其中 docs/content/getting-started/ 覆盖安装、容器、Kubernetes、排障全文现成模型配置去 gallery/ 翻按模型名找对应 yaml社区问题反馈走官方 Discord入口见 README.md。两个进阶方向多人共用一台服务时把LOCALAI_AUTHtrue打开按用户发 API key、做用量配额机器多了之后可以了解 Distributed ModePostgreSQL NATS 的水平扩展官方文档有专门章节。更多高级用法微调、量化、P2P 推理等请查阅项目官方文档。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考