Windows下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-win-cuda-12.4-x64.zip) 文章目录1. llama.cpp 简介2. b10068 版本亮点3. 获取安装包4. 快速开始1. llama.cpp 简介llama.cpp 是使用纯 C/C 实现的大语言模型LLM推理引擎由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建。最初是作为一个周末项目目标是在 MacBook 上运行 Meta 的 LLaMA 模型无需 Python、PyTorch 或 CUDA 依赖。如今它已成为全球最受欢迎的本地 LLM 推理框架之一截至 2026 年中GitHub Stars 突破 11.7 万拥有超过 700 位贡献者和近 2 万个 fork。2026 年 2 月Gerganov 与核心团队成员Xuan-Son Nguyen、Aleksander Grygier加入 Hugging Face 成为全职员工llama.cpp 仓库也从ggerganov/llama.cpp迁移至ggml-org/llama.cpp但项目始终保持 100% 开源MIT 许可证和完全的技术自主权。llama.cpp 是 Ollama、LM Studio、GPT4All、LocalAI 等数十个知名本地 AI 工具的底层推理引擎生态影响力极其广泛。llama.cpp 的核心目标是以最低的设置成本在各种硬件上实现最先进的 LLM 推理性能——无论是在本地还是在云端。其核心特色包括零依赖纯 C/C 实现无需 Python、PyTorch 等环境下载即可运行广泛硬件支持Apple SiliconARM NEON、Accelerate、Metal、NVIDIA GPUCUDA、AMD GPUHIP、Intel GPUSYCL、OpenVINO、Vulkan、WebGPU 等灵活量化支持 1.5 位至 8 位整数量化显著降低内存占用和提升推理速度CPUGPU 混合推理支持超出显存容量的大模型部分加速OpenAI API 兼容服务通过llama-server一键启动与 OpenAI API 兼容的 HTTP 服务庞大模型生态支持 LLaMA、Mistral、Qwen、Deepseek、Gemma、Phi 等近百种模型架构的 GGUF 格式2. b10068 版本亮点llama.cpp 采用持续构建build number版本号体系b10068 发布于 2026-07-18主要包含以下更新DFlash 注入 K/V 缓存旋转修复了在使用 K/V 量化时DFlash 注意力机制中注入的 K/V 缓存需要旋转的问题提升了量化场景下的推理正确性。本整合包选用llama-b10068-bin-win-cuda-12.4-x64.zip适用于 Windows x64 系统使用 NVIDIA CUDA 12.4 后端进行 GPU 加速推理。环境要求需安装 NVIDIA CUDA Toolkit 12.4 或更新版本并配备支持 CUDA 的 NVIDIA 显卡计算能力 ≥ 5.0推荐 GTX 10 系列及以上。若未安装 CUDA 或使用非 NVIDIA 显卡请改用 CPU 版本或 Vulkan 版本。3. 获取安装包如果访问 GitHub 不便安装包及中文文档https://hanshuixin.org/go/223T内含 llama-b10068-bin-win-cuda-12.4-x64.zip、README 中英对照、发布说明中英对照和 LICENSE。Windows安装llama.cpp-b10068llama-b10068-bin-win-cuda-12.4-x64.zip ├── llama-b10068-bin-win-cuda-12.4-x64.zip ← 官方预编译包解压后为各工具 .exe ├── Windows安装llama.cpp-b10068llama-b10068-bin-win-cuda-12.4-x64.pdf ├── README/ │ ├── README.md │ └── README-中文版.md ├── 发布说明/ │ ├── RELEASE-NOTES.md │ └── RELEASE-NOTES-中文版.md └── LICENSE适用显卡本整合包内为 CUDA 版本仅适用于NVIDIA 显卡GTX 10 系列及以上计算能力 ≥ 5.0。若您使用AMD 显卡请选用 HIPRadeon版本若使用Intel 显卡请选用 SYCL 或 OpenVINO 版本若无独立显卡或使用其他品牌请选用 CPU 或 Vulkan 版本。4. 快速开始将整合包根目录中的llama-b10068-bin-win-cuda-12.4-x64.zip解压到任意目录即可得到以下命令行工具工具用途llama-cli.exe命令行对话推理llama-server.exeOpenAI API 兼容 HTTP 服务llama-perplexity.exe模型困惑度评测llama-bench.exe推理性能基准测试llama-simple.exe最小推理示例解压后打开命令提示符cmd或 PowerShell进入解压目录执行以下常用命令# 使用本地 GGUF 模型文件进行对话llama-cli-mmy_model.gguf# 直接从 Hugging Face 下载并运行模型llama-cli-hfggml-org/gemma-3-1b-it-GGUF# 启动 OpenAI 兼容 API 服务默认端口 8080llama-server-mmy_model.gguf--port8080# 启动服务并支持多用户并行请求llama-server-mmy_model.gguf-c16384-np4# 使用推测解码加速推理llama-server-mmodel.gguf-mddraft.gguf# 运行性能基准测试llama-bench-mmy_model.gguf# 使用自定义语法约束 JSON 输出llama-cli-mmy_model.gguf-n256--grammar-file grammars/json.gbnf提示模型文件.gguf 格式可从 Hugging Face GGUF 模型库 获取。也可通过-hf参数直接从 Hugging Face 下载。

本月热点