ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Text Generation Web UI 本地部署与推理后端选型实战

Text Generation Web UI 本地部署与推理后端选型实战 Text Generation Web UI 本地部署与推理后端选型实战【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgenText Generation Web UI 本地部署解决的是一个很具体的问题把本地大模型变成浏览器里能聊天的界面再变成内部工具能直接调的 OpenAI 兼容 API。读完全文你能独立跑通对话界面、按显存选定推理后端、把模型塞进 user_data/models/ 调好参数并用一条 curl 把生成结果接进现有脚本。5 条命令跑通本地 LLM 对话界面拿到仓库后最省事的路径是便携版git clone https://gitcode.com/GitHub_Trending/te/text-generation-webui cd text-generation-webui ./start_linux.shWindows 双击start_windows.batmacOS 执行./start_macos.sh。脚本会用 Miniforge 在installer_files/里建好环境并装依赖装完打开http://127.0.0.1:7860就是主界面。日常启动参数写在user_data/CMD_FLAGS.txt每行一个重启直接复用。手动装 venv 的路径便携版不适合的场景已有自己的 Python 环境、服务器部署可以手动装python -m venv venv source venv/bin/activate pip install -r requirements/portable/requirements.txt python server.py --portable --api --auto-launch按硬件挑 requirements/portable/ 里对应的requirements_*.txt。全量安装ExLlamaV3、训练、图像生成约 10GB 磁盘另需单独装 PyTorch。按显存选推理后端项目内置 5 个后端在 modules/loaders.py 里注册启动参数--loader可以强制指定不传就自动检测llama.cpp便携版默认吃 GGUF 单文件--gpu-layers -1自动把层全塞进显存塞不下再手动降层数。Transformers兼容 HF 多文件模型显存不够可以--cpu或--load-in-8bit。ExLlamaV3 / TensorRT-LLM / ik_llama.cpp显存充裕时的长文本和高吞吐路线需要全量安装。多卡机器在 llama.cpp 下用--tensor-split 60,40把模型切到两张卡--parallel N开 N 个并发请求槽位上下文按槽位均分例如 4 个 8192 上下文的并发就把--ctx-size设 32768。把自己的模型和角色塞进来GGUF 单文件直接丢进user_data/models/界面自动识别不用改任何配置。HF 多文件模型safetensors 那套放进user_data/models/下的子文件夹每个模型一个文件夹。想让某模型开机就加载、上下文固定 8192往user_data/CMD_FLAGS.txt写两行--model 你的模型.gguf和--ctx-size 8192。角色人设是user_data/characters/下的 YAML 文件内置Assistant和Example两个加新文件就是新角色对话模板的 Jinja2 变量会自动套用。三个采样参数管住生成质量生成质量的旋钮很多先用这三个就够temperature随机性主开关0 为纯贪心越高越发散。top_p候选 token 累计概率上限0.95 是常见起点。min_p相对最可能 token 的阈值过滤0.02 起步。复读严重时再加 repetition 类惩罚但一次只动一个参数看效果再动下一个。参数组合存成 YAML 放进user_data/presets/内置几个预设都是社区盲测投票选出来的界面预设菜单里的 按钮会随机拼一个可解读组合生成质量卡死时点它救场。把 OpenAI 兼容 API 暴露给内部工具启动参数加--api5000 端口就多出 OpenAI 兼容端点/v1/chat/completions支持流式和 tool callscurl http://127.0.0.1:5000/v1/chat/completions \ -H Content-Type: application/json \ -d {messages:[{role:user,content:你好}],top_p:0.95,top_k:20}第三方应用把OPENAI_API_BASE指向http://127.0.0.1:5000/v1加一个OPENAI_API_KEY就能直接切过来官方 Python/Node 客户端也适用。完整接口列表见http://127.0.0.1:5000/docs。加--api-key做鉴权加--listen暴露到局域网--nowebui让服务只跑 API 不启界面。工具调用与批量任务Qwen、Mistral、GPT-OSS 这类模型走/v1/chat/completions的tools参数即可做函数调用返回finish_reason: tool_calls后执行工具、把结果作为role: tool消息回传直到stop。每个工具就是一个.py文件默认工具集网页搜索、取时间、骰子在 user_data/tools/照着写新工具即可。批量跑文案就用 Python 客户端并发调 APIllama.cpp 配--parallel开槽位。需要模型贴合业务语料时Training 页可以做 LoRA 微调数据集样例在user_data/training/datasets/。先跑一遍上面的最小对话链路确认环境没问题再决定上哪个后端、把常用参数组合存成预设。最后把--api --listen加进CMD_FLAGS.txt把http://你的内网IP:5000/v1发给同事试一条真实请求。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表