ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Eigent 本地模型接入:从平台选型到验证跑通的完整路径

Eigent 本地模型接入:从平台选型到验证跑通的完整路径 Eigent 本地模型接入从平台选型到验证跑通的完整路径【免费下载链接】eigentEigent: The Open Source Cowork Desktop - Local and Free Alternative to Claude Cowork and Codex项目地址: https://gitcode.com/GitHub_Trending/ei/eigent这篇指南带你把本机上的 Ollama 或 vLLM 推理服务接入 Eigent并跑通官方的 function calling 验证。前提是本地推理工具已装好、能正常拉起服务Eigent 桌面端已启动。先搞清楚你要接什么本地模型选型Eigent 里每个 agent 的调用最终都落到一个模型端点本地模型部署做的事就是把自托管的推理服务填到这个端点上让请求和数据不出本机。它在整体流程中处于模型层先在本机拉起推理服务再在设置界面填端点和模型名最后用内置的 function calling 测试完成验证。各平台内置的默认端点定义在 src/pages/Agents/localModels.ts选型看这张表平台特点适用场景Ollama一条命令拉模型并起服务上手成本最低本地模型部署入门首选vLLM高吞吐推理引擎OpenAI 兼容接口GPU 显存充足时选它SGLang优化生成框架长上下文吞吐高长文档与高并发场景LM Studio图形界面下载并启动模型不用命令行偏好可视化操作LLaMA.cpp 也内置支持默认端点 http://localhost:8080/v1适合没有 GPU 的 CPU 机器兜底。跑通本地模型最小链路分平台四个平台在设置里都是填三个字段平台、端点 URL、模型名默认端点已预填端点后都要带/v1。Ollama# 启动 Ollama 本地推理服务默认端口 11434 ollama serve平台Ollama端点 URLhttp://localhost:11434/v1漏填/v1会被客户端自动补上模型名qwen2.5:7b需带 tag 且与本机已拉取的模型一致。验证点浏览器访问该地址的/api/tags返回本地模型列表 JSON 即说明服务在跑。vLLM# 启动 vLLM 推理服务默认端口 8000替换为你要加载的模型 vllm serve Qwen/Qwen2.5-1.5B-Instruct平台vLLM端点 URLhttp://localhost:8000/v1模型名与启动命令实际加载的模型一致。验证点浏览器访问/v1/models返回含模型 id 的 JSON 即 OK。SGLang# 启动 SGLang 推理服务默认端口 30000 python -m sglang.launch_server --model-path Qwen/Qwen2.5-1.5B-Instruct平台SGLang端点 URLhttp://localhost:30000/v1模型名与--model-path加载的模型对应。验证点同 vLLM访问/v1/models能列出模型即通了。LM StudioLM Studio 是图形界面下载模型后在 Developer 面板启动本地服务器无需命令。平台LM Studio端点 URLhttp://localhost:1234/v1模型名LM Studio 中显示的模型 ID。验证点访问/v1/models返回已加载模型即正常。连接验证与常见卡点点设置里的验证弹出提示验证成功模型支持 function calling才算真正跑通——验证会真实发起一次工具调用请求流程实现在 backend/app/controller/model_controller.py。高频卡点连接超时或拒绝连接→ 先确认本地服务进程还活着端口是否对应Ollama 11434、vLLM 8000、SGLang 30000、LM Studio 1234本机防火墙是否拦截了 localhost 回环。验证报模型不支持 tool calling→ 这是使用 Eigent 的硬性门槛3B 以下小模型或非 Instruct 的 base 模型基本过不了换 7B 级别的 Instruct 模型再试。404 或提示模型不存在→ 模型名和服务实际加载的不一致打开/v1/models对照真实 idOllama 尤其别漏 tag写成qwen2.5而不是qwen2.5:7b。模型参数字段标红→ 该字段只接受 JSON 对象不想覆盖参数就留空别填注释或非对象内容。让性能再高一档可选进阶换量化版本用 Q4_K_M 这类量化权重能明显降低显存占用让显存有限的机器也能跑 7B–14B 模型。用模型参数字段覆盖请求参数该字段接受一个 JSON 对象可覆盖上下文长度等请求级参数本地小模型上常用。vLLM 调并发显存富余时调大--max-num-seqs和显存利用率参数能提升多 agent 并发调用下的吞吐。验证跑通后Eigent 的本地模型部署就齐了后续所有请求都走你自己的端点数据不出机器也不用再算 API 调用成本。【免费下载链接】eigentEigent: The Open Source Cowork Desktop - Local and Free Alternative to Claude Cowork and Codex项目地址: https://gitcode.com/GitHub_Trending/ei/eigent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表