ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

任何/v1/embeddings都能接:LLM Wiki 嵌入端点配置与兼容性完全指南

任何/v1/embeddings都能接:LLM Wiki 嵌入端点配置与兼容性完全指南 任何/v1/embeddings都能接LLM Wiki 嵌入端点配置与兼容性完全指南【免费下载链接】llm_wikiLLM Wiki is a cross-platform desktop application that turns your documents into an organized, interlinked knowledge base — automatically. Instead of traditional RAG (retrieve-and-answer from scratch every time), the LLM incrementally builds and maintains a persistent wiki from your sources。项目地址: https://gitcode.com/GitHub_Trending/ll/llm_wikiLLM Wiki 是一款跨平台桌面应用它把你的文档自动整理成相互链接、可长期维护的知识库。它的语义搜索由一个「嵌入端点embedding endpoint」驱动——只要你的服务提供 OpenAI 兼容的/v1/embeddings接口就能即插即用同时它还内置自动适配 Google Gemini 与火山方舟/豆包协议的能力。本文带你从零完成 LLM Wiki 嵌入端点配置并搞清楚各厂商的兼容细节。LLM Wiki 嵌入端点是什么语义搜索的总开关传统的关键词检索只匹配文字而 LLM Wiki 的语义搜索先把每页内容切块chunk并转成向量再按意思相近来召回。这个过程完全依赖你配置的嵌入端点启用开关关掉后搜索退化为纯 token 匹配打开后语义检索生效。向量存储向量按 chunk 级别存进本地 LanceDB检索时按页聚合打分。多协议自动识别程序根据你填的端点 / 模型名自动选择 OpenAI 兼容、Gemini 原生、火山方舟三种请求格式无需你手动切换。理解这一点后配置目标就清晰了填对端点 模型再按需微调切分与并发参数最后用内置测试验证即可。相关入口与实现分别在设置面板 embedding-section.tsx 与向量管道 embedding.ts 中。一键配置在设置里接入你的 embedding 服务进入设置 → 向量嵌入打开「启用向量搜索」开关下方会展开完整表单。核心字段只有两个——端点与模型其余都是可选项。接入 OpenAI 兼容的 /v1/embeddings 端点这是最通用的形态覆盖 OpenAI、Azure、Ollama、LM Studio、llama.cpp 以及大量自建网关。程序会向端点发送{model, input}请求并读取返回向量。端点示例http://127.0.0.1:1234/v1/embeddings模型示例text-embedding-3-small、text-embedding-004批量支持OpenAI 兼容端点会自动走批量请求单次最多 64 条显著提速。输入模型时下拉会提示常见取值如text-embedding-3-large、nomic-embed-text、mxbai-embed-large、text-embedding-qwen3-embedding-0.6b等自定义模型 ID 也可直接填写。接入 Gemini 原生 embedContent 端点当你填的端点包含generativelanguage.googleapis.com或:embedContent时程序自动切换到 Gemini 原生协议端点示例https://generativelanguage.googleapis.com/v1beta模型填gemini-embedding-001也可gemini-embedding-2认证方式自动改用x-goog-api-key头并把 API Key 从 URL 查询参数中剥离避免泄露在地址里。专属字段输出维度仅对 Gemini 生效作为output_dimensionality发送OpenAI 兼容端点会忽略此项。接入火山方舟 / 豆包 embedding 端点火山方舟.volces.com/volcengine主机被识别后会自动补齐/embeddings路径若模型名含doubao-embedding-vision则改用多模态端点/embeddings/multimodal端点示例https://ark.cn-beijing.volces.com/api/v3模型示例doubao-embedding-text-240715、doubao-embedding-vision路径自动处理已带/embeddings的不会被重复拼接避免 404。本地模型Ollama / LM Studio免 API Key本地服务通常不需要密钥API Key 留空即可。程序会检测到本地/内网地址如127.0.0.1、192.168.x.x自动补一个浏览器风格的Origin: http://localhost头兼容那些对来源校验较严格的本地推理服务器。高级参数切分、并发与批量如何调优端点填对后这些参数决定索引速度与召回质量都可在同一面板调整参数作用建议每块最大字符数单个 chunk 目标长度端点上下文小如n_ctx512、mxbai-embed-large时调低到 500 左右重叠字符数相邻 chunk 重叠避免语义在边界被切断默认 200一般保持即可并发请求数同时进行的请求上限1–32按端点承载能力逐步调高单次请求输入数批量大小1–64仅 OpenAI 兼容端点支持其余自动退回单条自动减半重试是隐藏的防崩机制当端点报输入过长/超出上下文时程序会把文本折半再试最多 3 次而不是直接失败。所以偶尔遇到超长报错时调低每块最大字符数是最稳妥的解法。这些重试逻辑位于后端 search.rs。自定义请求头让网关路由更灵活有些自建网关需要按请求头来路由例如 mify 需要X-Model-Provider-Id: siliconflow。在「自定义请求头」里每行填一条Header-Name: value即可程序会为每个嵌入请求都带上它。需要注意Authorization、Content-Type、Host、Content-Length、x-goog-api-key由系统统一管理你填的会被忽略——这是为了防止误覆盖认证信息。测试连接与功能30 秒验证配置是否正确面板底部提供两个按钮强烈建议配置完各点一次测试连接发送一条短文本做真实嵌入请求返回维度与耗时例如Connected. Returned 1536 dimensions in 210 ms。测试功能连续两次嵌入同一句校验向量是否稳定、有限、非零确认端点行为可复现。这两个测试由 connection-tests.ts 驱动能帮你区分连不上和连上了但向量异常两类问题。如果端点填错错误信息也会直接展示在上次 embedding 错误区域方便定位。重建索引让已有 wiki 用上向量搜索改过端点、模型或维度后旧向量已经失效需要一次性重建点击「重新索引全部页面」面板会实时显示进度如索引中 3/12…。重建采用先校验、后清空、再写入的安全策略若中途个别页面失败会保留它们此前的向量可修复后重试。若检测到旧版按页索引会提示你迁移到新版按 chunk 索引召回质量更高。重建入口与状态订阅同样在 embedding.ts 中实现完成后会提示已索引 N 个页面。常见问题端点报错如何排查404 / 路径不对多半是端点多带了/embeddings或/v1。可借助端点清洗逻辑 endpoint-normalizer.ts 的提示确认你填的是基础地址而非完整请求路径。认证失败OpenAI 兼容端点走 Bearer 认证Gemini 走x-goog-api-key确认密钥填对且未填进 URL。向量维度不稳功能测试报维度变化时检查是否误混用了不同模型或网关路由到了不同后端。本地服务连不上确认内网地址可达程序已自动补 Origin 头仍失败时优先看端点是否要http而非https。把端点、模型、切分三步配好再用测试连接 测试功能确认最后重建索引收尾你的知识库就拥有了可靠的语义检索能力。【免费下载链接】llm_wikiLLM Wiki is a cross-platform desktop application that turns your documents into an organized, interlinked knowledge base — automatically. Instead of traditional RAG (retrieve-and-answer from scratch every time), the LLM incrementally builds and maintains a persistent wiki from your sources。项目地址: https://gitcode.com/GitHub_Trending/ll/llm_wiki创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表