ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

BGE 文本嵌入实战:5 分钟给私有文档接上语义检索

BGE 文本嵌入实战:5 分钟给私有文档接上语义检索 BGE 文本嵌入实战5 分钟给私有文档接上语义检索【免费下载链接】FlagEmbeddingRetrieval and Retrieval-augmented LLMs项目地址: https://gitcode.com/GitHub_Trending/fl/FlagEmbedding你手里有一堆产品手册、内部 wiki、聊天记录想找“哪个片段跟这个问题最相关”。关键词搜索总漏召回自己搭向量库又太折腾——BGE 文本嵌入就是干这个的。三行代码跑通 BGE 文本嵌入# 克隆仓库并安装 git clone https://gitcode.com/GitHub_Trending/fl/FlagEmbedding cd FlagEmbedding pip install -e .from FlagEmbedding import FlagAutoModel # 加载中文嵌入模型检索任务建议带上官方指令 model FlagAutoModel.from_finetuned( BAAI/bge-base-zh-v1.5, query_instruction_for_retrieval为这个句子生成表示以用于检索相关文章 ) emb model.encode([报销流程是什么, 报销需先填单再走审批]) print((emb[0] * emb[1]).sum()) # 内积即相似度跑完你应该看到一个 0 到 1 之间的数。这两句语义相关分数通常在 0.5 以上不相关的低于 0.3。第一圈“文本进、向量出、相关分出来”就闭合了。有两个容易忽略的点一是 query 指令v1.5 中文模型编码查询时建议带上官方前缀少了它召回质量会掉二是设备参数没有显卡就传 cpu先用 small 或 base 规格跑通再说。它到底强在哪拿两个真实场景检验德语合同混在中文 wiki 里也能召回多语言材料塞进中英模型你得先翻译再建索引跨语言查询也基本打不中每种语言单独维护一套索引更累。BGE-M3 在 100 多种语言上训练一个模型同时给密集、稀疏BM25 式的关键词匹配和多向量交互三种检索结果。德语合同、中文产品 wiki、英文论文被编进同一个向量空间跨语言查询直接能命中。MIRACL 多语言检索榜单上M3 排第一。3 万字技术文档整篇切完再检索传统嵌入模型在 512 token 处截断长文档被拦腰砍断关键条款直接丢了。M3 支持最长 8192 token 输入是常规模型的 16 倍容量一篇论文或一份长合同能整段编进去截断损失小很多。如果你的语料里长文档占比高这个参数比换模型更实在。选哪个版本怎么接进你的工程只做中文检索的话说实话 base-zh 起步就够不用纠结 M3。版本擅长场景显存/速度门槛bge-base-zh-v1.5中文文档检索通用CPU 能跑上手最快bge-large-zh-v1.5要更高精度同为单语场景低档 GPU 即可bge-m3多语言 8k 长文档 混合检索8G 显卡比较舒服bge-reranker-v2-m3对第一轮召回再精排一次Reranker与 M3 相当Reranker 的选择上v2-m3 是多语言、推理快部署友好是我个人更推荐的默认项只要中英、追求极致精度再考虑 base/large 老版。M3 那行值得多看一眼它同时输出密集和稀疏两种表示你不用单独再维护一套 BM25。工程已用 LangChain 的话把 embedding 换成 BGE 就行下游 RAG 流程不用重写# LangChain 接入检索管道不用重写 from langchain.embeddings import HuggingFaceEmbeddings embeddings HuggingFaceEmbeddings(model_nameBAAI/bge-base-zh-v1.5)这一步卡住的话先确认模型权重能不能下载九成错误是网络问题也可以把本地模型路径直接填进去。从 Demo 到生产还差什么跑通 demo 只是开始要上线还差三件事叠一层 Reranker拿第一轮召回的结果再精排一次向量 top-20 只是候选集用 bge-reranker-v2-m3 精排后命中率明显上一个台阶reranker 打分脚本可以直接参考。自己挖难负样本检索质量很大程度上由训练数据决定hn_mine.py从候选池里自动挑“像但不对”的负例挖完喂给微调流程脚本在 examples/finetune/embedder/。打开混合检索稠密向量管语义稀疏 BM25 管专有名词和错误码M3 两种表示一起出加权合并后专名场景的漏召回能明显补上。下一步做什么拿自己一份 PDF 跑一遍 chunk embedtop-5 换 top-20 叠 reranker 对比命中率在 examples/ 找最接近业务的 demo 改参数先跑通检索精度慢慢调。【免费下载链接】FlagEmbeddingRetrieval and Retrieval-augmented LLMs项目地址: https://gitcode.com/GitHub_Trending/fl/FlagEmbedding创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表