ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

混合检索+重排:提升RAG检索精度,让你的大模型回答更精准!

混合检索+重排:提升RAG检索精度,让你的大模型回答更精准! 本文介绍了如何通过混合检索和重排技术提升RAG检索增强生成的检索精度。文章首先分析了纯向量检索的局限性特别是在处理精确编号、专有名词等问题上的不足。接着提出了混合检索的策略即结合BM25关键词检索和向量语义检索并使用RRF算法进行结果融合。此外还讨论了重排技术的应用通过使用交叉编码器模型对候选文档进行精排进一步提升检索效果。最后文章提供了一个完整的RAG检索流水线架构并强调了分词、专有名词处理等关键实现细节。做 RAG 的人都经历过同一个尴尬向量检索看着像但答不对。问订单 A2024-001 的状态向量检索召回一堆无关文档——因为向量擅长语义不擅长精确匹配编号问年假几天纯关键词又召回不到同义表达。解法是行业标配的混合检索 重排。这篇讲原理、讲实现附可直接参考的代码思路。一、纯向量检索为什么不够向量检索Embedding 相似度的本质是语义匹配订单 A2024-001 的状态 → 向量 → 找语义相近的块它有两个硬伤场景向量检索表现原因语义相同、用词不同“年假” vs “带薪休假”✅ 擅长语义空间里本来就接近精确编号/型号/人名“A2024-001”、“OSPF”❌ 经常失败编号没有语义梯度向量彼此等距短查询、少上下文“第 3 条规则”❌ 召回分散信息量太少语义锚点不足所以纯向量检索是够用但不好用——最致命的就是精确匹配类问题而这恰恰是企知识库、工单、法务合同里最高频的查询。二、混合检索两路召回各取所长思路BM25关键词管精确匹配向量语义管同义表达两路结果融合。BM25 是老牌关键词检索算法按词频和逆文档频率打分对完整编号、专有名词、术语命中极准但理解不了同义词。融合算法 RRFReciprocal Rank Fusion核心就一行逻辑——不依赖两路各自的分值量纲BM25 分和余弦分根本不可比只信排名# 常数 k 默认 60越大表示越平滑两路的排名差异def rrf_score(rank: int, k: int 60) - float: return 1.0 / (k rank) # rank 从 1 开始def fuse(bm25_results, vector_results, k: int 60, top_k: int 10): 两路结果都是 [(doc_id, rank), ...]rank 从 1 开始 fused {} for doc_id, rank in bm25_results: fused[doc_id] fused.get(doc_id, 0.0) rrf_score(rank, k) for doc_id, rank in vector_results: fused[doc_id] fused.get(doc_id, 0.0) rrf_score(rank, k) # 按总分降序取 Top-K return sorted(fused.items(), keylambda x: x[1], reverseTrue)[:top_k]关键点精确编号类问题BM25 路命中同义表达类问题向量路命中两路都命中的文档排名最高——这就是112。RRF 的好处是不用纠结两路分数怎么归一化直接按排名融合工程上最省心。三、实现要点BM25 路的中文问题BM25 按词频统计中文必须先分词否则订单/编号/状态会被切成单字命中率大降。这一步做错混合检索直接退化成半残。import jiebadef tokenize(text: str) - list[str]: # 索引和查询必须用同一套分词否则词表对不上 return [w for w in jieba.cut(text) if w.strip()]corpus_tokens [tokenize(chunk) for chunk in chunks]query_tokens tokenize(question)推荐用bm25s库轻量、纯 Python比自己写快很多索引和检索都几行import bm25sbm25 bm25s.BM25()bm25.index(corpus_tokens) # 建索引results bm25.retrieve(query_tokens, k20) # 检索 Top-20返回 (doc_ids, scores)小坑专有名词如 “A2024-001”建议加一层不过词保护或检索前对查询里的编号做正则提取、直接做子串匹配兜底能再救回一批精确命中。四、进阶重排Re-Rank——融合后再精排混合检索出了 Top-50还要不要更准加重排用一个模型对候选逐条打分精挑 Top-5。混合检索 Top-50 → 重排模型打分 → 精排 Top-5 → 喂给大模型重排的价值先广撒网召回多再精挑保精度。推荐用交叉编码器类模型如bge-reranker它对问题-文档这一对 jointly 编码打分比纯向量相似度准一个档次——因为它能看到问题和文档的交互信息而不是各算各的再比距离。# 伪代码思路对每个候选文档算 (问题, 文档) 的相关性分from sentence_transformers import CrossEncoderreranker CrossEncoder(BAAI/bge-reranker-v2-m3)pairs [(question, doc) for doc in candidates] # 候选通常是 Top-50scores reranker.predict(pairs)ranked sorted(zip(candidates, scores), keylambda x: x[1], reverseTrue)top5 [doc for doc, _ in ranked[:5]]工程注意重排模型比向量模型重别对全库跑只对召回后的 Top-50 跑成本可控中文场景优先选在中文数据上训过的 reranker。五、完整流水线直接参考的架构1. **文档切分按语义块500-800 字留 10% 重叠避免切断关键信息2. BM25 索引jieba 分词 向量索引Embedding双路建库3. 查询两路召回各 Top-204. RRF 融合 → Top-105. 重排模型精排 → Top-56. 拼进提示词 → 大模型基于资料回答**每一步都能单独评测、单独优化——这也是生产级 RAG 的标准形态。常见踩坑切块太大会导致召回的块里噪声多、重叠不够会切断上下文这两点先调往往比上重排收益还大。六、我的观点RAG 检索的真相没有银弹只有组合拳。数据量小、问题简单、纯同义查询 → 纯向量就够有精确编号/专有名词/术语企知识库、工单、合同→ 必须上混合检索追求极致精度、问答质量直接决定业务结果 → 混合 重排别一开始就上全套——先量问题类型再决定复杂度。我的经验是大多数场景混合检索不加重排已经是性价比拐点能解决 80% 的答不对重排是最后 20% 精度的锦上添花等召回稳定了再上。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取
返回列表