
前言DeepSeek 实在太火爆了。近期Open AI 推出的 Deep Research深度研究功能引发了广泛关注。该功能通过整合大模型、超级搜索和研究助理于一体使得金融机构能够一键生成报告科研人员能够一键撰写综述极大提升了效率。然而由于企业场景中私有化数据的敏感性和成本考虑如何将 Deep Research 进行开源的本地化部署成为许多人的关注焦点。在这篇文章中我们将对市场上模仿 Deep Research 的开源项目进行简要分析并结合 Deepseek 等主流开源模型Zilliz 推出一款名为 Deep Searcher 的开源项目。该项目的目标是帮助用户在企业级场景下基于 Deep Research的思路实现私有化部署。此外此方案在现有的RAGRetrieval-Augmented Generation方案上进行了重要升级。1、什么是 Deep Research为什么需要开源平替最近OpenAI 推出了一款先进的 AI 研究工具——Deep Research目的是为了帮助用户更高效地处理复杂的研究工作。这款工具基于 OpenAI 最新的 o3 大模型特别针对网络浏览和数据分析进行了优化。第一、核心功能包括多阶段信息搜集与推理Deep Research 能够自动执行多阶段的网络调研迅速整合网络上的大量信息涵盖文本、图片和 PDF 文件。专业报告自动生成通过分析综合数百个在线资源Deep Research 可以在5至30分钟内生成一份包含详细引用的专业报告显著减少传统研究所需的时间。第二、应用场景涵盖学术研究学者和研究人员可以利用 Deep Research 快速搜集相关领域的深入资料辅助撰写论文和进行研究。市场分析企业可以使用此工具进行市场调研、竞争分析和产品比较为商业决策提供支持。产品评估消费者可以利用 Deep Research 比较不同产品的特点和评价做出更明智的购买选择。总体而言Deep Research 作为 OpenAI 推出的深度研究产品旨在通过自动化的信息搜集和分析助力用户高效完成复杂的研究任务。但目前Deep Research 仅对美国地区的 OpenAI Pro 用户开放费用为每月200美元且每月查询次数限制为100次。第三、开源解决方案目前大多数用户尚无法使用 OpenAI 的 Deep Research 功能。不过自从 OpenAI 发布该功能后许多开源社区的贡献者开始分析并尝试复现这一功能。GitHub 上已经出现了多个开源方案它们的实现流程大致分为以下四个步骤第一步问题分析大模型分析用户提出的问题确定回答问题所需的角度和步骤。许多大型模型比如DeepSeek、ChatGPT、Gemini 等只需开启推理选项即可完成这一过程。第二步在线搜索根据大模型生成的问题进行在线搜索获取搜索结果的前 k 项并将内容反馈给大模型。第三步内容总结大模型根据在线内容生成简洁的答案。第四步答案验证将所有内容汇总后由大模型判断答案的完整性和准确性。如果答案完整且准确则输出最终答案。如果达到预设的循环次数或 token 上限同样输出最终答案。否则生成新问题返回第一步并将历史解决信息带入下一轮循环。2、相比传统 RAGDeep Research 有何亮点与不足相较于之前的 RAGRetrieval-Augmented Generation方案新方案实现了以下三个方面的创新第一、判定逻辑通过引入额外的判定逻辑提升了答案的精确度。Deep Research 利用多源验证、逻辑推理等质量控制手段确保了研究成果的可靠性并有效避免了传统 RAG 中常见的无目的检索和过度检索问题。与传统的 RAG 相比Deep Research 在信息整合和验证方面更为严谨。第二、以搜索结果为核心答案主要基于搜索结果而非单纯依赖大模型的生成。大模型的作用在于内容汇总和相关性判断从而增强了答案的可靠性。第三、深度思考与处理复杂任务Deep Research 能够模仿人类研究员进行多阶段的网络研究理解信息、整合资源并根据新发现调整研究策略。这种自主进行多步骤问题解决的能力是普通 RAG 所不具备的。虽然这些优势显著但Deep Research 也存在一些不足。从前面提供的方案中可以看出Deep Research 的响应速度较慢对计算资源和网络环境的要求也更高。更重要的是其答案的主要信息来源依然是公开的网络搜索结果。然而在大多数企业场景中真正有价值的数据通常是企业的内部数据这些数据无法通过在线搜索获取也不适合上传至大模型以避免隐私泄露的风险。此外在线搜索引擎的结果可能包含误导性信息比如广告且一些小众搜索引擎可能存在搜索延迟。鉴于此在多数企业级应用场景中采用基于 Deep Research 思路的私有化部署可能是一个更佳的选择。接下来我们将以 Deep Searcher 为例展示如何结合开源项目和本地数据实现一个升级版的 Deep Research本地部署。3、如何针对私有数据做 Deep Research以下是基于多数开源 Deep Research 方案改进后Zilliz 推出的 Deep Searcher 开源实现方案的架构图从图中可以看出Deep Searcher 通过集成向量数据库 Milvus实现了对用户本地存储数据的快速、低延迟的大规模离线搜索。Deep Searcher 的实现步骤如下第一步问题解析在接收到用户提问后利用 LLMLarge Language Model对问题进行分析生成多个子问题并明确每个子问题对应的数据集。第二步信息检索根据 LLM 的分析结果在向量数据库中检索相关信息。需要注意的是向量数据库中的数据是离线存储的因此在执行查询之前需要先将数据导入数据库。这些数据可以是企业内部数据、在线下载的数据或者是其他系统中定期导入的数据。第三步内容判断向量数据库检索到相似信息后将用户的原始问题、子问题及其对应的搜索结果一同提交给大模型进行内容判断。如果问题已经得到完整回答则进入最终回答阶段。如果达到预设的循环次数或 token 上限同样进入最终回答阶段。否则大模型将生成新的问题并继续下一轮循环。方案亮点包括1私有数据利用充分挖掘私有数据的价值更好地与大模型结合。2向量数据库优势发挥向量数据库在处理大规模数据、低延迟搜索、多种索引策略、高可用性和资源弹性管理等方面的优势。3数据管理通过向量数据库高效管理私有数据对不同类型的数据进行分库分表支持多种应用最大化数据价值降低管理成本。值得注意的是为了更有效地保护私有数据建议使用离线 LLM 大模型。如果使用 LLM API即使仅返回部分检索数据仍然存在数据泄露的风险。4、Deep Searcher 落地效果遵循上述思路Deep Research 的本地部署开源版本——Deep Searcher现已在 GitHub上 开放源代码项目链接为https://github.com/zilliztech/deep-searcher。当前项目功能包括第一、LLM 支持支持 DeepSeek 官方版本、DeepSeek 硅基流动、DeepSeek TogetherAI、OpenAI。第二、Embedding 模型支持支持 Pymilvus 内置模型、OpenAI Embedding、VoyageAI Embedding。第三、数据 Loader 支持支持离线文档比如PDF、Markdown、TXT、在线文档可通过 FireCrawl、JinaReader、Crawl4AI 获取。第四、向量数据库支持支持 Milvus、Zilliz Cloud注册后即可免费体验注册地址https://cloud.zilliz.com.cn/login 或 https://cloud.zilliz.com/。最终效果预览如下GitHub 项目——Deep Searcherhttps://github.com/zilliztech/deep-searcher。项目正处于快速迭代阶段。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】