ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeerFlow 工具集成实战指南:搜索引擎、私有知识库与MCP一站式配齐

DeerFlow 工具集成实战指南:搜索引擎、私有知识库与MCP一站式配齐 DeerFlow 工具集成实战指南搜索引擎、私有知识库与MCP一站式配齐【免费下载链接】deer-flowAn open-source long-horizon SuperAgent harness that researches, codes, and creates. With the help of sandboxes, memories, tools, skill, subagents and message gateway, it handles different levels of tasks that could take minutes to hours.项目地址: https://gitcode.com/GitHub_Trending/de/deer-flowDeerFlow 是一个能长时间自主干活的开源 SuperAgent 框架会自己搜索、查库、跑代码。本文讲它的工具集成搜索引擎、私有知识库、MCP 与 Python REPL 怎么配、怎么用、注意什么。快速全景DeerFlow 的四件外挂先说结论DeerFlow 本体负责想下面四件外挂分别负责查网上查内部接外部长板和动手算。能力一句话定位解决什么问题搜索引擎给 AI 一双联网的眼睛全网资讯、学术文献的获取私有知识库让 AI 读你的内部文档企业知识资产的问答与引用MCP 协议给 Agent 插U盘接入任意第三方工具服务Python REPL让 AI 自己动手算数据计算、统计分析、结果验证四者怎么协作一句话搜索和知识库负责进料MCP 负责加工具REPL 负责动手验证最后 Agent 汇总出报告。搜索能力从全网捞到学术精查这节解决的问题是AI 联网查资料时用哪个引擎、怎么切换、结果长什么样。日常网络搜索Tavily、Brave、DuckDuckGo 怎么选DeerFlow 里所有搜索引擎都挂在一个叫web_search的工具名下切换引擎就是换一条配置项对 Agent 完全透明。DuckDuckGo默认引擎免 API Keygit clone下来就能跑适合先熟悉流程。Tavily为 AI 场景设计的搜索服务能返回正文摘要甚至图片及图片描述做深度研究时信息密度更高需要TAVILY_API_KEY。Brave Search独立索引、隐私取向质量稳定需要BRAVE_SEARCH_API_KEY单次最多返回 20 条。SearXNG自己搭一套元搜索不依赖任何第三方适合数据合规要求高的团队。简单说先用 DuckDuckGo 跑通正式干活再换 Tavily 或 Brave。学术文献检索Arxiv 的特殊价值查论文和查资讯是两回事。Arxiv 引擎直接对接预印本数据库返回的不只是标题和摘要还能带上作者、机构等完整元数据并且结果按相关性排序。做技术调研时你可以让 Agent 只在这个引擎里找最近一年某方向的代表性论文省掉了手动去 Arxiv 网站筛选的功夫。一张表搞定切换搜索引擎配置速查在config.yaml的tools:区块里同一时间只保留一条web_search其余注释掉即可引擎API Key一句话特点DuckDuckGo不需要默认启用开箱即用SearXNG不需要自建聚合多源数据自主可控Brave SearchBRAVE_SEARCH_API_KEY独立索引商业级质量TavilyTAVILY_API_KEY面向 AI支持正文与图片SerperSERPER_API_KEY拿 Google 搜索结果Arxiv不需要学术论文专用元数据完整tools: # 默认DuckDuckGo免 API Key - name: web_search group: web use: deerflow.community.ddg_search.tools:web_search_tool max_results: 5 # 换成 Tavily注释掉上面一条启用下面这条 # - name: web_search # group: web # use: deerflow.community.tavily.tools:web_search_tool # max_results: 5 # # api_key: $TAVILY_API_KEY不管用哪个引擎AI 拿到的都是统一的标准化结构每条结果大致长这样[ { type: page, title: …, url: …, content: 摘要…, score: 0.91 }, { type: image, image_url: …, image_description: 图表内容描述 } ]type区分网页结果和图片结果content是可直接喂给模型的内容score是相关性评分。换引擎不改变下游处理逻辑这就是统一接口的好处。私有知识库让AI读你的内部文档这节解决的问题是公司 wiki、产品手册、历史工单这些网上搜不到的知识怎么让 AI 用上。开源项目接私有知识库的理由很朴素——大模型不知道你昨天刚改的需求文档但 RAG检索增强生成能先查出相关片段再交给模型答案就有了出处。DeerFlow 内置两条路径RAGFlow 和 VikingDB。RAGFlow vs VikingDB一张对比表说清差异维度RAGFlowVikingDB部署方式开源自建Docker 一键起火山引擎托管云服务认证方式API KeyBearer 头AK/SK HMAC-SHA256 请求签名环境变量数量2 个起步3 个起步适合谁数据不能出内网的团队已用火山引擎、想省运维的团队接入三步走配环境变量、声明工具、验证检索第一步配好环境变量RAGFlow 路径export RAGFLOW_API_URLhttp://localhost:9388 export RAGFLOW_API_KEYragflow-xxxxVikingDB 则换成三个变量export VIKINGDB_KNOWLEDGE_BASE_API_URLapi-knowledgebase.mlp.cn-beijing.volces.com export VIKINGDB_KNOWLEDGE_BASE_API_AK你的AK export VIKINGDB_KNOWLEDGE_BASE_API_SK你的SK第二步在config.yaml里声明知识检索工具tools: - name: knowledge_search group: knowledge use: deerflow.community.ragflow.tools:knowledge_search_tool base_url: http://localhost:9380 api_key: $RAGFLOW_API_KEY # datasets: # 可选限定 Agent 能碰的 dataset ID # - 0123456789abcdef0123456789abcdef page_size: 8 similarity_threshold: 0.2第三步发一句帮我查一下 XX 文档里怎么写的看返回是否带上你知识库里的原文片段。能命中就说明链路通了。资源URI格式rag:// 协议一句话讲清知识库资源用统一 URI 标识格式是rag://dataset/{resource_id}[#{document_id}]前缀声明这是 RAG 资源resource_id指向知识库#后面可选的片段精确到某一篇文档。这样无论后端是 RAGFlow 还是 VikingDBAgent 引用资源的写法都一致。MCP协议给Agent插U盘扩展工具这节解决的问题是DeerFlow 没有的工具怎么不碰源码就给它加上。MCPModel Context Protocol可以理解成 AI 世界的 USB 接口你写好一个标准格式的U盘MCP 服务器插上去 Agent 就能识别并用里面的工具双方都不用改接口。三种连接方式怎么选stdio / SSE / streamable_httpstdio本地起个命令通过标准输入输出通信。适合跑在你自己机器上的工具比如npx拉一个现成的 MCP 服务器。SSE服务器主动推事件适合需要实时数据流的服务。streamable_http走普通 HTTP 流式接口适合部署在远端、带鉴权头的服务是跨网络场景的默认选择。一句话本地用 stdio远端用 http要实时推送才上 SSE。工具怎么被发现并分配给指定AgentMCP 服务器写在extensions_config.json里。启动时 DeerFlow 会自动向服务器问你有哪些工具拿到工具清单后再按你的配置决定给谁用mcpServers: { github: { enabled: true, type: stdio, command: npx, args: [-y, modelcontextprotocol/server-github], env: { GITHUB_TOKEN: $GITHUB_TOKEN }, session_init_timeout: 60 } }还可以用tool_name_prefix给工具名加前缀防冲突用超时字段session_init_timeout、tool_call_timeout控制卡死行为。服务器挂了只影响它自己的工具不会拖垮主流程。安全开关默认关闭怎么打开所有 MCP 服务器默认enabled: false——写了配置不等于生效这是防误开的保险。把它改成true并重启 Gateway 即可。另外别把密钥明文写进配置统一用$GITHUB_TOKEN这种环境变量引用形式。Python REPL让AI自己跑代码验证这节解决的问题是AI 给出的数字你敢信吗REPL 就是让它当场算给你看。能干什么一句话列举统计计算、数据分析、算法验证、数学建模。典型场景是这组数据的均值和标准差是多少——REPL 里print出来的结果直接可见而不是 AI 凭印象编一个数。怎么开启环境变量与真值写法工具默认关闭靠环境变量开启# true / 1 / yes / on 均可不区分大小写 export ENABLE_PYTHON_REPLtrue注意写法必须落在上面四个值里写成enabled或TRUE_PLEASE这种都不算数。安全边界它不能做什么默认禁用不设环境变量就永远调不动生产环境想开就显式开。输入严格校验代码不是字符串会直接拒绝执行并返回错误信息。异常隔离任何执行异常都被捕获、记日志后返回不会把整个 Agent 进程带崩。日志可追溯每次执行都有 info/error 级别日志出事后能查到跑了什么。小例子你问这几列数据里哪个变量和存活率关系最大REPL 里 AI 会自己写几行 pandas 代码算相关性矩阵、print出排序结果再基于真实输出回答你。上面这张热力图就是这类代码分析的直接产物。配置速查与常见坑关键环境变量汇总表环境变量所属模块必填说明TAVILY_API_KEY搜索引擎用 Tavily 时必填Tavily 服务密钥BRAVE_SEARCH_API_KEY搜索引擎用 Brave 时必填Brave Search 密钥RAGFLOW_API_URL私有知识库用 RAGFlow 时必填RAGFlow 服务地址RAGFLOW_API_KEY私有知识库用 RAGFlow 时必填认证密钥VIKINGDB_KNOWLEDGE_BASE_API_URL私有知识库用 VikingDB 时必填API 地址VIKINGDB_KNOWLEDGE_BASE_API_AK私有知识库用 VikingDB 时必填Access KeyVIKINGDB_KNOWLEDGE_BASE_API_SK私有知识库用 VikingDB 时必填Secret KeyENABLE_PYTHON_REPLPython REPL否默认关闭取值 true/1/yes/on高频踩坑点MCP 配了没生效八成是enabled还是false或者改完配置没重启 Gateway。API Key 写进配置文件别把密钥明文塞进 yaml/json一律用$VAR形式引用环境变量配置文件才能安心进版本库。搜索引擎切不动tools:里出现了两条name: web_search后写的会打架。切引擎时记得注释掉旧的那条。REPL 设了却禁用检查值是不是true/1/yes/on之一写错真值等于没开。四件外挂各管一段搜索引擎管外部世界知识库管内部资产MCP 管能力扩展REPL 管动手验证。它们互不依赖按需开启配到哪一层 Agent 就强到哪一层。【免费下载链接】deer-flowAn open-source long-horizon SuperAgent harness that researches, codes, and creates. With the help of sandboxes, memories, tools, skill, subagents and message gateway, it handles different levels of tasks that could take minutes to hours.项目地址: https://gitcode.com/GitHub_Trending/de/deer-flow创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表