ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

MaxKB 网页抓取完全指南:把整站网页变成可问答的知识库

MaxKB 网页抓取完全指南:把整站网页变成可问答的知识库 MaxKB 网页抓取完全指南把整站网页变成可问答的知识库【免费下载链接】MaxKB MaxKB is an open-source platform for building enterprise-grade agents. 强大易用的开源企业级智能体平台。项目地址: https://gitcode.com/GitHub_Trending/ma/MaxKBMaxKB 是一款开源的企业级智能体平台它的网页抓取功能可以直接以 URL 为输入系统访问目标网页、提取正文、转成 Markdown、按知识库规则分段并向量化最终形成可被智能体检索问答的知识内容。对于帮助文档散落在网站上、产品说明频繁改版这类场景MaxKB 网页抓取让知识库的构建和更新从人工搬运变成一条链接的事。MaxKB 网页抓取的三个使用入口同一套抓取能力MaxKB 在不同位置提供了三种用法按需选择即可知识库网页文档在知识库中直接添加网页链接类型的文档适合把某站文档沉淀进知识库工作流网页数据源节点在智能体工作流里挂载网页数据源运行时实时抓取并参与问答网页同步任务对已建的网页文档重新抓取覆盖旧内容。对应的实现分别在 apps/knowledge/api/document.py 和 apps/application/flow/step_node/data_source_web_node/ 目录下有兴趣看源码可以直接翻。网页链接创建知识库文档两步建好网页知识库创建知识库并添加网页 URL登录 MaxKB新建知识库填写名称与描述在知识库中点击添加文档选择网页链接类型输入目标 URL——接口层面source_url_list是列表字段也就是说一次可以批量粘贴多个地址再提交后系统会在后台任务中逐页抓取。抓取过程发生了什么抓取逻辑在 apps/common/utils/fork.py 中实现可以概括为四个动作请求与解码发起 GET 请求自动识别页面 meta 中声明的字符集避免中文页面乱码正文提取默认抓取body也支持用 CSS 选择器指定区域Markdown 化HTML 正文经markdownify转成 Markdown 文本便于后续分段同源链接发现只解析与源地址同前缀的内部链接过滤mailto:、javascript:、外部跳转等无效链接并自动去重避免重复抓取同一个页面。进阶配置让抓取更干净用 CSS 选择器过滤无关内容添加网页文档时的selector参数支持.class、#id、标签名三种写法多个用空格分隔。例如某个文档站正文都在.article-content里填上这个选择器广告位和侧边栏就被自动排除了。不填时默认抓body全量内容。在工作流中配置网页数据源节点如果你的场景是回答前实时查官网可以在工作流里添加网页数据源节点只需要两个参数Web source url网页根地址Web knowledge selector内容选择器默认body。节点执行时会按根地址 → 内部链接展开抓取把结果作为文档列表交给下游的知识库或检索节点。节点表单定义见 base_data_source_web_node.py。重新同步已有网页文档网页内容更新后无需删除重建对网页文档执行同步接口在apps/knowledge/api/document.py的SyncWebAPI后台 Celery 任务 sync_web_document 会按原 URL 与选择器重新抓取并刷新内容。文档量大或更新频繁时这一环节最省事。典型使用场景场景做法收益产品帮助中心接入客服智能体帮助中心根 URL 建网页文档定期同步文档改版后知识库内容跟随更新技术文档站沉淀为内部知识批量粘贴多篇文档 URL用选择器只取正文免去逐页复制粘贴实时查外部资料工作流挂网页数据源节点每次问答拿到的都是页面当前内容配合 MaxKB 的工具能力知识库问答还能衔接外部查询。比如内置的搜索工具配置以及数据库类工具以 PostgreSQL 工具为例这类工具加上网页抓取进来的知识库可以组成文档知识 实时检索 业务数据的完整问答链路。注意事项与部署几条实践建议只抓取允许访问的公开页面控制访问频率别给对方站点造成压力动态渲染前端 JS 生成的内容页面静态抓取可能拿不到正文这类站点建议以静态页为主抓取后先抽查几篇文档的分段质量再决定是否加选择器或调整分段策略。部署方面MaxKB 提供 Docker 部署方式installer/目录下有各组件的启动脚本与 Dockerfile按官方部署文档操作即可跑起来。首次体验时界面大致如下小结MaxKB 网页抓取把找到链接 → 提取正文 → 向量化入库这条链路做成了平台内建能力知识库文档、工作流节点、同步任务三种入口覆盖了沉淀、实时、更新三类需求CSS 选择器和批量 URL 则解决了抓什么、抓多少的精细控制。如果你的知识来源长期存在于网页上这是值得优先尝试的自动化路径。【免费下载链接】MaxKB MaxKB is an open-source platform for building enterprise-grade agents. 强大易用的开源企业级智能体平台。项目地址: https://gitcode.com/GitHub_Trending/ma/MaxKB创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表