ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DataHub 本地跑通:一条命令拉起的元数据管理与血缘全景

DataHub 本地跑通:一条命令拉起的元数据管理与血缘全景 DataHub 本地跑通一条命令拉起的元数据管理与血缘全景【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahubDataHub 是一个开源的数据目录与元数据管理平台把散落在各个数仓、Kafka、BI 工具里的表、字段和血缘关系集中起来让这张表谁在维护、上游是谁变成一次搜索的事。想体验数据血缘可视化本地部署只需装好 Docker再敲一条命令。装好 Docker 之后真正要敲的命令只有一条。pip install --upgrade acryl-datahub datahub docker quickstart它会自动下载 compose 文件、拉取镜像然后一口气把全家桶拉起来GMS全局元数据服务整个平台的大脑API 在8080端口、前端9002端口、MySQL、Elasticsearch、Kafka。首次拉镜像要几分钟之后就是启动容器。想亲眼看看这套服务怎么协作可以翻一下 docker-compose 全家桶定义或者读一遍快速上手文档。如果卡住了 → 卡在Address already in use说明端口被占用换个端口再跑DATAHUB_MAPPED_FRONTEND_PORT19002 DATAHUB_MAPPED_GMS_PORT18080 datahub docker quickstart。不确定容器是否都起来了敲一句datahub docker check最省事。 资源底线2 核 CPU、8GB 内存、13GB 磁盘给 Docker 用就够了CLI 需要 Python 3.10。这些放这里当脚注不打断主线。别急着配数据源先让演示数据住进去浏览器打开http://localhost:9002用默认账号datahub / datahub登进去欢迎弹窗里就有导入示例数据的选项。想跳过鼠标也可以走终端datahub docker ingest-sample-data跑完再刷新页面搜索框里就能搜出演示平台的表了。这套演示数据带着完整的上下游依赖和标签等于一进门就有人给你画好了地图。第一件正事在一堆表里找到那张表数据目录的核心动作就是找到它。顶栏搜索框不只是按名字匹配它还吃一点查询语法name: *sales*是模糊匹配-snowflake表示排除某个平台短语用引号包住。搜索框左边是浏览区按平台 → 库 → Schema一层层点开像翻目录一样找。侧边栏的过滤器能按标签、负责人、平台收窄结果。如果卡住了 → 刚摄入的数据搜不到多半是搜索索引还没消费完等半分钟再试还是不行就datahub docker quickstart --restore-indices重建一次索引。让表之间的上下游关系自己画出来点开任意一张表的详情页找到 Lineage 这个 tab血缘图就在那儿这张表吃了谁、谁又吃了它。DataHub 的血缘不止表到表这一层。点进一个字段能看到它具体来自上游的哪个字段一路展开就是完整的字段级链路。这是回答这个数为什么对不上时最值钱的能力。如果卡住了 → 血缘是空的先别慌血缘不是凭空长出来的要么靠 SQL 解析要么靠作业平台Airflow、Dagster 这类上报。检查源端配置里有没有开 SQL 解析再看作业事件有没有正常上报。给表上户口标签、术语与负责人找得到表之后要让表变得可信靠的是标注。每张表的详情页都能打标签、挂业务术语、指认负责人——这就是开源数据治理的日常操作面pii、deprecated这类标签打上去团队约定俗成客户主数据这种术语建一次全局复用。**标签和术语都是全局词表先建后用。**打了标、挂了术语、认了主搜索和过滤器就都认它们找所有带 PII 标的表从此是一条搜索的事。把你自己公司的数据接进来演示数据看完下一步就是接真实数据源。界面上点创建数据源或者走更常用的 YAML 配方pip install acryl-datahub[snowflake] # 按需装连接器 datahub ingest -c my_source.ymlrecipe 里写清三件事source 是哪儿、sink 是 DataHub 的 REST 端点、要同步哪些内容。跑通首次同步后给它挂个定时任务元数据就会自己保鲜。DataHub 支持的平台图标墙数据源是插件化的要连哪家就装哪个 extra。想知道 CLI 内部怎么调度这些容器和流水线CLI 的 docker 子命令实现 值得扫一眼。如果卡住了 →datahub ingest -c my_source.yml --debug打开完整日志八成能直接看到是连不上源、还是权限不够。想推倒重来一条datahub docker nuke把数据和卷全清掉只想停容器留数据用datahub docker quickstart --stop。下一步你可以把团队里最痛的一张表所在的数据源MySQL、Snowflake 或 Kafka 都行用一份 recipe 接进来跑通第一次自动同步或者先给几张核心表打上标签、挂上术语让团队从找人问变成自己搜。【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表