ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

从内存计算走向 PB 级数据湖,深入理解 SAP HANA Cloud, data lake 的架构、SQL 分析与企业级数据分层

从内存计算走向 PB 级数据湖,深入理解 SAP HANA Cloud, data lake 的架构、SQL 分析与企业级数据分层 很多熟悉 SAP HANA 的开发者和架构师,第一次看到SAP HANA Cloud, data lake时,很容易把它理解成给 HANA 增加了一块容量更大的廉价磁盘。真正进入 SAP HANA Cloud 的架构以后,会发现这种理解明显低估了它。SAP HANA Cloud, data lake不是单纯的归档空间,也不是只能保存冷数据的对象存储。按照 SAP 当前官方产品定义,它由两个角色差异很明显的组件构成,data lake Files面向结构化、半结构化和非结构化文件,提供托管的文件型对象存储能力,data lake Relational Engine则是可选的高性能关系分析引擎,面向 PB 级关系数据执行 SQL 分析。两者组合在一起,构成了一套横跨数据库、关系分析和对象存储的数据平台。理解这一点以后,再看 SAP HANA Cloud 的整体数据架构就顺畅多了。我们的核心交易数据、需要极低延迟访问的数据、实时计算模型以及高价值业务数据,可以继续发挥 SAP HANA 内存数据库的优势。规模非常大、仍然需要关系模型和复杂 SQL 分析的数据,可以进入data lake Relational Engine。日志、历史文件、CSV、Parquet以及各种半结构化文件,则可以放入data lake Files。这样形成的不是简单的冷热数据搬迁,而是一套计算能力与存储形态相互配合的数据架构。
返回列表