ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Ray对象存储与数据流:快速理解分布式对象的内存管理精髓

Ray对象存储与数据流:快速理解分布式对象的内存管理精髓 Ray对象存储与数据流快速理解分布式对象的内存管理精髓【免费下载链接】rayRay is an AI compute engine. Ray consists of a core distributed runtime and a set of AI Libraries for accelerating ML workloads.项目地址: https://gitcode.com/gh_mirrors/ra/rayRay 对象存储Object Store是 Ray 分布式计算引擎的共享数据中枢。它让每个集群节点拥有一块共享内存区域任务与 Actor 产生的分布式对象可以被高速读写、零拷贝共享并通过自动溢写Spilling与分布式引用计数实现内存的精巧管理。本文用一篇图解指南帮你快速理解 Ray 数据流的运作方式与分布式对象的内存管理精髓。什么是 Ray 对象存储Object Store在 Ray 中任务和 Actor 都会创建和消费数据对象这些对象被称为远程对象Remote Object——它们可以存放在集群中的任意节点上并通过 **对象引用ObjectRef类似指针/唯一 ID**来间接访问。每个节点运行一个对象存储进程基于共享内存实现默认占用节点可用内存的 30%可通过启动参数调整。它有几个关键特性不可变性对象创建后不可修改因此可以安全地在多节点复制而无需同步零拷贝读取对 numpy 数组等数据类型ray.get()直接返回指向共享内存的视图无需序列化拷贝分布式引用计数只要集群中还有任意ObjectRef引用某个对象它就钉在内存中所有引用消失后自动释放。如上图所示在 Ray Data 这类数据流场景中数据块在各阶段下载、GPU 推理、写回之间流经对象存储的共享内存避免落盘和重复拷贝这正是对象存储 数据流组合的威力。相关概念详见 doc/source/ray-core/objects.rst 与 doc/source/ray-core/scheduling/memory-management.rst。对象如何在集群中流动put、get 与传参 对象的生产与消费只有两个入口ray.put()手动把对象放入对象存储返回一个 ObjectRef远程调用返回值task.remote()完成后结果自动写入对象存储并返回 ObjectRef。取回数据时用ray.get()——如果当前节点没有该对象Ray 会自动从持有它的节点下载。值传递 vs 引用传递Ray 对传参方式有一个巧妙的约定传参方式行为适用场景对象作为顶层参数传入任务Ray 先解引用等待数据就绪才执行任务按值任务确实要用数据对象嵌在列表/字典中传入不解引用只传指针按引用只转发引用、不消费数据这意味着如果你只是想把数据转交给下游任务而不查看它用嵌套引用传递可以让数据完全不需要移动到当前机器上既省内存又省网络带宽。分布式引用计数自动内存回收的精髓 Ray 实现了分布式引用计数任何处于作用域内的ObjectRef都会把对象钉在对象存储中。共有 5 类引用来源可通过ray memory命令逐一看到LOCAL_REFERENCE本地 Python 变量持有的引用PINNED_IN_MEMORYray.get()反序列化后数据直接指向共享内存变量未删除前对象无法驱逐USED_BY_PENDING_TASK有未完成任务依赖该对象CAPTURED_IN_OBJECT引用被序列化进了另一个对象内部Actor HandlesActor 持有引用。 新手最常见的内存坑闭包捕获closure capture会把对象钉住直到作业结束以及ray.get()后忘记删除变量导致已用完的数据仍占着对象存储。详细的 5 类引用示例与ray memory调试方法见 doc/source/ray-core/scheduling/memory-management.rst。内存不够了怎么办对象溢写Spilling当对象存储被填满时Ray 不会让你等到任务失败——它会触发对象溢写自动把部分已钉住的对象从共享内存溢写到本地磁盘默认临时目录或 S3当该对象再次被ray.get()访问时透明地恢复回内存整个过程对应用代码完全无感知相当于用磁盘扩容了对象存储的容量代价是 I/O 延迟。其内部分为三层保证核心执行路径不被拖慢检测层Plasma 存储线程内存分配失败时立即回调编排层Raylet 主线程基于 LRU 与钉住状态决定溢写谁并批量执行执行层独立 Python IO Worker 进程通过 gRPC 完成磁盘/S3 读写I/O 再慢也不阻塞调度。架构与状态机图解见 doc/source/ray-core/internals/object-spilling.rst用户级配置如自定义溢写目录--object-spilling-directory见 doc/source/ray-core/objects/object-spilling.rst。上图是 Ray Dashboard 的节点硬件利用率面板右下角的Node Memory (heap object store)曲线能直接看到堆内存与对象存储内存的叠加变化——排查内存问题时第一眼就该看它。实战排查用 ray memory 定位内存大头 当遇到ObjectStoreFullError对象存储满或内存持续增长时在应用运行期间执行ray memory它会输出每个节点的对象内存用量、引用数量汇总每个ObjectRef的持有者Driver/Worker、引用类型、对象大小、创建它的代码行全集群的溢写统计已溢写/已恢复数据量与吞吐。配合排序参数如按对象大小排序、按堆栈分组可以快速锁定哪一行代码造成了内存泄漏。关键路径速查清单 你想了解去哪里看远程对象、ObjectRef、序列化doc/source/ray-core/objects.rst、doc/source/ray-core/objects/serialization.rst内存模型与ray memory调试doc/source/ray-core/scheduling/memory-management.rst对象溢写原理含架构图doc/source/ray-core/internals/object-spilling.rst溢写目录配置与统计doc/source/ray-core/objects/object-spilling.rst数据流式处理的内部机制doc/source/data/data-internals.rst大对象传参的反模式与优化doc/source/ray-core/patterns/pass-large-arg-by-value.rst小结Ray 对象存储的核心思想可以浓缩为三句话共享内存实现零拷贝数据流、分布式引用计数实现自动内存回收、对象溢写实现内存磁盘的弹性扩容。理解这三点你就掌握了 Ray 分布式对象内存管理的精髓也能在遇到ObjectStoreFullError时从容排查 【免费下载链接】rayRay is an AI compute engine. Ray consists of a core distributed runtime and a set of AI Libraries for accelerating ML workloads.项目地址: https://gitcode.com/gh_mirrors/ra/ray创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表