ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

π0.5论文阅读

π0.5论文阅读 训练过程1、模型权重从在网络上训练的标准视觉语言模型初始化Gemme。2、首先数据方面预训练阶段整合所有数据源生成带有离散token的初始变长度动作。数据包含来自多种机器人平台的数据、高层语义动作预测数据以及网络数据。机器人的动作采用FAST action tokenizer 将动作转换为token。纳入了一组多样化的网络数据包括预训练阶段的图像描述、问答以及目标定位任务。对于目标定位通过添加带有边界框标注的室内场景和家居物品额外网络数据对标准数据集进行了进一步扩展。对于所有动作数据训练模型来预测目标关节和末端执行器位姿。为了区分这两者我们在文本提示词中添加了‘control_mode joint/end effector control_mode’。所有动作数据均通过各数据集每个动作维度的1%和99%分位数归一化至[−1,1]。将动作action的维度设置为固定值和Π0一样)以适配所有数据集中最大的动作空间。对于配置和动作空间维度较低的机器人对动作向量进行零填充和Π0一样。3、后训练阶段针对移动操作的低层和高层推理对模型进行定制利用与任务最相关的数据包括人类监督者的语言指令。该阶段使用流匹配来表示动作分布动作专家实现高效的实时推理并能表示细粒度的连续动作序列。推理时模型先推理出高层子任务再基于该子任务预测动作。4、推理时模型首先为机器人生成要执行的高级子任务然后基于该子任务通过动作专家预测低级动作。仿佛不是端到端更像是训练了两个模型上层是视觉语言模型下层是语言动作模型但其实不是这两个共享同一个神经网络模型既完成了对任务的分解又完成了基于子任务的动作输出5、预训练阶段Π基于机器人与非机器人数据进行训练作为标准的transformer进行训练。6、高级子任务预测将高层级任务指令打扫卧室拆解为整理毯子、捡起枕头等更为简短的子任务能够帮助训练好的策略对当前场景进行推理更好地确定下一步动作。训练模型既能充当高层级策略输出子任务又能充当底层级策略执行这些子任务所对应的动作推理过程的设计1、采用了两阶段的推理流程首先推理出高层语义子任务例如拿起盘子再基于该子任务预测动作。2、高层推理过程的运行频率远低于底层动作推理。3、动作token单独由动作专家进行推理4、控制系统为Π0.5直接输出机械臂、夹爪、躯干的升降指令目标位姿通过动作模块以50HZ的频率控制基座目标速度。这些通过PD控制器进行调节输入给机器人。
返回列表