ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ACT + Diffusion Policy 训练阶段完整 Mermaid

ACT + Diffusion Policy 训练阶段完整 Mermaid 将Policy改为Diffusion Policy,重新给出完整的mermaid图可以。这里我建议采用最干净、最接近原始Diffusion Policy(扩散策略)的替换方式:保留 ALOHA / ACT 的原始数据定义、双臂 14 维 position action 和 action chunk;把CVAE + ACT Transformer Policy整体删除,换成视觉条件编码器(Visual Observation Encoder)+ Conditional U-Net 1D Diffusion Policy。因此不再保留zzz、μ\muμ、log⁡σ2\log\sigma^2logσ2、重参数化、Action Query、ACT Transformer Decoder、L1 Loss 和 KL Loss。标准 Diffusion Policy 直接建模条件动作分布p(At∣Ot)p(A_t\mid O_t)p(At​∣Ot​),训练时对 GT action sequence 加噪并预测噪声;论文也明确推荐新任务优先尝试 CNN-based Diffusion Policy。turn856806view3需要先强调:下面是ALOHA/ACT 数据接口 + Diffusion Policy的改造架构,不是 ACT 原论文架构。完整训练阶段 Mermaid阶段 S7:扩散损失与优化目标(Diffusion Training Objective)阶段 S6:损失输入(Loss Inputs)阶段 S5:条件动作去噪网络(Conditional Action Denoising Network)阶段 S4:扩散条件构造(Diffusion Conditioning)阶段 S3:动作前向扩散(Forward Action Diffusion)阶段 S2:多模态观测编码(Multi-modal Observation Encoding)阶段 S1:数据预处理(Data Preprocessing)阶段 S0:原始训练数据(Raw Training Data)本体感知编码(Proprioceptive Encoding)视觉观测编码(Visual Observation Encoding)sConditionPredictionTargetMaskGradientGradientGradientGradientGradient数据模块:多视角 RGB 观测序列(Multi-view RGB Observations I_t)Shape: [B, T_o, 4, 480, 640, 3]数据模块:双臂关节状态序列(Joint State Observations q_t)Shape: [B, T_o, 14]数据模块:专家目标动作序列(Expert Target Actions)Shape: [B, T, 14]数据模块:动作填充掩码(Action Padding Mask)Shape: [B, T]操作模块:图像预处理(Image Preprocessing)参数:Channel Last→First + Normalization数据模块:标准化多视角图像(Normalized Multi-view Images)Shape: [B, T_o, 4, 3, 480, 640]
返回列表