ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? 原文链接https://arxiv.org/pdf/2608.15265项目链接https://usail-hkust.github.io/VibeWorlding-Gym/一、研究动机基于论文原文的引言部分端到端交互式3D开放世界构建在游戏、仿真、具身AI领域具备重要应用价值随着多模态大语言模型MLLM的发展基于MLLM的3D世界构建智能体已成为学术与工业界的关注热点但现有研究存在三大核心痛点构成了本工作的研究动机评估场景理想化缺乏系统的能力拆解分析现有方法大多仅在理想化的简单查询上验证效果无法系统性地对比分析多模态智能体在用户意图理解、3D工具调用、文本与视觉3D信息推理等底层维度的能力差异与瓶颈。缺乏统一开源的基准与训练框架绝大多数现有3D世界构建框架为闭源形态目前仍没有统一的开源框架能够支撑“训练如智能体强化学习后训练能否提升3D世界构建底层能力”这一问题的系统性研究。技术落地存在两大核心挑战3D资产环境碎片化高质量、物理一致性的3D资产难以大规模获取资产检索、编辑、渲染等操作分散在互不兼容的工具中无法支撑端到端的3D世界构建流程暂无工作将这些能力统一到同一个沙箱接口下。3D构建效果难以验证合格的3D世界需要同时满足物理约束资产高度合理、布局无碰撞与用户意图、任务要求、审美一致性多维度的评估标准无法仅通过手工规则或通用LLM评判器完成。二、论文方法概括论文提出VIBEWORLDING——面向3D开放世界端到端构建的多模态智能体统一基准与训练框架整体架构对应图1的上下两大部分核心思路是将3D世界构建建模为多轮交互、多模态反馈、工具集成的智能体推理过程同时配套标准化评测基准与可规模化训练体系。框架包含两大核心组件VWE-BENCH大规模评测基准包含高质量3D资产库、种子3D世界与反向合成的多模态用户查询搭配“物理可行性意图满足”双约束验证体系可系统评估智能体的多维能力。VIBEWORLDING-GYM联合多模态强化学习后训练框架集成了统一工具接口的3D沙箱环境、基于评分规则的验证奖励器以及“监督微调冷启动多模态强化学习优化”的完整训练流水线可规模化提升智能体的端到端构建能力。三、论文方法详细介绍结合图1的架构从智能体工作流程、VWE-BENCH基准体系、VIBEWORLDING-GYM训练框架三个部分展开详细说明所有内容均来自论文原文1. Vibe Worlding智能体的端到端工作流程图1上半部分智能体接收两类多模态用户查询通过多轮迭代交互完成3D世界构建最终输出可用于仿真的交互式3D世界完整流程分为4个阶段输入层多模态用户查询支持两种任务模式① 纯文本查询要求从零开始构建3D世界② 现有3D世界文本地图多视角渲染图搭配文本编辑指令要求优化现有3D世界。阶段1自主规划Autonomous Planning智能体自主完成用户意图理解、场景布局规划、工具调用方案设计等推理明确构建目标与执行路径。阶段2工具调用Tool Use via MCP in Sandbox智能体通过沙箱中的MCP工具集执行操作包含三类核心工具资产检索通过文本嵌入语义匹配从资产库中搜索符合需求的3D资产资产编辑对场景中的资产执行添加、删除、旋转、平移等空间编辑操作渲染对当前3D世界进行360°多视角渲染生成可视化反馈。阶段3观察与反思Observe Reflect智能体接收环境返回的多模态反馈包括5个固定视角的渲染图像、资产检索结果、3D世界文本地图等。基于反馈反思当前构建效果判断是否需要进一步调整再回到规划阶段开启下一轮迭代。阶段4最终输出迭代终止后输出物理合理、符合用户意图的交互式3D世界可直接用于仿真场景。2. VWE-BENCH评测基准体系图1左下部分VWE-BENCH是专门为vibe worlding智能体构建的评测基准通过“资产-种子世界-反向查询”的流水线构建提供标准化的测试集与评估体系。1基准数据构成3D资产库包含2616个高质量标注3D资产覆盖20个语义类别从小型道具、家具到大型建筑、地形每个资产包含唯一ID、名称、类别、网格面数、物理包围盒等元信息所有资产均经过统一的真实世界尺寸标注。种子3D世界由专业美术人员基于资产库构建323个种子3D世界放置资产数量从8到258不等覆盖不同复杂度场景作为查询合成的基础场景。反向合成用户查询共6828条分为两大类共10个子类型模拟真实用户的不同表达形式3D世界构建查询1364条从零开始构建场景包含仅主题、主题元素、完整蓝图、干扰项4个子类型均为无真实标注的开放型查询通过评分规则评估。3D世界优化查询5464条基于现有场景编辑包含精确资产级编辑有真实标注可与真值地图比对、模糊资产级编辑、场景批判、场景引导、场景重述、复杂描述6个子类型仅精确编辑类有真实标注。2双约束验证评估体系对应图1底部的验证维度从物理可行性与意图满足两大维度进行系统评估物理可行性基于几何规则包含两项硬约束碰撞检测校验资产之间是否出现穿透、重叠预留合理容差避免误判接触性放置高度校验校验资产是否贴合地面或合理支撑面排除无支撑悬浮、穿模等问题。意图满足MLLM评判包含四项能力维度生态合理性场景整体风格统一资产组合符合常识与场景逻辑3D理解智能体正确识别查询需求与场景信息3D推理智能体正确调用工具完成空间编辑实现构建目标资产检索使用智能体合理选择检索结果正确调用匹配的资产。3. VIBEWORLDING-GYM多模态强化学习后训练框架图1右下部分这是面向智能体训练的完整基础设施实现了可规模化的多模态RL后训练包含沙箱环境、奖励验证器、训练流水线三部分。13D沙箱环境Sandbox Environment基于Blender构建统一的仿真环境将资产检索、编辑、渲染封装为标准化MCP工具提供统一的交互接口5种原子3D工具资产检索、资产添加、资产旋转、资产平移、资产删除覆盖所有基础编辑操作统一渲染服务每轮编辑后自动渲染5个固定视角的1280×720分辨率图像作为多模态视觉反馈资产检索服务基于Qwen3Embedding-4B训练的检索模型采用InfoNCE损失优化保证检索结果与资产库ID体系对齐所有返回资产均可直接放置。2基于规则的验证奖励器Rubric-based Verifier同时作为评估工具与RL训练的奖励信号来源对于无真实标注的查询先执行物理可行性几何校验通过后再由MLLM评判四个意图维度全部通过则判定为成功获得二值奖励0/1对于有真实标注的查询直接将智能体编辑结果与真值地图对比按正确修改资产的比例给出[0,1]区间的连续奖励内置严格的奖励校验机制禁止未授权的额外编辑即“过度编辑”避免智能体通过破坏场景其他部分来换取局部正确。3联合多模态RL后训练流水线采用“冷启动SFT 多模态RL”的两阶段训练方案阶段1冷启动监督微调SFT针对不同查询类型合成高质量训练轨迹无真实值查询通过Gemini 3.1-pro多次构建、筛选出高质量结果再反向合成完整的推理轨迹有真实值查询直接从真值地图反向生成推理轨迹。基于这些轨迹做全参数监督微调让模型快速掌握3D工具使用与多轮推理的基础能力。阶段2联合多模态强化学习以冷启动模型为初始策略采用GRPO算法进行智能体强化学习训练。训练同时覆盖纯文本构建任务与多模态编辑任务基于双约束验证器的结果提供奖励无真实值查询为二值奖励有真实值查询为连续比例奖励。通过基于最终结果的奖励设计避免手工中间奖励带来的奖励破解问题让智能体真正学习到端到端的3D世界构建能力。
返回列表