ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

阿里:揭秘世界模型交互可靠性短板

阿里:揭秘世界模型交互可靠性短板 标题HappyWorld-Bench来源arXiv, 2609.24308v1️文章简介研究问题现有的世界模型往往只注重生成画面的视觉质量但它们在智能体进行探索、交互和修改时能否保持状态一致性和响应准确性主要贡献论文提出了HappyWorld-Bench基准通过统一的六层能力框架系统评估视频、空间和具身三类世界模型在交互下的可靠性。重点思路构建W1-W6层级能力框架从基础的感知构建W1、交互式模拟W2、持久性记忆W3到可编程干预W4、可扩展共享W5及通用世界建模W6定义了衡量世界模型可靠性的标准。设立三大独立评估赛道涵盖视频世界模型测试时空连贯性、空间世界模型测试物理可用性与编辑一致性和具身世界模型测试机器人视角下的动作响应与状态保持。结合人工与自动评估建立HappyWorld-Arena平台进行人类A/B对比以获取Elo评分同时开发针对行为正确性的自动化指标全面捕捉主观偏好与客观缺陷。分析总结视频模型存在长程一致性漏洞虽然头部模型如HappyOyster和Genie 3在视觉质量上表现优异但在长时间 rollout 和场景重访时物体身份和几何结构容易漂移且对规则修改的响应不够精准。空间模型物理可用性不足现有系统在物理放置准确率上最高仅达70.14%编辑执行率约73.33%许多模型生成的场景虽美观但缺乏有效的导航网格或物理支撑面。具身模型难以维持多步状态在复杂的多步动作序列中模型常出现初始状态未建立、中间状态丢失或最终目标未达成的情况且对物理规则如重力、摩擦力改变的敏感度极低几乎无法体现动力学变化。个人观点论文关注“世界真不真”指出当前技术最大的痛点不是生成能力而是交互后的状态保持和因果逻辑。
返回列表