
8月17日智象未来HiDream.ai发布了一款叫 HiDream-O1-World 的模型官方定位是原生全模态交互式世界模型给一段文字或一张图片就能生成一个能进去逛、能上手操作的 3D 世界。名字从视频生成换成了世界模型这两个词之间的差距比大多数人想象的大。它到底能干什么据多家媒体报道HiDream-O1-World 支持文本、图像、交互三种输入方式核心能力是漫游、编辑、交互三件事以第一人称或第三人称视角在场景里走动让角色抓取、奔跑、下蹲、跳跃触发降雨、物体坠落这类环境事件。典型场景是上传一张卧室照片模型把房间的其他区域补全出来镜头推拉摇移时家具尺寸、遮挡关系保持不变。这背后要解决的是视频生成的老大难场景漂移、物体消失、物理失真。传统视频生成模型本质上是在预测下一帧像素没有内部的空间记忆镜头一转刚才的东西就变形甚至没了。HiDream-O1-World 的做法据报道有两招一是把 3D 几何先验写进 Memory 上下文让模型记住这个空间里有什么、东西在哪二是在推理阶段用 Test-Time Training测试时训练做轻量在线调整让画面持续符合碰撞、重力这些物理规律。配套论文《DreamWorld》已经被 ECCV 2026 接收与复旦大学合作核心路线是把几何生成和外观生成拆开建模先把几何从视频生成的黑盒里单独拎出来。第三方评测也有个参照。据报道在美团 LongCat 团队与复旦大学联合推出的 WBench据称是首个面向交互式世界模型的系统性评测基准中HiDream-O1-World 以平均分 80.9 登顶 Navi 分榜物理维度 73.3 分排第一一致性维度 88.0 分相比参测模型平均水平视觉合理性提升 13.6%因果保真度提升 12.7%。技术本质造世界和画画面是两码事世界模型这个概念谷歌、World Labs、DeepMind 都在押注但业界一直有争论现在市面上这些产品到底是在构造世界还是在渲染画面区别的关键有两点模型内部有没有一个 3D 空间表征以及它能不能预测动作的后果——杯子碰倒了会不会碎人走过去会不会留下脚印。DeepMind 的 Dreamer 4 就是让智能体在内部世界里反复想象各种行为的结果再行动据报道它在《我的世界》里能自己摸索出挖钻石的完整流程不需要任何示范。对普通打工人来说这类技术短期和我们的日常开发没有直接关系——不做影游、不做机器人仿真、不做 3D 内容就用不上。但它决定了 AI 的下一个阶段具身智能要训练得先有能连续存在、响应操作的仿真环境自动驾驶、机器人、智能制造都靠它。做内容工具的团队倒是可以留意可交互 3D 场景的生成成本如果真的降下来虚拟展厅、互动广告、数字孪生的玩法都会变。想上手先搞清楚三件事怎么分辨真世界模型和高级视频生成器。看三点空间记忆镜头转一圈回来场景还一不一致、因果预测碰撞、遮挡、重力符不符合常识、持续交互是能连续玩很久还是循环播一段短视频。很多号称世界模型的产品本质还是对单张图做视角扩展。一致性是可以量化的。世界模型最核心的指标是时空一致性评测本质上就是在量物体有没有漂移。这种度量不神秘计算机视觉里最基本的做法就是算 IoU交并比defiou(box_a,box_b):计算两个检测框的 IoU交并比box (x1, y1, x2, y2)x1,y1max(box_a[0],box_b[0]),max(box_a[1],box_b[1])x2,y2min(box_a[2],box_b[2]),min(box_a[3],box_b[3])intermax(0,x2-x1)*max(0,y2-y1)area_a(box_a[2]-box_a[0])*(box_a[3]-box_a[1])area_b(box_b[2]-box_b[0])*(box_b[3]-box_b[1])returninter/(area_aarea_b-inter)# 同一物体在第 1 帧和第 50 帧的检测框stableiou((10,10,110,110),(12,12,112,112))# 镜头微动基本没漂移driftiou((10,10,110,110),(60,40,160,140))# 物体明显偏移 - 漂移print(f稳定帧 IoU{stable:.3f}漂移帧 IoU{drift:.3f})# 输出稳定帧 IoU0.924漂移帧 IoU0.212WBench 这类基准要做的就是把这种单帧度量扩展成多轮交互下的系统性评分。别急着上生产坑还不少。据报道目前这类模型的交互速度、生成成本、长时间稳定性和仿真精度都还是待验证的指标算力需求高商用定价也不成熟。试玩可以拿去做业务核心链路之前先自己跑长交互压测别只看官方演示。收尾视频生成解决的是像不像世界模型要解决的是真不真、连不连续。等哪天一个 3D 世界能连续玩上几小时不穿帮那才算过了及格线。你怎么看世界模型这条路评论区聊聊。