当人形机器人学会端茶递水,背后是几十亿条真人视频 这个月去看上海的世界人工智能大会本以为大模型、GPU芯片会是这次的主角没想到各种具身机器人抢了风头整个会场几百台两足、四足、轮式的机器人不光能跳舞、打拳还可以分拣快递、冲咖啡、情感陪伴物理AI的概念一下子具象化了。我在会场听不少技术大佬说同一个话题机器人目前在尝试走进工厂和公共服务区域但离走进家庭还有很长时间其中一个重要原因是在scaling法则下需要大量的数据去训练机器人各种精细动作和自主意识也就是所谓的“世界模型”但现在优质的训练数据非常稀缺特别是多样化的视频数据。为什么机器人是个“牵线木偶”如果你观察一个两三岁的孩子你会发现他不需要任何人教他重力公式。他只是不断地观察、扔东西、看着水流过杯子就能在脑子里建立起对物理规律的理解。相比之下现阶段的机器人大多像个“牵线木偶”虽然能接入claude、chatgpt等顶级模型但对物理世界规则一窍不通需要工程师写好固定程序或者远程遥控方式非常笨拙比如人套上感应设备手把手教机器人这个杯子这样抓那个门这样推这样的训练可以教会机器人自己去操作。这种真实模拟的数据质量最高但问题是它太贵了而且完全没法规模化。根据Epoch AI在2025年的分析目前全球最大的机器人模型训练所用的算力竟然只有顶级语言模型的1%左右。原因不是没钱买显卡而是没那么多高质量的“手把手教”的数据。世界模型从“死记硬背”到“脑内演练”所谓“世界模型”就是让机器人学会预测。简单来说给模型一段当前的视频和它准备做的动作它得在“脑子里”预判出下一秒会发生什么。如果机器人预判到“我一推杯子就会倒”那它就理解了物理。这种能力不需要机器人真的去摔碎一万个杯子它完全可以通过“观看”海量的真人视频来学习。但这又带来了新的问题你的世界模型上限取决于它从未见过的那些视频比如Youtube某个小博主拍的生活日常。如果一个模型只见过实验室里干净整洁的场景那它到了下雨天的马路上、到了杂乱的厨房里瞬间就会变成“智障”。它需要见过无数种材质、光影、突发状况而这种多样性单靠实验室采集的一点点数据很快就会枯竭。互联网视频才是机器人真正的“精神食粮”这时候公开网络上的视频就成了唯一的救命稻草比如Tiktok、Youtube、Bilibili等汇集大量真人视频的平台。互联网上有几十上百亿段视频。有厨师拍的做饭Vlog有路人随手拍的街景有各种各样的手工制作教程。这些视频虽然没有机器人的动作标签但它们包含了最珍贵的东西物理常识。一个机器人看了100万小时的人类生活视频后比如Meta推出的V-JEPA 2就是这么干的它会产生一种“语义理解”。它知道抹布是软的石头是硬的水流是连续的杯子摔碎了是不可逆的。根据某robot大厂工程师的经验1小时的网络视频数据在提供“世界知识”方面的价值可能顶得上5分钟昂贵的远程操作数据。虽然转换率低但胜在量大管饱。难难难怎么把这些数据“抓”下来公开视频数据采集说起来容易做起来其实非常难。很多团队在尝试建立PB级Petabyte的视频数据集时发现现有的开源工具比如常用的yt-dlp在小打小闹时还好使一旦规模上去了瞬间就会崩溃。这里有三个技术障碍1. 反爬阻碍拥有高质量视频的平台比如各大视频网站、社交平台都有极强的反爬技术、地理位置限制和人机验证。2. 成功率很多开源工具在PB级规模下的提取成功率只有60%到75%左右。这意味着你不仅浪费了大量时间还漏掉了最关键的那部分“长尾”数据——也就是那些稀有的、极具多样性的长尾场景。3. 精准搜索现在的机器人模型需要按“内容”找视频。比如我需要“一个人在雨中捡起湿透的纸盒”传统的关键词搜索很难搜准这需要的是基于视觉内容的搜索。所以虽然公开视频数据对世界模型很重要但想要采集大量数据并不容易。Bright Data给世界模型装上“数据水泵”对于PB级别的公开视频数据可能需要Bright Data这样的采集工具很多人误以为它只是一个代理服务商其实在物理AI很多公司它已经成了基座模型训练的“底层设施”。https://get.brightdata.com/weijunBright Data解决的是数据从“互联网”到“训练集”之间那段最难走的路他们已经索引了超过100亿条互联网视频90PB大小并且支持通过Video Search API直接按内容进行精准搜索你不再需要依赖那些词不达意的标题。其次在处理PB级的数据提取时Bright Data能保持99%以上的成功率。这多出来的20%-30%成功率往往决定了一个模型在处理极端情况Edge Cases时的鲁棒性。最重要的是数据质量获取原始数据只是第一步Bright Data提供的自动化流程可以协助完成转码、质量过滤和去重确保喂给模型的是高质量的“干货”而不是低分辨率的垃圾片段。小结这次在世界人工智能大会上看到的这么多机器人真正拉开差距的可能是构建世界模型的真实视频数据。在物理人工智能的竞赛中算法的门槛正在变低算力的差距可以用钱补但高质量、大规模且多样化的数据才是那个最终决定胜负的“定数”。如果你的机器人只待在实验室里它永远无法理解真实世界的复杂。而要把全世界的物理规律装进机器人的大脑我们需要的不止是几千个G的视频而是一套像自来水系统一样稳定、纯净、源源不断的数据基础设施。

本月热点