ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

第三视角视频生成模型的Scaling Law:实操结论与参数解析

第三视角视频生成模型的Scaling Law:实操结论与参数解析 视频生成模型的规模法则过去一年被各家团队反复炒了很多轮。大家默认引用的结论都出自 OpenAI 的 Sora 技术报告视频模型的 scaling law 在“数据量、参数量、训练算力”这三个维度上呈幂律关系模型越大、数据越多生成质量越高。但有一个细节一直被讨论得很少——Sora 报告里的 scaling law 成果究竟是在什么视角的数据上测出来的答案偏向第一视角和第三人称混合数据。而 Light-O1 这个项目做了一件看起来有点“笨”但是极其必要的事它把第三视角视频单独拎出来做了小规模但完整的 scaling law 测试并且给出了几条用真金白银换来的结论。这篇文章不聊宏大叙事只拆解 Light-O1 实验里那些可以直接复用的结论和参数。我会把第三视角视频的 scaling law 拆成“数据维度怎么选、分辨率帧率怎么配、损失函数怎么收敛、batch size 如何缩放”这几个实操层面再把从 Light-O1 实验里看到的几个反直觉现象讲清楚。如果你是做视频生成、多模态大模型或者 3D 内容生成的工程师这篇文章值得读完再走。1. 整体设计与思路拆解为什么单测第三视角1.1 第三视角视频和第一视角视频在建模难度上根本不是一个量级先定义清楚什么叫第三视角视频。简单说摄像机放在场景外部、和主体保持一段物理距离拍摄的画面就是第三视角而像 GoPro 绑在头上拍的、或者自动驾驶车载摄像头拍的那种“以主体自身为原点向外看”的画面是第一视角。这两者在模型建模难度上有着本质差别。第一视角视频的主运动是摄像机自身的平移和旋转画面中的背景流动有强几何规律——本质上是 3D 场景在球面上的投影变换。模型学第一视角视频时很大程度上是在学“自我运动估计”场景中物体的独立运动比例很低静态背景占绝大多数像素。第三视角视频则完全不同。摄像机是固定的或者只有缓慢的推拉摇移但画面里的主体始终在移动形变、遮挡、自遮挡、背景交互频繁出现。建模第三视角视频模型必须学会“把这个物体的物理运动轨迹和形态变化预测出来”而不是像第一视角那样主要处理“摄像机位姿变换”。从信息论角度看第三视角视频每帧的“有效信息熵”远高于第一视角视频。这也是 Light-O1 选择第三视角作为唯一测试对象的核心原因把视角类型固定住之后scaling law 的测量才不会受到“不同视角数据混合比例”这个变量的污染。很多团队在报告里写“模型在混合数据上表现随规模提升”但你根本不知道这个提升到底来自纯数据量增长还是来自数据中第一人称/第三人称比例的变化。Light-O1 直接把这个混淆变量干掉了。1.2 从 Sora 结论到 Light-O1 假设轻量复现校验Sora 报告里最有名的那张图展示了视频生成模型的 loss 随计算量增大而平稳下降的趋势OpenAI 称之为“视频模型的 scaling law 和语言模型高度一致”。但很多人忽略了一个关键前提Sora 训练数据的视角构成是严重倾斜的、且未公开详细配比。Light-O1 团队的实验设计从一开始就在质疑这个前提他们提出的假设是第三视角视频的 scaling law 曲线斜率可能和混合数据不一样第三视角视频在低计算量区间可能会出现“伪饱和”——即 loss 下降变缓但实际生成质量还在提升第三视角视频对分辨率的敏感度远高于第一视角视频因为细粒度运动细节手部动作、物体形变需要足够像素来承载。基于这些假设Light-O1 设计了一套 3 个模型规模、5 个数据规模、2 个分辨率档位的全因子实验矩阵用固定随机种子、固定采样策略、固定评估协议做了一套干净的对照实验。这不是一个“大炼 GPU”的项目。Light-O1 的定位是轻量级验证——用尽量少的算力把“第三视角视频到底有没有自己的 scaling law”这个问题回答清楚。这个思路我认为非常值得借鉴因为在算力有限的情况下与其跟风堆海量数据不如先把实验变量控制好用科学的实验设计去榨取有限算力的信息量。1.3 为什么“视角”本身应该成为一个独立实验变量大多数人做视频生成时对“视角”是无感的。数据管道里从网络上爬回来的视频什么视角都有清洗时只看分辨率和时长不看视角分布。但 Light-O1 的实验用数据证明了视角分布发生变化时同一批数据产生的 scaling law 斜率会出现显著偏移。这个结论的直接工程启示是如果你在做视频生成模型的数据配比必须在实验记录里标注第一视角和第三视角的比例。否则当模型训练到后期出现 loss 平台期时你根本无法判断是“数据不够”还是“某一视角的数据学饱和了另一视角还在欠拟合”。更直观地说不同视角对应的最优 token 分配策略不同。第一视角视频中静态背景的时空冗余度很高可以用较大的压缩率去 tokenize第三视角视频中主体运动占主要信息量压缩率必须保守否则丢的全是运动细节。Light-O1 的实验确认了这一点同样的压缩模型在第三视角视频上的重建 loss 比第一视角高 30% 以上。2. 核心维度拆解第三视角视频的 scaling law 到底受哪些变量支配2.1 分辨率与帧率第三视角的“像素饥饿”效应Light-O1 实验里一个很有意思的发现第三视角视频对分辨率的敏感度呈非线性。把 256x256 升到 512x512生成质量提升的幅度远远大于把 512x512 升到 1024x1024。这在第一视角视频实验里是看不到的——第一视角视频从 256 升到 512 的提升幅度相对平稳。为什么因为第三视角视频中主体往往只占画面的 30% 到 60%。在 256x256 分辨率下一个占画面 40% 的主体实际只有大约 100x100 像素的可用信息手部动作、面部表情、衣物褶皱这些细节在这个分辨率下几乎完全不可分辨。模型学不到细节就只能“脑补”脑补出来的动作就是模糊的、平均的、没有个性的。帧率方面Light-O1 给出了一个具体建议区间第三视角视频训练时帧率不宜低于 12fps推荐 16fps推理时可以根据场景需求降帧。原因有两个第三视角视频中主体的运动速度通常比第一视角慢因为摄像机不动运动只来自主体低于 12fps 时相邻帧之间的位移本来就小时间维度上的学习信号变弱但第三视角视频中有大量非刚体形变人的手臂摆动、衣服飘动、面部肌肉变化这些形变需要足够的时间采样密度才能被模型捕捉到。如果你用的视频数据本身是 30fps 的直接每秒抽 16 帧不要抽 12 帧以下否则运动信息的丢失会直接反映在生成视频的“呆滞感”上。2.2 数据规模与模型规模的联合缩放batch size 不是随便设的Light-O1 实验中最有价值的实操贡献是他们揭示了batch size 与数据规模之间的耦合关系。很多团队跑 scaling law 实验时数据规模变大就同步线性增大 batch size理由是“GPU 多了batch 就大点”。但 Light-O1 用控制变量法测出来的结果是数据规模从 100 万视频增长到 500 万视频时最优 batch size 只需要从 256 增大到 384而不是翻倍到 512。为什么因为第三视角视频的数据多样性主要体现在“动作类型”和“场景类型”的分布上而不是单条视频内的信息密度。当数据规模扩大时新的信息主要来自“更多不重复的动作种类”而不是“同一条视频里更多可学的帧”。一个容纳 512 条视频的 batch 已经能够覆盖绝大部分动作类型了再增大 batch 只会让每个 step 的计算量白白增加而不会带来有效的信息增益。这个发现直接指导了 Light-O1 的算力分配方案用节省下来的 batch 增量去换更大的模型参数量而不是把算力全砸在增大 batch 上。最终他们的实验矩阵里参数量从 0.6B 涨到 3B 时在相同数据量下 loss 下降了 14%而 batch size 从 256 增到 1024相同数据量下 loss 只下降了 4%。差距非常明显。2.3 视频时长长视频训练数据的边际效应递减点Light-O1 团队还专门测了“视频片段长度”对 scaling law 的影响。他们把训练语料切成 2 秒、4 秒、8 秒、16 秒四个档位分别用相同总帧数去训练结果发现从 2 秒到 4 秒模型提升明显从 4 秒到 8 秒还有一定提升从 8 秒到 16 秒几乎没有任何额外收益但训练成本却成倍增加。这背后的逻辑值得展开讲。第三视角视频中的有效信息密度是随时间衰减的。一个 16 秒的第三视角镜头里前 4 秒可能涵盖了“人物走进画面、开始做动作”的完整语义场景4 到 8 秒主要是动作的延续语义信息重复度上升8 秒之后大量帧只是同一动作的细微变化对模型学习的边际贡献接近于零。所以在做第三视角视频数据管道时优先保证视频片段的“动作完成度”而不是“时长”。一个 4 秒的完整动作比如一次挥拍、一次跳跃、一次转身在训练中的价值远高于一个 16 秒但只有两次重复动作的素材。3. 实操过程与核心环节实现复现一套第三视角视频 scaling law 实验3.1 数据准备与清洗第三视角数据集的构建标准如果你想在自己环境里复现 Light-O1 的实验第一步就是建立一套严格的第三视角数据筛选管道。只按“视频里有人”去爬数据是不够的必须用几何先验判断视角画面中心区域是否有稳定的主主体背景是否有明显的透视运动主体边界是否频繁和画面边缘相交具体操作时我用 Light-O1 的思路给出一套可落地的筛选方案用现成的检测模型提取每一帧的主体框计算主体中心到画面中心的平均距离。第三视角视频里主体中心通常稳定停留在画面中心附近偏移幅度不超过画面宽度的 15%计算相邻帧的光流场统计背景区域光流的平均方向和幅值。第一视角视频中背景光流幅值大且方向一致摄像机运动引起第三视角视频中背景光流幅值小且方向杂乱统计主体框面积占画面总面积的比例。这个比例在第三视角中通常位于 15% 到 60% 之间高于 80% 大概率是第一视角或特写镜头。这套规则不能做到 100% 准确但配合人工抽检可以把第三视角数据的纯度控制在 85% 以上。对于 scaling law 实验来说这个纯度完全够用因为实验关注的是相对趋势而不是绝对数值。3.2 训练配置从 0.6B 到 3B 的参数选择与收敛调节Light-O1 实验的核心训练配置可以总结为一个表格我直接把关键参数列出来供参考配置项小模型中模型大模型参数量0.6B1.4B3B层数122028隐藏维度102415362304视频 patch 大小16x1616x1616x16帧采样数888训练分辨率256/512256/512256/512峰值学习率3e-42e-41.5e-4batch size256384384训练步数200k200k200k几个要注意的调节细节学习率必须随模型规模增大而减小。0.6B 模型用 3e-4 没问题但 3B 模型如果用同样的学习率前 10k 步就会出现 loss 震荡原因是模型容量变大后同样大小的学习率会导致梯度更新步长相对过大。batch size 的 384 这个值不是拍脑袋定的。Light-O1 先用小模型做了一组梯度噪声标定实验发现 384 的 batch 下梯度噪声尺度最小然后把这个值迁移到更大模型上通过 grad accumulation 实现等效 batch 大小。视频 patch 大小选择 16x16 而不是 8x8是为了控制序列长度。第三视角视频本身主体信息集中16x16 的 patch 不会像第一视角那样造成大量细节丢失但序列长度减少 4 倍训练显存占用大幅下降。3.3 评估协议不同规模模型的对比不能只看 lossscaling law 实验最容易被质疑的点就是评估方式。Light-O1 的做法比较科学他们没有只看训练集上的 loss而是建立了一套三重复合评估协议验证集 loss预留 5000 条和训练集分布一致但内容不同的第三视角视频评估模型在标准视频预测任务上的泛化 loss生成质量人工评分从每个模型规模下用固定 prompt 采样 200 段 4 秒视频让标注者对“动作合理性”“形变自然度”“背景稳定性”三个维度打分运动轨迹指标提取生成视频中的主体关键点轨迹和真实视频的运动轨迹计算 Frechet 距离用来量化模型对真实运动分布的还原程度。这三项指标组合起来能够同时覆盖“像素级拟合能力”“语义级生成质量”“物理运动合理性”三个层面比单独说一句“loss 下降了”要有说服力得多。从 Light-O1 的实验数据来看验证集 loss 在 3B 模型上比 0.6B 模型低 18%而人工评分提升了大约 30%。说明在第三视角视频这个场景下模型规模增大带来的生成质量提升幅度比 loss 降幅更明显。这个结论很重要——如果你只看 loss 曲线判断模型好坏可能会低估大模型的实际收益。4. 常见问题与排查技巧实录第三视角视频 scaling law 实验避坑指南4.1 “我在小模型上测出来的 scaling 趋势迁移不到大模型上”这是被问得最多的一个问题。现象是用 0.6B 模型测出的 loss vs 数据量曲线外推到 3B 模型时3B 模型的实际 loss 比你预测值高出一截。Light-O1 团队排查并确认的根因是数据增强策略不一致。他们早期实验里小模型训练时开了较弱的随机裁剪和水平翻转大模型训练时为了加快收敛把增强强度调大了导致大模型实际看到的数据分布和小模型不完全一致。scaling law 的前提是输入分布不能随模型规模变化这个条件一破坏外推曲线必然失真。解决方案所有规模的模型必须使用完全相同的预处理管道、数据增强参数、tokenizer 配置只允许控制变量为参数量、数据量、训练步数。改任何一项不是在测 scaling law是在测两个不同的实验。4.2 “训练到中后期 loss 一直震荡不下降”第三视角视频训练的 loss 震荡大概率出在时间维度的采样不均匀上。排查思路检查每个 batch 里视频片段的起始帧分布。如果起始帧都是从每条视频的固定位置比如开头 2 秒采样的到了训练后期模型会对这些特定时间点的帧过拟合导致 loss 震荡解决方案是在数据管道里引入随机起始帧采样并且限定采样范围覆盖整条视频而不是前 50% 帧如果震荡仍然存在把 batch size 临时减小一半看 loss 是否稳定。是的话说明你当前这个阶段的最优 batch size 比理论值要小需要动态调整而不是从头到尾固定。4.3 “生成视频中主体运动僵硬背景却异常清晰”这个问题我见过很多人问但大多数人的第一反应是加大模型、加数据量方向完全错了。主体运动僵硬的本质是模型没有学到足够的动作先验而不是分辨率不够。实操层面的两个排查方向确认训练数据里静态视频占比。如果数据管道里混入了大量背景运动很小、主体几乎不动的视频模型会被带偏生成时倾向于预测一个“静态主体 动态背景”的保守方案尝试在训练 loss 中提高主体区域像素的权重。Light-O1 用一个简单的注意力 mask把主体检测框内的像素在 loss 计算时乘以 1.5 的权重主体运动质量提升非常显著对背景质量几乎无副作用。4.4 “第二视角和第三视角数据混在一起后scaling 曲线变乱了”这其实是 Light-O1 实验中最有工程价值的一个发现视角混合数据训练出的模型其 scaling law 曲线会出现明显的“扭结”即 loss 下降在某一点突然变缓之后又重新下降。原因是两种视角的数据在模型内部形成了不同的特征表征空间梯度更新在早期主要优化其中一类当这一类学到一定程度后另一类的贡献才开始显现导致 loss 曲线呈现非单调平滑的形状。如果你不关心视角分类只想要一个更好的视频生成模型这个现象不是问题但如果你在做 scaling law 测量必须确保训练数据只包含单个视角或者把视角作为条件输入注入模型架构否则测出来的幂律指数毫无意义。5. 从 Light-O1 延伸到更大的尺度第三视角视觉的下一步容量空间做完整组实验之后Light-O1 团队最大的感受是第三视角视频的 scaling law 远没走到“饱和”的阶段。在测过的所有维度上——模型参数量、数据规模、训练分辨率、训练步数——曲线都还保持稳定的下降趋势没有看到明显的收益天花板。这也意味着当前的视频生成模型在第三视角这个方向上可能还距离“真正理解物理世界”有相当距离。模型现在学会的是“像人的动作”“像物理的运动轨迹”而不是“为什么人这样动作”“什么样的物理约束导致这样的轨迹”。而后者需要的模型容量按照现有 scaling law 曲线的斜率外推比现在最大的模型还要再大 15 到 20 倍。Light-O1 的实验受限于算力没有去验证这个外推是否合理但他们给出了一条值得后续跟进的技术路线用混合分辨率训练替代固定分辨率训练让模型在不同层级上同时吸收全局结构和局部细节信息可能会改变第三视角视频 scaling law 的斜率让模型用更少的算力达到同样的表现水平。从数据侧看第三视角视频的“有效数据上限”也还有很大的拓宽空间。当前的网络视频数据大多数是人物摆拍或者自然场景记录真正包含“明确目的导向的物理交互”比如人用工具改变物体状态、多物体相互碰撞的第三视角视频比例极低。如果把这类“物理交互丰富”的数据单独整理成一个子集测一下它在 scaling law 中的独立贡献很可能是未来视频生成模型突破物理理解瓶颈的关键一步。我自己在复现这套实验时最深的体会是一个看似简单但容易被忽略的原则做 scaling law 实验宁可模型小一点、数据少一点也要把变量控制干净。实验设计上的一个微小疏忽浪费的不只是算力更是从头再来一遍的时间成本。控制好视角、控制好分辨率、控制好数据增强策略然后用统一的评估协议横比不同规模的模型这套方法在任何团队里都低门槛可复现。Light-O1 用不到十几块卡跑出来的结论已经足够给第三视角视频生成这个方向提供可靠的结构性参考了。
返回列表