ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

多模态不再是“拼乐高“了——聊聊从拼接式到原生统一的这次架构转身

多模态不再是“拼乐高“了——聊聊从拼接式到原生统一的这次架构转身 10 月 1 号那天地平线的余凯和黄畅时隔十年又联手发了一篇论文开源了一套叫 MultimodalFlowMF-1的统一语言视觉模型。消息出来那天圈子里讨论得挺热闹但说实话真正让我在意的不是这个模型本身而是它背后那个已经憋了很久、正悄悄把整个行业带偏方向的问题——我们的多模态模型到底应该怎么长出来这个问题想明白了你再看今年这一连串的发布就会有种豁然开朗的感觉Qwen 把视觉能力直接并进主线、砍掉了独立的 -VL 系列智源那篇纯自回归的多模态论文登上了 Nature还有前面提到的 MF-1。看似不相关的几件事其实都在朝同一个方向挤。先把这个背景铺开。过去这几年大家做的多模态模型绝大多数是拼接式的一个现成的文本大模型负责想外面挂一个视觉编码器负责看图片进来先被编码器变成一串特征向量再喂给语言模型。这套东西开发起来快图像那块直接复用现成的文本那边也不用动所以大家乐此不疲地往上面拼今天拼个语音明天拼个视频像极了在乐高底座上堆积木。但它有个特别要命的毛病——模态之间是各想各的。图片的理解和文字的理解发生在两条平行的流水线上到最后才被一个融合层硬捏到一起。模型从头到尾都没真正看见过这张图它只是学会了在视觉特征和文字之间划统计等号。你想让它做一个需要空间推理或者物理直觉的判断它就露怯了因为它脑子里的世界是割裂的。我做图生文、文生图的接口都调过那种图理解得不够深、文字一绕就崩的感觉做久了你会很明显。这就要说到为什么大家都在往原生统一上转了。原生统一的意思是把文本的 token、图像的 patch、音频的帧这些不同模态的最小单元直接塞进同一条序列里丢给同一个 Transformer 从注意力机制那一层就开始做跨模态交互。说白了让模型从底层起就一张桌子吃饭而不是各开一桌再拼桌。这么做的好处是信息在早期就交汇模型能真正基于多模态的联合语义做推理而不是事后硬对齐。代价你也猜得到——数据、训练、对齐全部要重来一遍工程量大得多。可为什么大家宁愿吃这个苦也要转因为能不能的问题基本解决之后拼的就变成贵不贵和顺不顺了。拼接式看着省事攒多了全是技术债换一个模态要重新描述一遍角色和场景生成的图片没法直接驱动视频视频的帧也回不到图像编辑那一环。创作者早就烦透了这个——我就见过有人为了一个 3D 场景在三个不同的模型之间来回搬数据搬到最后自己都想把需求砍了。原生统一省掉的正是这一整条搬运流水线。当然原生统一不是银弹它自己也有一堆没扯清楚的地方。比如音频、视频这些模态的 token 怎么定——是跟文本一样用词元还是用更省的分片方式我看到有的团队在做层次化的视频压缩把长视频压到平均每帧十几个 token省是省了可一旦要精细理解画面里的局部压缩过头的信息就找不回来了。这里面的取舍我觉得未来几年都还会是吵得最凶的战场。还有个绕不开的功利问题摆在眼前市面上那些假统一——就是外面包了一层统一壳、里面还是各模块调度——它们能在一段时间里浑水摸鱼用漂亮的话术把能力包装成原生。做工程的人要识破其实不难就看它跨模态推理是不是真的在共享表征空间里完成的还是靠一层 API 在外面搭桥。别被发布会上的 demo 唬住。说到成本这也是原生统一常被人误读的一块。很多人一听要从底层重训一个全模态模型第一反应是这得烧多少钱啊。其实反过来看原生统一在部署端反而有省钱的地方——因为它只有一个主干推理的时候不用为每个模态单独起一套服务和对应的显存省掉了模块之间来回搬运、序列化反序列化那一大堆开销。我自己算过一笔账一个 7B 量级的原生模型跑一段同时带图和长文本的请求端到端的开销往往比视觉编码器 文本模型两段式拼起来的方案更低因为少了好几次数据落地。当然训练端的预训练成本是实打实上去了这个账得分开看。还有一点是生态和开源今年其实给了不小的助力。像 MF-1 这种直接开源出来给大家复现的还有智源那套把多模态收敛到自回归的路线都是在降低大家入局原生统一的门槛。以前你想做原生多模态得从零攒数据和训练配方光这一步就劝退了一大批团队。现在有现成的底座和验证过的路子小团队也敢上手试了这我觉得是件好事。对我们这些做技术选型的人来说这个转向意味着一件挺实在的事以后选模型别光看它能处理几种模态这个清单那清单多半是拼接时代的产物。真正该问的是它的多模态是长在同一根主干上的还是几个模块各长各的再用胶水粘的。前者才是这两年新范式下真正值得投入的东西。最后留个问题给你你现在项目里用的多模态模型是拼接式的还是原生统一的你有没有遇到过那种换个模态就要重新喂一遍角色设定的坑评论区聊聊我也想听听大家在实际踩坑里都是怎么权衡的。
返回列表