
这篇论文阅读笔记我前后整理了近一年。起因很简单2024年之前我的收藏夹里塞满了各种多模态模型的paper它们看起来都在做同一件事——把图片、文字、音频塞进同一个模型。但到了2024年下半年我明显感觉到风向变了纯“融合”不再是大家比拼的重点越来越多的论文开始讨论推理、规划、智能体甚至世界模型。于是我干脆把所有散落的阅读笔记重新拉通按“从Fusion到Reasoning Agent再到World Model”这条主线重新过了一遍这才发现整个领域其实有一条非常清晰的进化路径。先说结论从2024年到2026年多模态AI的主赛道肉眼可见地挪了三个位置。第一站是Fusion解决“怎么把多种模态放进一个模型”第二站是Reasoning Agent解决“模型看完图之后能不能想清楚、能不能动手干活”第三站是World Model解决“模型能不能在内部模拟世界的变化”。这篇文章就是这条主线的完整梳理我会把我筛选过的代表方向、关键设计、以及复现和踩坑的经验全部写出来给正在跟论文的朋友一条可以少走弯路的索引。1. 一条主线多模态AI为何从融合走向推理再走向世界模型做技术梳理最怕的就是“什么都想讲最后什么都没讲清楚”。我这次给自己定的原则是不看单篇论文的指标刷榜而是看每篇论文回答了什么问题、把能力往前推了哪一步。按这个标准去读2024到2026年间的论文基本可以归为三代范式每一代都有明确的问题意识和代表作。1.1 三个关键词对应三代技术范式**Fusion多模态融合**要回答的是一个模型能不能同时吃图片、文字、音频、视频并且让这些信息互相补充。2023年之前的很多工作其实是在“对齐”典型如CLIP它把图片和文本映射到同一个向量空间但模型本身仍然分两路。真正意义上的多模态融合发生在LLM接管视觉编码器之后比如LLaVA系列、Qwen-VL系列、InternVL系列。这类工作把视觉特征投影到大语言模型的token空间里让语言模型直接“看见”图像。**Reasoning Agent推理智能体**要回答的是模型理解了多模态信息之后能不能完成多步推理、能不能调用工具、能不能在真实环境里执行任务。这个方向2024年突然爆发标志性变化是从“单轮问答”走向“多轮交互”从“只能输出文字”走向“可以调用搜索引擎、操作GUI、读写文件”。代表方向包括多模态思维链、视觉规划、GUI Agent、多模态工具调用等。**World Model世界模型**要回答的是模型能不能在内部建立对外部世界的动态预测。它不再满足于“识别这张图里有什么”而是尝试回答“这个场景接下来会发生什么”“如果我做一个动作环境会怎么变”。Sora这类视频生成模型让公众第一次感受到世界模型的威力但世界模型远远不止视频生成自动驾驶、机器人控制、多模态仿真都在往这个方向走。1.2 我筛论文的框架模态覆盖、任务形式、训练范式面对海量论文我给自己定了三个筛子参数每篇论文必须在这三个参数上至少有一个可取之处才值得进主题列表。模态覆盖从纯文本扩展到图像、音频、视频、点云、触觉信号等覆盖范围是否真的拓展了任务边界。任务形式从判别式分类、检索、问答走向生成式图文生成、视频预测再到交互式智能体、工具调用任务越复杂越靠主线后半段。训练范式从大规模预训练、指令微调到偏好对齐、强化学习、多智能体协同范式越往后期越接近Reasoning Agent和World Model的核心。用这个框架去套你会发现很多论文其实在同一个格子里。比如某些模型虽然参数大但任务形式仍然停留在单轮图文问答那它在我的分类里就只属于Fusion的成熟期而不是Agent方向的突破。1.3 2024年为什么是转折点2023年之前多模态研究的主流是“把精度刷高”数据集、榜单、指标都围绕“识别得准不准”展开。2024年开始几个底层条件同时到位直接改变了研究重心。算力不再是空谈开源社区能跑得动7B、13B甚至70B的多模态模型GPT-4V、GPT-4o这类闭源模型展示了多模态指令跟随的上限让大家看到了“多模态对话”和“多模态识别”之间的巨大差异同时纯文本的智能体范式ReAct、Toolformer、HuggingGPT开始成熟研究者立刻想到要把这套能力搬到多模态场景里。三个条件叠加Reasoning Agent 在2024年下半年几乎成了顶会投稿的“主战场”。到了2025年世界模型开始和视频生成深度捆绑大家意识到如果能用大量视频训练一个能预测下一帧的模型这个模型天然就有了“对世界常识的理解”。这个趋势在2026年大概率不会停只是从“生成漂亮视频”转向“生成可交互、可推理的视频环境”。2. Fusion篇多模态融合如何从“拼接对齐”走向“原生统一”Fusion是最老的话题也是最容易被低估的话题。很多人以为融合已经被大模型解决了但实际上2024到2026年的融合仍在演进只是它的战场从“能不能融合”变成了“融合得多自然、多彻底”。2.1 早期融合的三条技术路线我在整理这一部分时把2024年之前的技术路线归成了三类理解这三类就能理解后来所有模型的架构基因。第一类是双塔对齐路线。以CLIP为代表图像和文本各自走一个编码器最后通过对比学习拉到同一个向量空间。优点是训练稳定、检索效果好缺点是无法做复杂的生成和推理任务。它更像“给两个模态之间搭了一座桥”而不是真正的融合。第二类是大语言模型作大脑路线。这是2023到2024年的绝对主流。视觉编码器通常是ViT把图像切成patch并编码然后通过一个投影层Projection Layer把视觉特征转换成LLM能读懂的向量序列。LLaVA系列是这条路线最典型的例子。它做对的关键设计是先冻结视觉塔和LLM用大量图文数据训练投影层对齐再全量微调。这个过程可以用一个很生活化的类比来理解视觉塔负责“描绘”图像里有什么投影层负责“翻译”成文字能表示的语言LLM负责“思考”这些描述之间的关系。第三类是统一分词器路线。以Gemini为代表的原生多模态模型从预训练阶段就把图像、音频、视频统一切成离散token和文本token一起输入同一个Transformer。这条路线的优势在于模态间没有明显的信息瓶颈缺点是训练成本极高数据配比非常讲究不是一般团队能复现的。2.2 融合设计的三个关键细节投影层、视觉塔、位置编码很多朋友复现Fusion类模型时跑出来的效果总比论文差一截问题往往出在三个容易被忽略的地方。第一个是投影层设计。早期LLaVA用的是一层线性投影效果已经不错但后续工作很快发现视觉token数量多、信息密度低直接用线性投影注入LLM会让模型“看了一堆图却抓不住重点”。所以后来的工作普遍采用Q-FormerBLIP-2思路或MLP多层投影本质上是做“视觉信息的压缩与语义抽取”。第二个是视觉塔的选择。同样是ViTCLIP预训练的ViT和DINO预训练的ViT特征分布完全不同。CLIP特征适合跨模态对齐DINO特征在空间理解上更细腻。2024年很多论文做的一个重要工程改进是让LLM同时看CLIP特征和DINO特征两个视角互补这比单纯堆参数有用得多。第三个是位置编码。图像输入和一维文本不同天然是二维结构。如果位置编码处理不好模型对“图片左上角和右下角的关系”就会很糊涂。所以不少论文做了二维位置编码的增强目的就是让模型真正建立视觉空间感。我复现这类模型时最常遇到的效果下降百分之八十出在位置编码实现不完整上。2.3 从融合走向统一处理2025年后的新变化如果只看2025年之后的趋势融合阶段并没有消失而是升级成了“多模态统一处理”。这个阶段的核心思路不再是把外部模态“翻译”成文本而是让不同模态在模型的内部表示里彻底混在一起。比如新一批模型开始尝试“任意模态进、任意模态出”的统一接口。同一套参数输入图像可以输出文本、输入文本可以输出图像、输入视频可以输出音频。技术上靠离散token化把不同模态的连续信号编码成有限的codebook再交给统一的Transformer。这个方法最大的技术红利是训练数据不再局限于“图文对”视频、音频、图文交错序列都能参与预训练数据来源一下子丰富了一个数量级。这个阶段还有一个很接地气的应用趋势就是电商和搜索场景里的“商品多模态支持”。一个商品页里既有标题文本、又有主图和详情图这天然就是多模态统一处理的场景。过去是分别抽取特征再做后融合现在可以直接把商品信息一次性喂给模型让模型自己理解“标题里说的材质”和“图片里的质感”是否对应这种统一化处理比过去的pipeline简单很多。3. Reasoning Agent篇当多模态遇上思维链与工具调用融合阶段解决了“模型能看见”但从“看见”到“想明白”之间还有一条很深的沟。2024年大量多模态测评发现一个尴尬现象模型能准确描述一张图但面对需要多步逻辑推理的视觉问题时错误率飙升。Reasoning Agent方向的核心工作就是填补这道沟。3.1 多模态推理为什么“看得见”不等于“算得对”用一道题就能说明问题给一张三位数的加法算式图片模型能识别出每个数字但如果让它算出结果很多多模态模型仍然会犯错。问题的根源在于推理机制而不是视觉识别。纯文本大模型之所以能推理得不错是因为它的训练语料里有海量的逻辑链哪怕存在“背题”的成分它也能在遇到类似题时激活正确的推导路径。多模态模型的问题在于视觉信息经过编码和投影之后大量位置关系和空间逻辑被压缩模型拿到的视觉表达相对粗糙。再加上多模态训练数据里推理型样本本来就少很多模型本质上是“看图说话”训练出来的不是“看图想事”训练出来的。3.2 从纯文本思维链到多模态推理链2024年之后一批论文开始系统性地把Chain-of-Thought思维链扩展到多模态场景。大体上有三种做法第一种是把思维链直接搬过来让模型先输出观察结果再用文字推导这在部分任务上能提升效果但幅度有限。原因很简单如果视觉感知就已经错了后面推得再漂亮也是错的。第二种是多模态链式分解模型先把复杂问题拆成若干个子问题比如“图上有什么”“物体的相对位置是什么”“哪个物体影响了结果”然后逐个子问题对应到具体图像区域重新定位最后综合判断。这种方式等于让模型“来回看”每一次观察都带着一个明确的问题感知精度明显提升。第三种是隐式推理增强不要求模型输出可读的推理过程而是通过中间计算模块生成思考用的中间TAG或者潜意识信息。这种方法更接近人类直觉工业界落地时也更避免不稳定。3.3 多模态智能体的关键组件感知—规划—工具调用—记忆如果说多模态推理链解决的是“单轮任务里的思考问题”那么多模态Agent解决的就是“多步任务里的执行问题”。2025年涌现的大量Agent工作本质上都在拼四个组件的能力。感知组件负责把环境状态屏幕截图、摄像头画面、传感器数据转成结构化的文本或语义表示。做GUI Agent的人都知道把一张截图转成“当前页面信息”这一步决定了后面所有规划的上限。规划组件负责把一个大目标拆成多个小步骤。早期方案干脆用“你是一个智能体请一步步思考”的prompt现在越来越倾向于用专门的规划模型或者树状搜索。这里最关键的转变是规划不再靠LLM的“自由发挥”而是加上外部反馈让模型每走一步都对照环境状态检查是否偏离目标。工具调用组件负责实际操作比如调用API、点击按钮、打开文件。政策上有一个重要的细节——工具的定义不局限于数字接口也可以是“在虚拟机上执行命令”“操作系统级GUI操作”。这个方向的热度在2025年里持续走高背后是业界对真实生产力的需求。把LLM连上PC端Agent、手机端Agent可以完成填表、订餐、查资料、操作Excel等任务潘多拉的盒子一旦打开后面全是工程问题。记忆组件则是Agent迈向实用的最后一道坎。没有记忆Agent每次对话都是“全新的”上一轮的规划结果无法沉淀。目前主流做法是结合短期工作记忆和长期外部向量库把历史决策、环境状态、用户偏好切成可检索的文本。记忆组件做得好不好直接决定Agent在长任务中的稳定性。4. World Model篇多模态的最前沿正在从“识别世界”转向“模拟世界”做一个多模态论文梳理如果不聊World Model等于只看了一半。World Model是2025到2026年最让人兴奋也最容易被误解的方向。4.1 世界模型是什么不只是视频预测更是环境推演先把一个误区说透世界模型不等于视频生成。视频生成只是世界模型的一种外在表现而世界模型的核心目标是让模型在内部建立一个对环境的动态理解能在给定当前状态和动作的条件下预测下一个状态。生活化类比你开车进一个路口你不会只“看到”前面的车你会在脑子里瞬间模拟出“如果我不减速那辆车会不会撞上我”“如果我现在变道后车距离够不够”。这种基于物理常识和空间关系的快速推演就是世界模型在做的事。自动驾驶行业把它叫occupancy prediction机器人行业叫manipulation planning游戏行业叫neural rendering。4.2 多模态在世界模型中扮演的角色世界模型的输入通常是多模态的视频帧序列、文本指令、音频事件、雷达点云输出则是“对未来的描述”它可以是下一帧图像、下一状态的点云、一段文本预测甚至一台机器人的动作序列。多模态在这里的作用不是“锦上添花”而是“必要充分地感知环境”。比如自动驾驶场景里单靠摄像头识别物体不够因为摄像头对距离和遮挡的估计天然不准单靠雷达又看不到颜色和语义只有把图像语义、深度信息、时序运动信息融合起来模型才能建模出一个相对完整的“世界状态”。所以我们在World Model相关工作里看到的多模态网络结构往往比Fusion阶段复杂得多通常会引入跨模态的注意力机制让不同模态的特征在时空维度上对齐。4.3 2026年的观察点世界模型从“生成演示”走向“决策基础”以我目前的阅读和经验来看2026年的世界模型会沿着三条线分化第一条线是视频生成的极致化。代表方向是用大规模视频训练通用视觉生成器让它能在给定首帧或者文字条件时生成高度一致的后续帧。这类工作的核心考核点是时间一致性如果你生成几秒就会发生物体变形或闪烁那再惊艳也不适合拿来做世界模型。第二条线是世界模型与强化学习结合。模型先生成未来状态的预测再让策略模型基于预测结果做决策这个闭环如果真能跑通机器人领域和自动驾驶会进入新的发展阶段。目前瓶颈是预测误差在长时域上会累积所以大家开始研究“多层级预测”粗粒度预测世界的整体走向细粒度预测局部交互。第三条线是具身智能的落地。世界模型给机器人提供“预演能力”先在大脑里模拟尝试某个动作的结果再在实际世界执行失误率能大幅下降。我之前在复现一个机械臂抓取demo时就被这种模式震撼过——模型先在环境模拟器里尝试了一百次抓取路径选出一条成功率最高的再输出真实动作指令效果比起纯感知模型好了很多。5. 实操篇多模态论文的高效阅读与复现方法前四章是梳理这一章写给正在读论文、复现论文的读者这部分是我自己这一年多实验下来最有价值的方法论。5.1 我自己的论文阅读流程我不从左到右读论文而是固定按照一个顺序来从摘要跳到方法再到实验最后反推动机第一步读摘要和标题在纸上写出这篇论文的三个贡献点写得出来说明读懂了写不出来就再过滤一遍。第二步直接看图不看文字。多模态论文的图一般有两个图最核心一个是总体架构图一个是效果对比图。把图当作论文的浓缩理解。第三步读Methods里的关键公式但只关注“它到底改了什么”。不需要从头推公式只需要看它相对baseline的差异点。第四步翻实验部分的消融表。消融实验是最好的论文阅读方式。它告诉你每个模块到底贡献了多少我读论文最认真看的就是消融实验和成本分析。第五步回到第一步看看自己写的“三个贡献点”是否和作者想表达的一致。这个闭环走完一篇论文才算真正读完读完时间约40到60分钟阅读效率和效果都会明显提升。5.2 论文复现的最小实践方案很多朋友问我读完论文要不要复现我的建议是不要盲目复现但要“指向性复现”。全量复现一篇70B的多模态模型对大多数个人开发者不现实但我总结了三种低成本复现方式能有效验证论文的核心假设最小模型复现使用7B以下的基座模型加上一份小规模图文数据集跑一个几十个step的短训练重点看训练loss是否符合论文中的下降趋势。这种方法大概两三小时能跑一个结论足够验证“方法本身是否有效”。已有开源代码做微调验证许多论文提供了基于Legacy平台的实现不需要全量训练我们可以加载预训练权重在论文的评测集上抽样跑一批结果判断指标是否落在这个论文它声称的区间内。替代模型复现如果论文用的是一个专有视觉塔没法原样复现我会换一个等量级的开源视觉塔用同一套下游任务观察方法带来的提升量是否仍然存在。以我个人经验复现中最容易卡住的坑有三个显存不足、数据下载不全、deepspeed配置差异。这三个都可以通过降低batch size、把图像分辨率降一半、使用CPU offloading来缓解。如果试了三轮还是跑不起来直接换一个更小的baseline先跑通再谈效果。5.3 工具清单与文献追踪多模态论文更新速度非常快光靠朋友圈刷到推荐已经不现实了。下面是我固定使用的一套追踪组合不一定适合所有人但足够应付大多数场景ArXiv的RSS订阅按关键词multi-modal、vision language model、world model设三个组每天早上花十分钟扫标题。Hugging Face Papers每日推荐帮助筛出社区活跃度高的paper。GitHub Trending里的awesome-xxx列表手动更新慢但能顺手找到一些demo代码注意区分demo与full code。论文聚合社区和短视频平台的“大佬讲解”这部分用来补眼界不看细节看方向判断。这套流程一年下来我的主题列表能保持更新而且基本不会错过真正重要的转向。6. 常见问题与避坑经验实录最后这部分我想认真写一下踩过的坑和看别人踩过的坑。我把它按问题类型整理成表大家对照自查能少走很多弯路。问题典型表现原因分析避坑建议论文读到一半完全跟不上不理解图像token和文本token怎么对齐多模态基础缺失先补CLIP、BLIP-2、LLaVA三篇入门再读后面的工作复现时效果明显低于论文指标掉10个点以上视觉塔、数据集、训练精度不一致优先检查数据集配比和视觉塔预训练权重部署Agent总是死在第二步工具调用流程偶尔失败反馈循环没有闭环先做“感知-规划-执行-结果反馈”的最小循环再扩展World Model训练不收敛生成的后续帧开始闪烁时间一致性约束不足引入时序一致性loss降低预测步长只看摘要和指标不了解关键设计知识树是散的没法迁移读得太快每个方向精读5篇泛读100篇效果远好于全都泛读6.1 新手入门最容易踩的坑把CLIP当成多模态我发现一个小现象很多新手读论文时把多模态的起点定位为2024年之后结果一上来就看不懂。正确的方式是回退到2021到2023年的地基性论文把CLIP、BLIP-2、LLaVA、Flamingo这四篇读完后面所有新论文都自然能串起来。这个顺序比倒着看2025年最新论文有效得多。6.2 关键误区面向多模态的数据量是否越大越好这个问题我在很多交流群里被反复问过。我的观点是在Fusion阶段可能还行到了Agent和World Model阶段很可能会翻车。Agent阶段需要的是高质量、带有工具调用序列和反馈信号的数据盲目堆图像文本对不会让模型更擅长操作GUI。我在一个GUI Agent复现项目里甚至发现把文本指令相关的数据减少一半、增加正反馈数据效果反而更好。同样地世界模型需要的是时序连续的数据单张图片堆得再多也无法建模动作和变化的物理规律。所以读论文时一定还要关注它使用的数据分布策略而不是只看数据总量。6.3 从论文阅读到研究方向提炼最后一点也特别重要就是阅读不能被动。我经过这一个长期整理发现最有效的阅读方式是“带着自己的问题去搜索”我想找“Agent如何评估自己是否完成任务”我就会把open-set evaluation、self-refine这些关键词联合检索。每读完一圈更新一次自己的research map。Research map我一般用类似思维导图的结构中心是“多模态认知”向外伸出的分支分别是Fusion、Agent、World Model、评测、数据工程。每个分支下再挂代表论文和个人心得。这个map建起来之后新读的论文只要能挂进去就说明知识体系在生长挂不进去的要么是离主线太远要么是在开拓新分支这两种都值得记录。回头再看我这一年多的论文阅读经历最大的收获不是记住了多少论文名字而是理解了这个领域的演化逻辑融合是底座推理是桥梁智能体和世界模型是应用的上层探索。如果你刚开始入门我的建议是慢下来把几篇经典论文精读透再顺着主线索去扩展。如果读到一个看不懂的章节不用硬啃先跳过继续往下很多问题会随着见过的论文增多自动解开。多模态这个领域变化确实快但它的地基是稳的把地基打牢后面无论出什么新模型你都能快速看懂它到底做了什么事。