
引言多模态大模型的视觉编码器通常被视为一个黑盒——图像进去token 出来但是当我们需要回答为什么 Qwen2-VL 能处理任意分辨率的图像或它和 Swin Transformer V2 的本质差异在哪等这样细致的问题我们必须打开这个黑盒追踪从像素到 token 的每一行代码因此本文基于 Qwen2-VL 官方源码将从数据流、核心模块、框架对比三个层面逐层拆解数据流分析配置文件我们打开源码的配置文件(通常文件名是包含 Config)看看配置内容是什么从配置文件看可以了解到 Vision Encoder 有 32 层 Transformer每一层输出 1280 维的特征并且会映射到 LLM 的维度是 3584 (说明具有投影层)采用的激活函数是 quick-gelu 等信息下面我们把里面一些关键的信息拿出来做分析Quick-gelu我们可以看到第一个设计点是激活函数的选择采用的是 quick-gelu这个激活函数我基本没有接触过但是从功能上看应该主流大模型都会用这个函数对应的表达式QuickGELU(x) x * sigmoid(1.702 * x)我们把两个函数图像拿出来对比发现基本上是吻合的最大误差只有0.02误差 0.02 在神经网络中间层完全可以忽略但计算速度提升约 30-50%很明显从公式上来看后者的计算明显是更简单用几乎不可见的精度损失换显著的速度提升token 压缩Vision Encoder 处理完一张图后会产生很多 token这个参数表示把相邻 2×2 4 个 token 压成 1 个减少数量为什么要压缩 token原因是 LLM 处理序列的计算复杂度为 O(n²)视觉 token 数量直接决定推理开销将 4 个 patch 压缩为 1 个 token能将序列长度降为 1/4计算量降为约 1/16一般都是采用 reshape 的方法实现时间切片处理视频时不仅要把画面切成空间 patch还要把时间切成小段这个参数表示每 2 帧画面打包成一个时间块那么这样视频就能和图像用同一套流程处理——图像可以看作只有 1 帧的视频时间块数为 1权重初始化的抖动范围神经网络刚开始训练时所有权重不能全是 0也不能太大这个值表示初始权重随机抖动的标准差是 0.02这个步骤很关键原因是如果初始化太大训练初期梯度会爆炸模型学不动如果全是 0所有神经元输出一样模型也学不动图片的预处理接着进入图片的预处理部分实现的功能是将图片转化成 tensor 的格式送进 Vision Encode千问在这边有一个小设计—动态分辨率处理简单来说就是保持原比例进行 resize传统的做法基本都是直接裁剪成为正方形这样做宽屏图被压扁了竖屏图被拉宽了信息可能会变形图像编码图像 Encoder 部分是架构中的核心的内容上图中的代码是功能的定义我们看看 forward 函数对这些功能是怎么编排的可以很直观看出数据的流动方向def forward( self, hidden_states: torch.Tensor, grid_thw: torch.Tensor, **kwargs: Unpack[TransformersKwargs] ) - torch.Tensor: r grid_thw (torch.LongTensor of shape (num_images, 3)): The temporal, height and width dimensions of feature shape for each image. Each row contains [t, h, w] values. position_ids get_vision_position_ids(grid_thw, self.spatial_merge_size, kwargskwargs) cu_seqlens get_vision_cu_seqlens(grid_thw, kwargskwargs) hidden_states self.patch_embed(hidden_states) rotary_pos_emb self.rotary_pos_emb(position_ids) emb torch.cat((rotary_pos_emb, rotary_pos_emb), dim-1) position_embeddings (emb.cos(), emb.sin()) for blk in self.blocks: hidden_states blk( hidden_states, cu_seqlenscu_seqlens, position_embeddingsposition_embeddings, **kwargs, ) merged_hidden_states self.merger(hidden_states) return BaseModelOutputWithPooling( last_hidden_statehidden_states, pooler_outputmerged_hidden_states, )数据流数据进来先被 Patch Embedding同时加上 2D-RoPE 位置编码最后传入 Transformer 模块压缩投影后返回注意一下blk 里面并没有 window_size 的字样也就是注意力采用的大概率是全局注意力Patch Embedding 这个步骤我们通常是用卷积直接实现的切分后直接映射只需要控制两个变量分别是 Kernel_size 和 Stride 就可以直接实现Block这个就是前面循环的 32 层的单个内部结构我们可以看看很标准的一个Pre-Norm 残差连接的模块在初始化定义的时候我们看到 sdpa这个全程是Scaled Dot-Product Attention表示的就是全局注意力机制我们继续看 VisionAttention 这个模块代码中有 self.is_causal False表示的是采用了双向注意力机制因果注意力Causal每个 token 只能看前面的不能看后面的LLM 生成文本时用非因果注意力Non-causal每个 token 可以看所有其他 token视觉特征提取时用这个部分就是一个常规的 qkv 的构造和 ViT 的实现基本上是一致的我们把上述的内容总结到表格上并且列举出来步骤操作输入 shape输出 shape关键源码预处理resize normalizePIL Image(3, H, W)image_processingPatchEmbedConv2d(k14,s14)(B,3,H,W)(B, N, 1280)patch_embed位置编码get_vision_position_idsgrid_thw(N, 2)rotary_pos_emb32层 BlockAttention MLP(B, N, 1280)(B, N, 1280)blocksMerger2×2 压缩 投影(B, N, 1280)(B, N/4, 3584)merger数据流的方向如下图所示框架对比在配置环境的时候会安装一个库叫做 Transformer库transformers 库会预装了几百个模型因此我们找 Swim-v2 直接搜就可以代码放下面python3 -c from transformers import Swinv2Model; import inspect; print(inspect.getsourcefile(Swinv2Model))注意力的不同Swim Transformer 的核心的创新就是引入了窗口注意力机制从而减少了计算量简单描述窗口注意力机制把全图切成小窗口每个 patch 只和窗口内的 patch 算注意力而不是和全图所有 patch 算聪明的你发现了那么不同窗口之间实际上是没有注意力交互的因此 Swim 提出可以使用滑动窗口的方式解决这个部分的问题那为什么 Qwen 敢用全局注意力呢前面我们有提到PatchMerger方法因此实际上在送进 LLM 之前我们已经尽量压缩 token 的个数虽然最后的视觉 token 少但是用全局注意力换更强的全局感知能力位置编码的不同Swin 的注意力只在一个小窗口里算它需要一个位置编码来告诉模型这 49 个 patch 彼此的相对位置是什么而 Qwen 的 Vision Encoder 是全局注意力它不需要知道窗口内的相对位置它需要知道的是每个 patch 在原图中的绝对二维坐标归一化的不同这是Swin V2 论文的核心创新之一Swin V1 用 Pre-Norm但模型变大后训练不稳定深层梯度爆炸因此 Swin V2 改成了Post-Norm论文指出 Post-Norm 能抑制特征方差增长让模型能稳定扩展到 3B 参数Pre-Norm (Qwen): x attn(norm(x)) ← 归一化在残差分支前 Post-Norm (Swin): norm(x attn(x)) ← 归一化在残差分支后为什么 Qwen 不做这样的处理呢因为 Qwen 的 Vision Encoder 只有 32 层、大约是 600M 参数Pre-Norm 足够稳定这个时候就有人问为什么 Qwen 不扩展呢因为多模态模型的瓶颈在 LLM不在视觉编码器视觉编码器的任务是提取特征LLM 的任务是理解、推理、生成因此大头是在后者那Swin 为什么需要扩展到 3B因为 Swin 是纯视觉 Backbone下游任务检测、分割、分类的性能直接取决于视觉特征的表达能力所以会扩展参数