
上篇说过规则引擎再强也有够不着的地方「施工区锥桶摆放混乱」「行人撑着花伞」「逆光下的临时交通管制」——这类语义级场景结构化条件根本写不出来。这正是多模态大模型VLM推理挖掘的领地让模型「看图说话」把画面里的语义读成标签和说明。本篇拆解这套引擎的四件事推理输出什么双输出设计、说明文本怎么控成本caption 分级、任务怎么可靠地跑流水线与断点续跑、产出怎么把关审核门禁。一、双输出设计结构化标签 关键说明引擎支持 Qwen-VL / InternVL / BLIP2 等多模态大模型模型名称、版本、端点由模型注册表统一管理。每次推理产出两样东西结构化标签映射统一标签字典——模型产出的标签自动走上篇讲的字典映射与去重未匹配的进候选池待审模型不会污染标签体系关键说明caption一句话描述画面内容如「雨天夜间高速公路上前方有行人横穿道路有积水」——给语义检索用的自然语言描述。两样产出的去向也各有安排标签走统一标签服务入库caption 双重落地——作为 CAPTION 类标签写图片标签表与结构化标签口径同条并存同时作为 caption 列存入图片向量表成为「文搜图」的文本向量来源。一次推理喂饱了结构化过滤和语义检索两条消费路径。可追溯性上每条推理结果全量记录置信度、模型名称、版本、推理时间dwd_mining_inference_job_detail 标签血缘字段——任何一张图上的任何一个模型标签都能回答「哪个模型哪个版本说的它自己有多大把握」。二、caption 成本分级好钢用在刀刃上让大模型给几百万张帧每张都写一句自然语言描述成本会失控。所以 caption 生成分两档方式适用范围示例大模型生成高价值图片规则命中 / 事件抽帧「雨天夜间高速公路上前方有行人横穿道路有积水」标签模板拼接普通图片成本控制「场景高速天气雨时间夜间参与者行人」逻辑很直接规则命中和事件抽帧的帧本来就少且价值高值得花算力让模型写好描述普通帧用已有的结构化标签套模板拼一句成本几乎为零。两类 caption 进了向量表之后检索体验一致——用户搜「积水路面」两档描述都能命中。三、推理任务流水线从选帧到入湖仓一条推理任务的完整链路是推理选帧打分 → Ray GPU 推理 → 双输出 → 字典映射未匹配进候选池→ 人工审核 → 临时区写入 → 质量校验 → 合并入湖仓正式表。几个关键工程点任务要素齐备数据范围时间 / 标签过滤 / 抽样比例、模型与版本、输出目标经 mining_task_id 挂接任务主表明细落推理任务表断点续跑checkpoint 记录已处理 image 水位——任务中断不从头再来几百万帧的任务跑到一半挂了也只损失最后一批幂等写入先写临时区经标签映射与质量校验后才合并入正式表——推理结果永远不会半成品入湖弹性算力Ray / Spark GPU 集群弹性伸缩单卡每日处理不低于 10 万张视模型规模。注意入口的「选帧打分」——不是所有帧都值得推理。结合抽帧篇的 frame_quality_score 与规则命中信号先把算力花在信息密度最高的帧上这是整个推理挖掘成本控制的第一闸门。四、质量门禁模型产出先过审再上岗模型标签天然带噪声所以出口侧的规矩很硬推理结果支持人工审核修正审核结论写回标签表未审核的模型标签不得进入训练集圈选。这也是行业通行的自动标注准入规则——特斯拉 Auto-Labeling 同样以离线自动标注为主、人工团队仅复核难例业界公开实践里「未审核标签不直接进训练集」是底线而非加分项。回头看三级漏斗规则引擎用近乎零成本圈出候选VLM 推理给候选帧补上语义标签和自然语言描述审核门禁保证产出可信。到这里数据已经具备了「结构化标签 语义描述」双重表达——万事俱备只欠把它们变成向量下一篇进入向量化流水线。 本篇要点回顾① 双输出结构化标签映射字典 caption文搜图的向量来源② caption 分级控成本高价值帧模型生成、普通帧模板拼接③ 选帧打分控入口、断点续跑 幂等写入保可靠、单卡日处理 10 万张④ 未审核模型标签不得进入训练集。标签和说明都齐了但要支持「找一批跟这张图相似的场景」还需要把它们编码成向量。下篇讲向量化流水线Embedding 模型怎么选、凌晨 6 点前的 GPU 窗口怎么排、向量表为什么是湖仓里唯一的非分区表。