
“4个月后交付AGI”这种说法最近在圈子里热度很高。很多人第一反应是“又要画饼了”也有人会认真问AGI到底能不能被交付多模态是不是就是通往AGI的那条路。本文不打算站队而是从技术视角拆开这个话题AGI是什么、多模态AGI为什么被频繁提起、当前工程上能做到什么程度、距离“可交付”还差哪些关键能力。无论你是做算法、做后端还是做系统架构这篇文章都想帮你建立一条相对完整的技术判断链。1. AGI 与多模态 AGI我们需要先对齐概念1.1 什么是 AGIAGI 全称是 Artificial General Intelligence中文一般叫“通用人工智能”。它指的是机器能够在多个领域、多种任务上像人类一样进行理解、学习、推理和行动而不是只在一个窄任务上超越人类。日常我们接触到的 AI 产品比如智能客服、推荐系统、人脸识别、语音助手本质上都是“窄人工智能”ANIArtificial Narrow Intelligence。它们只能解决某个单一问题模型换一个领域几乎就要重新训练。AGI 的差异在于“通用性”同一个系统既能写代码也能做物理实验设计还能看懂医学影像并在这些任务之间迁移知识。不过学术界对 AGI 并没有统一的标准。有人认为“通过了图灵测试就算”有人提出“可以在大多数经济工作中达到人类水平”还有人把 AGI 定义为“具备跨领域学习和自我改进能力的自主智能体”。定义不同交付标准自然也不同。1.2 多模态 AGI 为什么被频繁提起“多模态”指的是文本、图像、音频、视频、传感器数据等多种信息形态。多模态 AGI 则强调一个通用智能系统需要能同时处理和理解多种模态信息并在此基础上完成推理和决策。过去几年大语言模型LLM让机器在纯文本任务上有了质的飞跃但人类获取信息的渠道从来不只是文字。一张产品截图、一段会议录音、一个视频操作步骤都包含比文本更丰富的信息。如果 AI 只能“看文字”它就很难真正理解现实世界。因此多模态成了从“大语言模型”走向“通用智能”的一个关键方向。现在很多产品已经在做多模态融合比如图片问答、视频理解、语音交互、OCR 文档解析。但从“能处理”到“能理解并采取行动”中间还有巨大的鸿沟。后面我们会看到这条路远不是把几个模型拼在一起那么简单。2. 从“口号”到“技术拆解”AGI 可交付吗2.1 “4个月交付”背后的工程语境“4个月后交付 AGI”听起来很具体但站在工程技术角度“交付 AGI”和“交付一个 App”是完全不同量级的事情。一个 App 有明确的版本号、功能边界、验收标准AGI 没有。更常见的现实是研究团队在某个阶段取得突破后会先发布 Demo再逐步开放 API随后变成产品能力。这个过程中“交付”往往不是一个瞬间而是一系列阶段性发布。所以对这类时间点表述更合理的理解是团队内部给自己设定了一个“里程碑节点”希望在此时间点之前把当前技术整合成一个够接近 AGI 体验的原型系统。至于它是否达到真正意义上的通用智能还需要通过大量评测和场景验证。2.2 AGI 能力分层模型为了不让“AGI”这个概念飘在空中工程上可以把它拆成若干能力层。下面是一个常见的分层方式能力层说明当前成熟度感知层理解文字、图像、声音、视频甚至触觉、嗅觉信号文字和图像较成熟视频与物理信号仍在爬坡认知层记忆、推理、规划、知识迁移大模型已有初步能力但稳定性不足行动层使用工具、调用 API、操作软件、控制机械臂Agent 方向快速进展但可靠性和安全性是瓶颈自我进化层自主设定目标、收集反馈、持续改进仅有少量低风险场景下的实验对齐与安全层确保目标符合人类意图、避免有害行为研究活跃但远未收敛如果把这五个层当成一个“AGI 交付清单”你会发现大部分团队在感知层和认知层已经有不少成果但行动层和自我进化层还处在早期。所谓“交付 AGI”更像是指把这些能力整合成一套可用的系统而不是一次性解决所有科学问题。3. 多模态 AGI 的技术栈与实现路径3.1 核心技术组件要搭建一个多模态 AGI 原型系统至少需要以下几个组件多模态编码器把图像、音频、视频等信号转换成模型可以处理的向量表示。统一语义空间让文字、图像、声音在同一个向量空间里可以互相检索和推理。推理与规划模块基于当前状态和用户目标生成执行步骤。记忆模块短期记忆保存当前任务上下文长期记忆沉淀跨任务经验。工具调用层模型输出结构化指令调用搜索引擎、代码解释器、数据库等外部工具。安全与对齐模块判断输出是否安全是否符合用户真实意图必要时阻断操作。这七个组件并不是孤立运行的。它们通常需要在一个事件循环里协作感知输入 → 理解意图 → 规划步骤 → 调用工具 → 观察结果 → 更新记忆 → 生成最终回复。3.2 当前三条主流技术路线路线一大语言模型扩展多模态这是目前产品化最快的一条路。它的思路是在已经很强的文本大模型外面加一层图像/音频编码器并训练一个“投影层”把多模态特征对齐到文本空间。典型如各类多模态大模型。这种路线的优点是数据好找、训练相对稳定、能快速上线多模态问答能力缺点是模型本质上仍然以“文本思维”为主对复杂物理世界的理解能力有限。路线二世界模型路线世界模型希望让模型学到“世界如何运转”的因果规律。例如看到一只杯子从桌上掉落能预测它会向下落并可能摔碎。这种预测能力不靠死记硬背而是靠对物理过程建立内部模拟。如果这条路走通模型就能像人类一样在脑海中“推演未来”再决定下一步动作。难度比前者高很多因为它需要更丰富的时空数据和更复杂的训练目标。路线三具身智能与 Agent 路线这条路线强调“行动反馈”。AGI 不能只在云端回答问题还要能在数字世界或物理世界中执行任务。具身智能把模型接入机器人、无人车、智能终端通过传感器感知环境通过执行器影响环境再从环境的反馈中持续学习。整体来看当前产品级多模态 AGI 更接近路线一和路线三的混合先用多模态大模型做理解再通过 Agent 框架完成工具调用和任务闭环。4. 一个最小多模态感知训练流程示例为了帮助大家理解多模态 AGI 的训练和评测不是玄学下面给出一个极简的工程示例。这个示例不追求复现某个大模型只用来展示“多模态模型训练”的基本流程。4.1 数据准备与处理假设我们要训练一个“图文问答”模型。输入是一张图片和一个问题输出是自然语言答案。第一步是把图片、文本整理成统一的训练样本。# 文件路径prepare_data.py from PIL import Image import torch from torch.utils.data import Dataset class ImageTextDataset(Dataset): def __init__(self, samples, tokenizer, processor): samples: 列表每个元素是 {image_path: str, question: str, answer: str} tokenizer: 文本分词器 processor: 图像处理器负责把图片转成 tensor self.samples samples self.tokenizer tokenizer self.processor processor def __len__(self): return len(self.samples) def __getitem__(self, idx): sample self.samples[idx] image Image.open(sample[image_path]).convert(RGB) pixel_values self.processor(image, return_tensorspt).pixel_values text sample[question] inputs self.tokenizer(text, return_tensorspt, paddingmax_length, truncationTrue, max_length64) labels self.tokenizer(sample[answer], return_tensorspt, paddingmax_length, truncationTrue, max_length64).input_ids return { pixel_values: pixel_values.squeeze(0), input_ids: inputs.input_ids.squeeze(0), attention_mask: inputs.attention_mask.squeeze(0), labels: labels.squeeze(0), }这段代码的核心思路是将图片通过processor变成像素向量将问题通过tokenizer变成 token将答案作为监督标签。真正做数据工程时你还需要考虑图片分辨率、数据清洗、多轮对话格式、混合模态配比等问题。4.2 模型结构示意一个最简的多模态模型可以用“视觉编码器 投影层 语言模型”来搭建。视觉编码器负责提取图像特征投影层负责把图像特征映射到语言模型能理解的空间。# 文件路径model.py import torch.nn as nn class SimpleMultimodalLLM(nn.Module): def __init__(self, vision_encoder, projector, language_model): super().__init__() self.vision_encoder vision_encoder self.projector projector self.language_model language_model def forward(self, pixel_values, input_ids, attention_mask, labelsNone): # 1. 图像特征 vision_features self.vision_encoder(pixel_values) # 2. 投影到文本空间 projected_features self.projector(vision_features) # 3. 拼接文本 token 与图像 token送入语言模型 # 这里为了简化假设语言模型支持 cross-attention outputs self.language_model( input_idsinput_ids, attention_maskattention_mask, encoder_hidden_statesprojected_features, labelslabels, ) return outputs实际工程中你可能会选择已有的开源视觉编码器如 SigLIP、CLIP 等和语言模型然后只冻结一部分参数训练投影层和部分语言模块。这样能显著降低训练成本。4.3 训练与评测框架训练配置用 YAML 维护方便实验管理# 文件路径configs/multimodal.yaml model: vision_encoder: openclip/SigLIP projector_hidden_size: 2048 language_model: qwen2.5-7b-instruct freeze_vision_encoder: true freeze_language_model: false data: batch_size: 16 max_length: 64 image_dir: ./data/images annotation_file: ./data/annotations.jsonl training: epochs: 3 learning_rate: 5e-5 optimizer: adamw fp16: true logging_steps: 50 save_steps: 500启动训练和评测可以使用命令行# 启动分布式训练 python -m torch.distributed.run --nproc_per_node8 train.py --config configs/multimodal.yaml # 在验证集上评测 python evaluate.py --checkpoint ./checkpoints/step_1500.pt --config configs/multimodal.yaml4.4 运行与结果解释训练完成后模型可以在一个简单的问答接口里使用# 文件路径inference.py def predict(image_path, question): image load_image(image_path) prompt f请根据图片回答{question} response model.generate(imageimage, textprompt, max_new_tokens128) return response当模型在测试集上拿到不错的 BLUE / ROUGE / 人工评分时说明它已经学会了一些图文对齐能力。但要注意这只是多模态 AGI 的起点。真正复杂的是如何让模型在连续多轮交互中保持目标一致并在面对模糊输入时主动提问澄清而不是一味“自信输出”。5. 部署一套“AGI 原型系统”需要关注什么5.1 系统架构建议从单模型 demo 走向可部署的多模态 AGI 系统架构上通常需要切成几个模块入口层接收用户文本、图片、音频、视频做格式校验和去重。编排层一个长期运行的 Agent 运行环境负责对话状态管理、工具调度、任务拆解。模型层多模态大模型、向量检索模型、重排序模型、安全分类模型。记忆层这里可以用 Redis 存短期 session用向量数据库存长期事实。工具层内置代码解释器、浏览器搜索、数据库查询、第三方 API 适配器。可观测层请求链路追踪、token 用量统计、打分回调、操作审计日志。这种分层的好处是即使底层模型换版本上层 Agent 流程和安全策略可以保持不变。5.2 推理与工具调用设计“能推理”和“会调用工具”是两件事。一个合理的 Agent 执行循环大概是这样接收用户请求。调用多模态模型解析意图。如果信息不足先调用检索工具补齐背景。生成候选执行步骤。在沙箱里执行代码或调用工具。观察工具返回结果。如果结果异常回溯并重试。最终生成答案给用户。每一步都需要有日志和上限次数避免 Agent 陷入死循环。尤其要设置单轮任务的最大时长、最大 token 消耗、最大工具调用次数。5.3 可观测性与安全护栏多模态 AGI 带来的新风险是“模型看到了图片里的敏感信息后仍然输出不安全内容”。所以系统需要在模型前后各加一道防护输入侧对图片做 OCR 检测、暴力内容过滤对文本做提示注入检测。输出侧对模型输出做关键词和语义风险评估禁止执行高风险工具。审计侧记录每次工具调用的输入、输出、决策原因方便事后追溯。安全不是一个开关而是一组策略叠加。最稳妥的做法是“最小授权”Agent 默认只能访问完成当前任务所需的最小工具集合。6. 常见问题与排查思路在实际训练和部署多模态 AGI 系统时大家经常遇到下面几类问题整理成表格方便排查。问题现象常见原因解决思路多模态模型回答与图片无关图像特征没有有效注入语言模型检查图像 token 是否参与注意力计算尝试加大投影层容量图片分辨率很低导致识别错误数据预处理时压缩过度设置合适的分辨率或在训练时使用多尺度增强模型总是重复同一句话生成参数中 repetition_penalty 过低或训练数据单一调高 repetition_penalty检查数据多样性Agent 调用工具后拿到错误结果还继续用缺少结果校验和重试机制增加工具结果 schema 校验失败后自动重试或换工具多模态模型幻觉严重图像细节无法被模型“看到”或训练数据噪声过大提高图像 token 数量添加幻觉评测集训练时引入拒绝回答训练时显存溢出batch size 过大或模型所有参数都参与训练冻结部分模块使用梯度累积、混合精度、LoRA 微调排查训练问题时我的习惯是先看“数据对不对”再看“loss 降不降”最后看“生成结果差在哪一步”。很多时候问题不是模型能力不够而是输入数据格式不统一或者评测指标选错了。7. 最佳实践与工程建议7.1 数据质量大于模型大小对多模态模型来说数据质量直接影响上限。与其堆海量图文对不如认真做一轮清洗过滤图文不匹配的样本。过滤包含敏感信息或异常文本的样本。对不同模态数据做比例配比避免文本语料过强导致图像特征被忽略。为每个测评场景保留一个小而精的人工标注集。7.2 评测要贴近真实场景很多模型在公开 benchmark 上分数很高一到真实业务场景就露馅。原因是 benchmark 分布太单一。建议自建一套业务评测集包含模糊提问、长上下文、多轮不一致、图文矛盾、恶意输入等场景。每次模型迭代都要回归。7.3 渐进式发布与灰度策略多模态 AGI 系统不要一次全量开放。更稳妥的做法是先内部小范围试用。再对一小部分真实用户开放收集反馈。根据错误类型决定是调数据、调模型还是改流程。最后再扩大流量。同时要设计“降级方案”当模型服务不可用时系统能切换到规则客服或经典检索流程而不是直接报错。7.4 关注成本与延迟“交付 AGI”听上去很酷但算力账单不会陪你浪漫。多模态模型通常体积大推理成本高。工程上可以做模型蒸馏合并视觉编码器和语言模型。使用 KV Cache 和量化推理。对简单问题走小模型通道复杂问题才调用大模型。对多媒体输入做缓存避免重复计算图像特征。8. 学习路线与后续方向如果你刚刚接触多模态和 AGI想系统学习可以参考下面的思路第一阶段学透一个大语言模型的基本原理理解 Transformer、Attention、预训练和微调。第二阶段学习多模态模型的基础结构比如 CLIP、LLaVA、Qwen-VL 的实现方式。第三阶段动手做一个小型多模态问答模型用自己的数据集跑通训练和评测流程。第四阶段研究 Agent 框架比如如何让模型调用工具、如何管理多轮任务状态。第五阶段关注安全对齐和可解释性这些是 AGI 能否真正落地的关键。一个比较重要的提醒是不要被“某天交付 AGI”的说法带偏节奏。技术迭代是渐进的模型能力会越来越强但工程交付物始终是“能力边界清晰、可评测、可回滚的系统”。与其争论 AGI 到底哪一天来不如把精力放在打磨感知、决策、行动、安全这些具体能力上。把这些能力拼装好AGI 才会从愿景变成一个可用的产品。