从Copilot到Director:多模态智能体如何接管AIGC全流程 本文整理自 QCon北京 2026 李云鑫《从Copilot到Director多模态智能体如何接管AIGC流程》技术分享通过AI音视频转录总结工具Ai好记转录整理以下为视频转文字后的会议笔记内容。AIGC工具遍地开花但为什么还是用起来费劲现在的 AIGC 工具已经多到数不过来。文生图、图生视频、视频剪辑、语音合成每一个细分赛道都有好几个产品。按理说工具越丰富创作应该越方便。但实际情况恰恰相反工具泛滥反而带来了精力消耗。问题出在哪李云鑫在分享中指出当前 AIGC 工具有三大核心痛点规划无逻辑复杂任务比如生成一段短视频涉及多个步骤但现有工具在长程推理和步骤规划上远远不够。工具调用缺乏统筹要做一条完整的视频往往需要在多个工具之间来回切——完图用A工具配音用B工具剪辑用C工具。人成了那个胶水层。评估标准缺失扩散模型天然有随机性同一段 prompt 生成5条结果可能只有1条能用。谁来帮你挑这三个痛点叠加导致一个荒诞的现实工具在提效人在当调度。最终大部分时间不是花在创作上而是花在串联工具上。解题思路以语言智能为大脑李云鑫团队的核心思路很简单但很有效用大语言模型的强规划和抽象能力来接管整个AIGC工作流的调度。具体来说就是构建一个以语言智能为核心的智能体框架基座是全模态大模型能理解文字、图像、音频、视频上层是多模态智能体框架具备复杂任务规划和长程交互推理能力外挂各类 AIGC 工具把生成任务藏到工具调用里这个架构有个很有意思的设计原则不追求一个模型搞定所有事。团队选择的是大语言模型 外挂模块把具体的生成任务比如画图、配音视为工具调用由语言模型指挥合适的工具去执行。全模态基座模型的构建路径要撑起这个智能体框架基座模型必须同时具备理解和生成两种能力。李云鑫团队走了一条务实的技术路线多专家混合架构MoE 渐进式三阶段训练第一阶段让模型学会理解外部信息图像、音频、视频第二阶段预热各专家模块第三阶段任务级调优他们训练的Uni-MoE-20-Omni模型在仅用75B tokens的训练规模下效果已经超越了千万参数的 Omni 模型。这在当时是相当亮眼的成绩。不过更重要的是团队发现外挂式结构才是构建综合型多模态大模型最方便的路径。原因很简单——生成模型迭代太快今天用的文生图模型下周可能就有更强的替身。外挂式的架构允许你随时换发动机。复杂任务推理用强化学习教模型思考有了基座模型还不够要让智能体真正能干复杂活还得教它怎么推理。李云鑫团队在这块用了迭代式强化学习方案冷启动先用已有数据让模型具备基础能力生成采样让模型在真实场景中生成数据强模型筛选用更大的模型来批改作业只保留有效的推理路径DPO对齐用正负样本对加速对齐效果非常明显。在 AIGC 场景中没有推理过程的模型只能生成粗粒度结果而带了推理过程的模型能显著提升生成质量。更有意思的是他们在 UI 操控场景做的多目标强化学习实验。传统的 RPO 训练只有一个监督目标但在复杂的 UI 工作流中单一目标根本不够。团队的做法是在关键中间节点也施加奖励让模型保持路径多样性。结果是一个 7B 的小模型在 UI 调试场景中达到了 96% 的幻觉通过率超越了 GPT-4o 和 Claude 在未见场景上的表现。从 Copilot 到 ComfyAgent 的实践理论讲完来看实际落地的产品。李云鑫团队做了三个递进式的智能体项目ComfyUI-Copilot给 ComfyUI 配了一个AI副驾驶。用户输入需求中控 Agent 从知识库检索相关技能自动生成工作流然后调试修复最后验证交付。这个项目在 GitHub 上拿了 1500 星标还被官方集成了在阿里国际业务也有落地。Anim-Director四智能体协作框架——导演智能体管剧本和分镜摄影智能体调用视频生成模型评估智能体管质量打分14个维度包括美学、一致性、动作质量等后期智能体管配音和后期处理。配合蒙特卡罗搜索做路径优化生成了《小王子》片段。AIGC智能体员工整合前期所有工作迭代实现了全流程自动化。一句话输入比如被老板PUA了系统自动完成从剧本创作到成片输出的全流程。甚至支持多集续写通过飞书/微信就能交互。这个员工后来被美国电影制片人关注并转发带来了25万关注量。AIGC智能体的未来构想李云鑫在分享的最后给出了AIGC智能体发展的三个支柱工具智能维护好 Skill 与工具包组合保持灵活替换的能力叙事能力大模型在剧本创作上有天然优势这会是智能体的核心差异点智能体自进化通过闭环优化知识蒸馏、记忆库沉淀让智能体越用越好用他提到目前 Agentic RL 还处于起步阶段但像 Kimi 2.5 在并行智能体 RL 上的创新已经让人看到了方向。最终的目标是让内容创作不再被技术流程束缚每个人都能把自己的想法直接变成专业内容。对技术团队的三点启发听完整场分享我觉得有几点特别值得技术团队思考外挂式比大一统更实用。别试图做一个什么都能干的超级模型把生成当作工具调用反而更灵活。推理能力是关键分歧点。同样的模型、同样的工具有没有推理过程输出质量差了一个量级。强化学习是教会模型思考的有效路径。智能体自进化能力决定天花板。能沉淀经验、自我迭代的智能体才会越用越好。FAQQAIGC 智能体框架的开源方案有哪些可以参考AComfyUI-Copilot 是一个不错的起点GitHub 上可以找到相关代码。此外MCP 协议和 GEP 协议也值得关注。Q小模型在智能体场景下真的够用吗A不一定非要大模型。李云鑫团队的实验显示7B 模型在配合强化学习后在特定场景如 UI 调试上的表现可以超越 GPT-4o。关键是训练策略和场景聚焦。Q智能体自进化的具体实现思路是什么A核心是经验沉淀 闭环验证。把每次执行中的有效路径和失败案例都结构化存储定期回训练模型形成正反馈循环。以上内容由Ai好记视频转笔记整理。Ai好记是一款音视频转图文笔记的AI音视频转录总结助手支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件视频转文字后自动截取PPT关键帧生成精华速览、思维导图和结构化笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

本月热点