ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AIGC行业的“两张皮”难题,安笙新媒体用AI编程给出答案

AIGC行业的“两张皮”难题,安笙新媒体用AI编程给出答案 影视行业里的AIGC存在普遍的“两张皮”这状况, 就是技术团队呢知晓模型算法, 可不懂叙事节奏如何把控, 内容团队呢明白故事审美方面的事, 却不晓得参数该如何进行调优, 而这两者之间靠手工来传递需求, 效率很低, 损耗还特别大。更为根本的矛盾是, 多数公司存在两种情况, 一种是“内容公司运用工具”, 这种情况在拼第三方应用程序编程接口时缺乏底层掌控力另一种是“技术公司从事内容”, 这种情况虽有模型能力但缺少完整的变现链路。而能够把研发、生产、分发整合为一体的企业非常少。走第三条路的是安笙新媒体科技, 这家处于北京朝阳区的AIGC数字内容企业, 将“用AI影视构想想象里的未来世界”当作使命, 构建了从技术研发直至实现商业变现的完整产业链, 尝试运用一体化闭环的形式, 从根源上排除“两张皮”问题。01 四层技术架构把AI编程写进从模型到分发的每一层有着明确职责边界的自底向上的四层架构才是安笙的技术体系, 并非零散工具的拼凑, 而AI编程能力作为贯穿四层的“通用语言”, AIGC在可复现性、可规模化、可迭代性这三个维度因AI编程而改变, 可复现性表现为微调、参数、流程全部代码化, 风格质量得以精确复现, 可规模化体现为流程编排成可并行DAG任务图, GPU资源实现动态调度, 百集短剧无需线性增人, 可迭代性是分发数据结构化反馈回模型层, 形成自我优化闭环, 这三点唯有深度工程化方可达成。模型层不只是调用模型而是工程化地养模型安笙构建了模型微调工程化管线, 此管线基于PEFT达成LoRA低秩微调, 训练数据经自动化清洗后步入多卡并行训练阶段, 接入版本管理, 微调结束后借助自动化AB测试来确定与基础模型flux-dev的融合配比, 整条管线依靠脚本编排, 能支持一键复现以及批量训练, 条件控制涵盖姿态、MiDaS深度、Canny边缘等多个预处理器, 这些预处理器被封装成标准算子并可按需组合, 从而使生成结果从“开盲盒”转变为“可预期”。通过对象存储权重复查接口中的上层引擎, 动态匹配最优模型无需改业务代码, 即可实现新增或替换模型 , 而模型注册表会以YAML配置维护能力画像含推理速度、显存占用、FID/, 进而将所有基础模型、LoRA权重以及模型存储其中。引擎层自研AI影视技术引擎把复杂推理变成标准接口存在着一个引擎层, 此引擎层属于自研的 AI 影视技术引擎, 而其核心之处在于, 把复杂的模型推理予以封装, 使之成为标准化的接口。要基于构建领域推理框架, 向上提供语义化接口, 这个接口要进行类型校验, 向下负责模型选择, 还要进行参数编译, 这里参数编译还包括预处理, 之后要进行推理, 最后要进行后处理, 这些构成全流程。开发者只需要调用高层接口, 并不需要去了解底层模型格式。多模型推理调度器借助Redis搭建而成, 依据任务优先级以及实时采集的GPU负载, 动态挑选模型与参数。它具备支持通过动态批处理来提高吞吐的能力, 拥有关键镜头多模型生成并融合的操作, 有着过渡镜头速度优先配置的方法, 同时包含超时控制、指数退避重试以及死信队列兜底的措施。生产层Agent驱动的全流程内容生产把短剧项目, 拆解成标准化任务节点, 在生产层引入, 由AI Agent驱动的自动化工作流。短剧, 从剧本开始拆解一直到成片审核的整个流程中的各个节点, 是由那种基于特定条件的专门Agent来负责的。这个Agent会去调用引擎层的接口, 还会用到工具函数。Agent之间是通过传递结构化的数据来进行操作的, 在经过校验之后才负责写入相关内容, 可不是依靠人工采取复制粘贴的方式来完成的。重点在于DAG任务的编排以及异常处理, 编排引擎会依照剧本自动生成依赖图, 通过拓扑排序来确定并行 or 依赖关系, 每个节点都支持持久化, 且能够做到断点续跑, 当结果不符合标准时会自动进行重试或者降级处理, 若耗尽后则转入人工审核队列, 并非将全流程中断。人类创作者, 从原本的操作者, 转变成为了关键节点决策者, 负责把控创意方向, 以及做最终审核, 而重复性工作, 则由Agent自动去完成。分发层让内容数据反哺技术迭代分发层做多渠道分发与发行并将数据反馈闭环回技术体系。针对播放完成率、互动数据、受众画像等信息展开追踪, 将其进行结构化处理之后, 反馈至生产层以及模型层, 其中, 把高完成率镜头的特征提取出来作为训练数据, 凭借高互动风格拉动对应LoRA优先级进行提升, 依据平台偏好对分镜节奏参数产生影响。“分发数据”流程之后进行“技术迭代”, 接着实施“内容优化”, 从而达成“更好表现”, 这样的一个闭环, 唯有一体化架构才能够实现, 纯技术公司缺少真实数据, 纯内容公司缺少转化能力。02 自研引擎的三个核心技术突破框架是四层架构, 是为骨架, 而真正构建差异化的, 那是引擎, 是在三个真实痛点之上实现的工程化突破, 是这样。突破一角色一致性的工程化解决方案AI影视的核心痛点在于角色一致性, 同一角色于不同镜头里, 面部会出现变化, 发型会有所不同, 服装也常常“漂移”, 致使观众一眼就会出戏。常见的多个方案, 分别是固定Seed、IP - 参考、角色LoRA, 其中各种局限存在: Seed仅仅负责随机性, 参考图于大角度发生变化的时候不稳定, 当单一LoRA进行风格迁移时容易丢失特征。安笙的多维度角色锚定系统, 组合起多种技术, CLIP提取512维特征向量, 存入其中作为“角色指纹”, 在生成时, 通过IP-注入来进行强约束, 姿态加上深度控制, 以此保证结构合理, 专属LoRA起到风格保底的作用, 后处理时, 用人脸检测以及余弦相似度那余弦相似度阈值设定为0.85, 来自动重生成不达标的帧, 同时还辅以LPIPS感知校验。系统具备可量化特性, 它能够进行迭代, 一致性评分会反馈至模型层, 进而推动LoRA持续进行微调, 最终形成持续优化的闭环。突破二推理成本与生成质量的动态平衡AIGC影视存在隐性痛点在于成本, 高质量生成意味着大模型, 意味着多采样步, 意味着高分辨率, 也就意味着高GPU成本, 几十集短剧, 如果全都采用最高配置, 那是无法接受的, 要是统一采用低配置, 又不达标。调度器的核心思路是按镜头重要性分级分配算力而非一刀切。剧本拆解期间自动标注镜头重要性, 主角近景加情绪高潮等同于高优先级, 这高优先级意味着高分辨率, 还意味着多采样步, 以及多模型融合, 过渡与远景则是均衡配置, 空镜和转场是速度优先轻量配置。基于K8s的成本感知调度算法, 实时采集GPU负载, 结合项目预算、模型成本质量比矩阵以动态调整策略。借助优先级队列, 实现高优任务抢占, 在算力紧张时自动进行降配减采样步加速, 在预算充裕时提升基线, 视频生成支持相邻帧隐空间复用从而减少计算。关键帧对渐进式精修予以支持, 先是呈现512×512低分辨率的开始检查构图情况, 接着经历Real-/超分这个过程, 随后针对面部手部展开局部修复工作, 以此来防止出现因高配置生成后构图有误而造成的浪费。突破三从自然语言剧本到结构化镜头的转换引擎人工智能生成内容影视的首个技术障碍并非生成画面, 而是要把剧本转化为机器指令, 自然语言编写的剧本充斥着模糊不清的描述, 必然得拆解为景别、角度、表情、灯光等参数, 原本依靠被称为分镜师的人员人工达成, 效率非常低, 标准也不一致。安笙自己研究制作剧本至镜头结构化的转换引擎, 它的核心, 是由大语言模型驱动的影视领域语义解析, 能自动完成三步转换。解读剧本结构, 借助LLM把解析设定成结构化函数调用, 此调用涵盖角色提取、场景标注、情感分析及节奏标记, 对参数进行严格定义, 经过校验后写入数据库, 输出的是包含角色关系图、情绪曲线及剧情节点的结构化对象, 该对象能够直接供下游使用。依据RAG架构, 影视语法知识库经典分镜与题材模式, 通过BGE嵌入存入, 生成之际, 依照情绪标签检索相似案例注入, 再结合爆款镜头特征优化, 最后输出, 有真实案例支撑, 并非纯LLM臆想。从分镜到参数展开映射, 其本质是一种“影视语言转换至AI生成语言”的编译器, 具体做法是进行模板填充, 接着自动完成选择组合, 然后查询模型注册表, 最后分配质量等级分镜AST经过语义解析这个过程, 接着生成中间代码, 最后编译成为JSON请求体, 进而直接执行。将分镜师经验编码成可复用系统能力的是转换引擎, 人类会在关键节点进行创意干预, 标准化转换能够自动完成, 本质上效率和一致性得到了提升。03 内容验证千万级播放量背后的工业化产出能力已在市场得到验证的技术能力, 合作上线了多部精品剧目, 例如《规则之下》, 还有《九重煞》, 以及《顾总你的奶狗掉了》, 甚至包括《人间不必相逢》, 这些剧目都有着千万级的播放量。作品涵盖悬疑、古风、都市、情感等题材, 悬疑题材凭借专属LoRA、构图控制以及暗调场景优化达成氛围稳定输出, 古风题材依靠角色锚定系统、古风专用模型确保服化道一致性与场景还原。千万级的播放并非偶然的运气所致, 而是源于工业化的能力体现, 具体表现为技术架构能够稳定地输出质量, 生产流程具备高效交付的特性, 并且分发数据可实现反哺优化, 这诸多因素共同作用, 使得爆款从依靠概率出现的事件转变为能够重复再现的结果。04 商业闭环从技术研发到内容变现的完整链路安笙的一体化闭环在技术层面有所体现, 构建了一条从研发直至变现的完整产业链, 在商业层面也有体现, 运营着一种自我强化的内容生态。在上游, 其所开展的是持续投入引擎研发这一工作, 其中涵盖微调工程化、推理调度、Agent迭代、剧本转换这些方面, 并且是直接服务于中游的生产所需情状, 而且每项改变改进均在事实上实际项目之中进行快速验证, 以此来达成相应目的。中游阶段, 存在着全链路的内容生产过程, 该过程涵盖剧本策划, 而后是IP改编, 接着是分镜, 再接着是AI视觉, 随后是配音, 最后是精剪, 通过自研引擎来保障效率与质量, 并且持续进行生产以此反哺技术迭代过程当中的数据以及场景。下游, 通过多渠道分发来获取收益, 经过数据结构化这件事之后, 又将其反馈回上游研发以及中游生产, 进而形成一种“技术向着内容转变, 内容再到分发, 由此产生数据, 数据用于优化”这样完整的闭环。商业价值的闭环呈现出这样的模式, 具备全链路利润捕获能力加上具备数据流动驱动技术。再有内容会为此持续自我增强形成积累优势, 而这种优势后来者很难去追赶。
返回列表