四十万美元、两亿张图:华为联合六校训出2K模型 Boogu-Image-0.1,比肩闭源 近日华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了 Boogu-Image-0.1。训练一个顶级文生图模型到底需要多少钱Qwen-Image、HunyuanImage 这些优秀的开源模型预训练动辄用掉数十亿张图像而 GPT-Image-2、Nano-Banana-Pro 等闭源系统虽然效果惊艳其内部实践却始终不对外公开。对于绝大多数研究机构来说这条赛道的入场券太贵了。近日华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了 Boogu-Image-0.1—— 一个仅用 2.08 亿张独立图像、理论训练成本约 40 万美元就在多个基准上做到开源第一、逼近闭源水平的统一多模态模型家族。模型权重、代码与训练配方已全部以 Apache 2.0 协议开源。Boogu 系列模型是最早支持原生 2K 的开源模型之一并支持华为昇腾 Ascend NPUvLLM-Omni 框架等 ModelScope 和 ComfyUI 均已上线。论文标题Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal BudgetarXiv 论文地址https://arxiv.org/abs/2607.13125HuggingFace 论文地址https://huggingface.co/papers/2607.13125代码仓库https://github.com/Boogu-Project/Boogu-Image在线试用https://boogu.org/从「文生图」到「需求生图」Boogu 团队的核心判断是图像生成正在从 Text-to-Image 走向 Requirement-to-Image。用户早已不满足于给一句描述性 prompt—— 他们希望模型能理解复杂意图、隐含约束、多层指令甚至跨模态上下文。而现实需求又极度多样有的只想快速出图有的需要精细排版的海报。单一模型配置很难同时服务好所有场景。因此Boogu 把「理解」提升为与数据质量、训练配方同等重要的一等公民并将其拆解到系统的每一个环节更强的指令编码器。团队把文本编码器类比为文生图模型的「传感器」它决定了整个系统能获得的信息上限。系统性实验证实冻结编码器的规模从 1.7B 扩到 14B生成质量单调提升且未见饱和。最终 Boogu 选用 Qwen3-VL-8B在能力与开源社区可部署性之间取得平衡。Agentic 提示重写做「翻译官」不做「加戏者」。论文提出一个常被忽视的设计原则 —— 重写器应以恒等变换为下界当用户 prompt 已经清晰完整时就原样保留只在意图模糊时才介入。实验显示重写模型越强收益越大0.8B 到 397B 呈近似对数线性提升且在计数、推理、场景文字等维度上能力定向的重写技能带来数倍优势。模型路由让合适的模型干合适的活。Turbo 与 Base 在很多简单请求上输出几乎无差异推理成本却相差 50 倍。Boogu 用 Agent 估计请求难度并动态分发把重型模型留给真正复杂的任务。在 Boogu 自建的 Arena 盲测中与公开 LMArena 排名的 Spearman 相关系数达 1.0, Pearson 相关系数 0.986Boogu-Image-0.1-Turbo-Thinking 以 1048 的 Elo 位列开源第一仅次于 GPT-Image-2 和 Nano-Banana-Pro。在新发布的 Qwen-Image-Bench 上其 Base-Thinking 变体在中英文双语下均取得开源模型最佳总分编辑模型 Boogu-Image-0.1-Edit-Thinking 更是在 ImgEdit-Bench 上拿下全场最高的 4.64 分。敢说真话的技术报告这份 71 页的技术报告有意思的地方不只是结果还有大量业内「靠试错才能学到」却很少被写进论文的细节。公开基准正在失效。团队用 6 个近期模型对比了 LMArena 人类偏好排名与 GenEval、DPG-Bench 分数发现明显的排名倒挂人类偏好最强的 GPT-Image-2 在两个学术基准上只排中游。团队直接宣布不再把这些基准作为主要评估并呼吁社区重新审视其适用性 —— 甚至坦率指出自家模型在 ImgEdit-Bench 上分数虽高但人评中仍不如 Nano-Banana-Pro。「“足够” 的数据」是不够的但结构化的数据可以很省。团队用 1.87 亿开源数据训练的模型明显撞上性能天花板而利用少量按人类先验组织的「Boogu Syllabus」教学大纲式数据仅 2162 万独立样本进行后训练反而能全面提升性能。原则很朴素系统性细粒度拆解、能力全覆盖、每个类别数据量充足 ——「如果模型训练时没见过猫就默认它画不出猫」—— 数据的精细的 “质” 大于朴素地堆砌 “量”。几个可复用的量化结论。一个汉字要被稳定渲染训练中至少需要约 300 次曝光覆盖 3500 个现代常用字即可满足日常中文渲染需求。让模型记住一个从未见过的人物身份需要约 4500 次语言匹配的曝光 —— 团队用一位志愿者也是论文作者之一的 170 张日常照片做了完整消融。不要盲目过滤「坏数据」。水印、过曝、运动模糊的图片不必丢弃 —— 只要在 caption 里明确详细地描述缺陷它们反而能让模型学会理解并可控地规避或复现这些视觉元素。慎用 RL。重度美学 RL 会让输出分布坍缩让模型画「一位六十岁的中国女性」重 RL 模型倾向输出精致妆容的理想化形象。Boogu 选择把人类偏好放进理解系统而非烙进生成器只在肢体结构、文字渲染等不损害多样性的问题上使用 RL。此外作为最早的原生 2K 训练的开源模型之一团队发现标准的动态时间偏移策略在 2K 分辨率会产生「过度挤压」效应导致收敛变慢并给出了简单有效的截断修正方案附录还提出了免训练的推理增强方法 BOGBoosted Orthogonal Guidance把 DiT 预测视为二维矩阵做结构化归一化强化垂直于 flow 流场的信息一定程度提升照片摄影艺术质感。写在最后Boogu-Image-0.1 当然有局限世界知识仍落后于头部闭源系统文字渲染只优化了中英双语复杂多人交互场景仍会出现肢体畸变。但在 40 万美元的预算约束下它给出了一条可复现、可验证的路径 —— 并把过去藏在工业团队内部的工程经验摊开在了论文里。正如团队在结语中所说希望 Boogu-Image-0.1 让图像生成向「真正理解用户想要什么」的系统迈进一步。团队介绍Boogu 团队来自华为香港小艺大模型应用实验室莱布尼茨所联合香港大学、香港科技大学、香港理工大学、香港城市大学、香港中文大学与南京大学共同完成。项目负责人为 Chenyang Lei通讯作者包括 Chenyang Lei、Rui Liu 与 Chao Huang。团队致力于以理解驱动的统一智能体多模态生成研究模型、代码与训练配方均以 Apache 2.0 协议开源。

本月热点