Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。
开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。
我们推出 Boogu-Image-0.1,这是一个开源统一多模态理解与生成模型系列,包含 Base、Turbo、Edit 和 Edit-Turbo 四种变体。它在高质量文生图、快速推理、基于指令的编辑以及双语(中英文)文本渲染方面均展现出具有竞争力的性能。像 Nano-Banana-Pro 和 GPT-Image-2 这样的闭源多模态系统,其强大性能更多源于系统级集成而非单一模型,但其内部实践在很大程度上仍未公开。在这项工作中,我们证明:即使在计算预算极为受限的条件下,通过对模型理解能力、数据质量和训练流程进行针对性改进,并结合智能体推理时扩展,也能显著提升生成与编辑性能。全面评估表明,Boogu-Image-0.1 在各项标准基准测试中持续达到或超越其他开源模型,并取得了接近领先闭源系统的成果。值得注意的是,这一成果仅使用了 2.0862 亿张独立图像。基础模型的理论训练成本仅约 40 万美元。我们分享了我们认为对整个研究社区有价值的实践讨论,并在 Apache 2.0 许可下发布权重、代码和配方,以推动统一多模态理解与生成的开源生态发展。我们的代码可在此处获取:https://github.com/Boogu-Project/Boogu-Image。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org