跳到正文
北京时间
原文
Qwen:Blog Retrieval(API)· QwenTeam·· 2026-07-21精选AI 评分77

通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为“实”

Qwen-Image-3.0: Rich Content, Authentic Details, Deep Knowledge

AI 导读

通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。

推荐理由

我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。

正文 · AI 翻译

Image 2QWEN CHAT 我们正式发布 Qwen-Image-3.0,这是 Qwen-Image 系列中的第三代基础图像生成模型。如果说 Qwen-Image-1.0 的关键词是“精准”,Qwen-Image-2.0 的关键词是“精准、多样、完整、美观与真实”,那么 Qwen-Image-3.0 的核心可以归结为一个字——“实”。

这个“实”体现在三个维度上:

  • 内容丰富:支持最高 4.5k token 输入,轻松生成报纸、故事板、试卷等复杂版面。
  • 细节真实:支持小至 10px 文字的精准渲染,生动还原毛孔、发丝等细节,呈现逼真的微观级描绘。
  • 知识深厚:支持 12 种语言的原生渲染,模拟网页、游戏、直播等主流界面,并调用丰富的世界知识。

总而言之,Qwen-Image-3.0 追求的不只是“好看”——它追求的是“好用”,让图像生成成为真正可落地的生产力工具。

内容丰富#

我们先从下面这张由 Qwen-Image-3.0 生成的图片说起:

Image 3 如你所见,Qwen-Image-3.0 能够精准渲染一张数学幻灯片,包括空间关系、数学符号、定理描述以及其他丰富的视觉内容。这些内容布局合理,相对位置恰当,信息量看起来十分丰富。

然而,这并非 Qwen-Image-3.0 的真正实力所在。事实上,这仅仅是它真实能力的“1/9”,因为这张图片实际上只是 Qwen-Image-3.0 生成的一个复杂 3×3 网格中的一格。让我们看看原图:

Image 4 没错——上面这整张图片是由 Qwen-Image-3.0 一次性生成的,而非由多张图片拼接而成。这张图片的难点在于,每一格都是一张复杂的信息图;要精确描述完整的 3×3 网格,需要整整 3.7k tokens。

这 3.7k tokens 必须完整描绘一部隧道安全漫画、一堂空间几何课、《出师表》的文体分析、物理抛体运动、生物寄生虫学讲解、右侧胸痛的医学图解、群论中的 Sylow 定理、银行内控管理信息图,以及细胞 DNA 结构对比——每一格都包含精确的中英文文字、公式、图表、卡通角色等内容。

然而这对 Qwen-Image-3.0 来说依然毫不费力——因为 Qwen-Image-3.0 将可接受的指令长度提升到了 4.5k tokens,这意味着模型能够理解并渲染极其复杂、信息密集的视觉布局。

这正是我们提到的“丰富内容”的一个重要特征:内容可以横向扩展。横向扩展体现了模型在语义并置和空间控制方面的能力——即在单张图像中有序排布多个概念,并在渲染时使其互不干扰。

除了横向扩展,深度是丰富内容的另一个重要特征。

横向扩展考验的是“单张画布上能放置多少个并列元素”,而深度考验的是模型的语义解构和逻辑嵌套能力——即它能否在单张图像中逐层渲染多个嵌套界面。以下示例使用单条指令,由外到内依次展示:VSCode 编程界面 → Qwen Chat 界面 → 微信界面 → 手冲咖啡海报。每一层都保留了各自 UI 的真实风格与细节,形成“画中画中画”的视觉深度。

Image 5 以上两个示例从横向和纵向两个维度阐释了“丰富内容”的含义。

真实细节#

如果说“丰富内容”解决的是“画多少”的问题,那么“真实细节”解决的就是“画多细”的问题。Qwen-Image-3.0 在微观细节的渲染精度上达到了新的高度:10px 的小字清晰可辨,毛孔与发丝纤毫毕现,皮肤质感逼近照片级真实。让我们从小字的精准渲染说起。

下面是一张关于鲸鲨的知识信息图,包含大量文字和插图。Qwen-Image-3.0 能够准确渲染每一个区域。

Image 6 学术论文是小字渲染的终极压力测试——密集的 LaTeX 公式、上下标、希腊字母以及定理编号,其中任何一个符号都不能出错。

Image 7 该模型渲染了一整页代数几何领域的学术论文,包含多行复杂的公式推导。上标、下标、花括号、分数线以及多行对齐等 LaTeX 排版元素均被准确呈现,即使在小字号下也保持了极佳的可读性。

Qwen-Image-3.0 还能在逼真的纸张上生成精细文字。下面这个例子是 Qwen-Image-3.0 生成的一份报纸,模型不仅准确生成了密集的文字,还模拟出了报纸的真实质感。

Image 8 在编辑任务中,我们同样可以生成精细文字。例如在下面这个案例中,模型生成了具有真实风格的标注。

Image 9: Before editingImage 10: After editing

模型会在书页上叠加逼真的红色手写批注——下划线、波浪线、圆圈、箭头和简短评语——笔迹自然流畅,完美模拟了高中生的课堂笔记风格。

除了对文字和版式的精细还原,“真实细节”在质感刻画方面同样表现出色。以下是两个肖像摄影示例,模型在其中捕捉到了极其细腻的质感。

Image 11Image 12 除了肖像之外,模型还能描绘其他物体的细腻质感。

Image 13Image 14Image 15Image 16 在编辑任务中,我们同样可以生成细节丰富的图像。

Image 17: image1Image 18: image2Image 19: image3Image 20: After editing

给定一幅破损或不完整的传统画作,模型能够修复缺失部分,同时忠实保持原有的艺术风格与笔触。

Image 21: Before editingImage 22: After editing

模型完成了这幅鹰斗图的修复,笔触与原作一致,保留了水墨渐变、羽毛质感和构图平衡,同时去除了霉斑和破损痕迹。

深度知识#

“丰富内容”回答的是“它能画得多复杂”,“真实细节”回答的是“它能画得多逼真”,而“深度知识”回答的是“它能画得多广”。Qwen-Image-3.0 具备覆盖 12 种语言、多种字体、100+ 艺术风格以及各类 UI 界面的渲染能力——这一切都依托于模型对世界知识的深度理解。

在以下三个示例中,模型分别准确渲染了日语、韩语和西班牙语。Image 23

Image 24Image 25 除了准确渲染多种语言之外,模型还拥有丰富的世界知识。特别是,该模型能够生成各种逼真的 UI 界面。Image 26

Image 27 我们还可以利用模型强大的世界知识来创建信息图。在下面的示例中,我们基于一张真实图片生成了一张复杂的信息图。

Image 28: Before editingImage 29: After editing

在保留原始昆虫照片主体对象的同时,模型添加了分类学信息、形态学标注、放大细节视图和比例尺等专业元素,生成了一张可直接用于学术发表的研究图。

除了模型自身已具备的世界知识之外,它还可以连接互联网来检索最新的世界知识。例如,我们可以让模型生成一张杭州 7 月 21 日的天气预报图。

Image 30: After editing 该模型还能找到特定的 IP 形象并基于它们进行创作。例如,我们可以生成一张齐白石与梵高在直播间里介绍 Qwen-Image-3.0 的图片。

Image 31: After editing

结论#

从 Qwen-Image-1.0 的“精准”,到 Qwen-Image-2.0 的“精准、多样、完整、美观、真实”,再到如今 Qwen-Image-3.0 的“真实”——我们始终追求的目标,是让图像生成从“可用”走向“实用”,从“好看”走向“好用”。

在“内容丰富、细节真实、知识深厚”三大核心特性的支撑下,Qwen-Image-3.0 在报纸 PDF、短剧分镜、复杂 UI 界面等高价值生产力场景中实现了显著突破。我们相信,随着图像生成模型能力的不断提升,它们将在设计、内容创作、教育、电商等更多领域释放出真正的生产力价值。

以上就是本次更新的主要亮点。希望你们喜欢使用 Qwen-Image-3.0!

来源:Qwen:Blog Retrieval(API) · qwen.ai