跳到正文
北京时间

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

143条精选相关主题AI 视频多模态产品更新

最新精选

第 101–120 条 · 共 143 条
5月18日周一
5月17日周日
5月16日周六
5月15日周五
  1. OpenRouter68

    现已在 OpenRouter 上线:@recraftai V4.1! 包含六款新图像生成模型:追求高美学的 V4.1 和 V4.1 Pro,用于 SVG 插画的 V4.1 Vector 和 V4.1 Pro Vector,以及优先考虑克制风格的产品图像的 V4.1 Utility 和 V4.1 Utility Pro。 照片级真实感更自然,渐变更平滑,简短提示词能更准确地命中目标,无需过多手动调整。

    推荐理由:Recraft V4.1 把图像生成从「能看」推到「好用」,六个变体覆盖从电商图到 SVG 的细分需求,短提示就能出好图,做设计的应该当天就用上。

5月14日周四
  1. Krea73

    Krea 2 访问码发放! K2-PRFUF8 / K2-NRWW9E / K2-CAP48S – 每个码可使用50次。 访问链接如下 👇 [引用 @krea_ai]:this is Krea 2. our first foundation model, built completely from scratch for aesthetic diversity and stylistic control. learn more and get early access 👇

    引用Krea@krea_ai

    这是 Krea 2。 我们的第一个基础模型,完全从零构建,专注于美学多样性与风格控制。 了解更多并获得抢先体验 👇

    推荐理由:Krea 从套壳到自研模型这一步走得关键,专攻美学多样性和风格控制,对设计师来说是个值得立刻上手试的新选择。

5月12日周二
  1. HuggingFace Daily Papers(社区热门论文)76

    Qwen-Image-2.0技术报告

    Qwen-Image-2.0是一个统一高保真生成与精确编辑的全能图像生成基础模型。它采用Qwen3-VL作为条件编码器,结合多模态扩散变换器进行联合建模,并通过大规模数据整理与多阶段训练实现强化。该模型支持长达1K令牌的指令输入,能生成幻灯片、海报等富文本内容,显著提升多语言文本渲染与排版质量。在生成方面,它增强了细节、纹理真实感与光照一致性,并更可靠遵循复杂指令。人工评估表明,其在生成和编辑任务上均大幅超越前代模型。

    推荐理由:这是 Qwen-Image 系列第一次把多模态理解和生成真正拧到同一框架里,长文本渲染和多语言排版提升肉眼可见,做海报和幻灯片的可以重点关注。

5月11日周一
  1. SenseTime72

    SenseNova U1图像生成模型现已在ComfyUI上可运行,并获得包括REBEL AI在内的评测者高度认可。REBEL AI发布的实践教程展示了该模型的部署工作流,并对其图像生成能力进行了真实场景测试。模型支持8步快速推理,生成速度极快,应用场景涵盖人像、超现实艺术、文字标志和生物设计等。相关资源已在Hugging Face、GitHub和Discord平台开放。

    推荐理由:商汤把新模型U1的ComfyUI部署流程完整放出,还有实测视频,想在自己机器上跑国产图像模型的开发者可以直接抄作业了。

5月7日周四
  1. Apple Machine Learning Research(RSS)61

    Normalizing Flows with Iterative Denoising

    研究团队在归一化流(NFs)生成模型领域取得新进展,提出了迭代TARFlow(iTARFlow)。该方法在训练阶段保持完全端到端的基于似然的目标,采样时则采用自回归生成方式。iTARFlow延续了TARFlow在图像建模任务上的优势,使其成为扩散模型等方法的可行替代方案,进一步提升了归一化流生成模型的性能表现。

    推荐理由:Normalizing Flows 这个老方法被苹果玩出新花样,iTARFlow 在训练上保留端到端似然,采样却自回归,给做生成模型的人提供了扩散模型之外的第二个靠谱选择。

  2. Google Gemini67

    通过个人智能与Nano Banana 2的协同工作,您现在可以将兴趣转化为Gemini中的图像。 请勿错过我们在Discord上的下一次社区活动,届时将有最新版本团队的现场演示和问答环节。 👉加入我们的Discord观看直播:http://discord.gg/gemini 📅 今天太平洋时间中午12:00

    推荐理由:Nano Banana 2 把 Gemini 的图像生成从写 prompt 变成了识别你的兴趣,不用费力描述也能出图,对普通用户可能是真痛点,看直播看看实际效果。

5月6日周三
  1. SenseTime71

    🚀 SenseNova-U1 更新: ⚡ 开源8步蒸馏LoRA:100 NFE降至8 NFE,H100推理时间从23秒缩短至2秒 🧩 现已支持ComfyUI,提供文生图、图像编辑和交错生成的即用工作流 试用链接 👇 https://github.com/OpenSenseNova/SenseNova-U1/

    推荐理由:从100步到8步,23秒压到2秒,商汤这个蒸馏LoRA把U1的推理成本打下来了,做实时图像应用的可以认真看看,ComfyUI一接就能跑。

5月1日周五
  1. Midjourney:Updates(RSS)56

    V8.1 更新

    Midjourney V8.1 版本现已登陆 Discord 平台及其官方网站。本次更新重点提升了图像的清晰度与整体画质,这一改进在风格参考(SREF)和情绪板(Moodboards)功能中效果最为显著,同时所有类型的图像生成质量均有所增强,为用户带来更精细的视觉体验。

    推荐理由:Midjourney V8.1 只是个小版本迭代,主要提升锐度和图像质量,用惯了 V8 的可以不急着换,但玩 SREF 和 Moodboard 的值得试一下,细节确实有提升。

  2. ChatGPT63

    一条针对GPT Image 2的特定图像生成提示词正在社交媒体上病毒式传播。该提示词的核心要求是:以最笨拙、潦草且极其糟糕的方式重绘所附图像,背景为白色,使其看起来像是用鼠标在MS Paint中绘制。生成效果需与原图似是而非,带有低质量像素感和令人困惑的别扭感,以突出其荒诞的“差劲”。推文引用者指出,这条提示词正引发疯狂传播。

    引用CHOI@arrakis_ai

    这个 GPT Image 2 提示词现在正疯狂刷屏。 “把附上的图片以最笨拙、最潦草、最可悲的方式重画一遍。用白色背景,让它看起来像是用鼠标在 MS Paint 里画的。它应该隐约相似但又不完全是,有点对得上但又以一种令人困惑、尴尬的方式偏掉,带着那种低质量的逐像素质感,真正强调出它有多荒唐地糟糕。其实,算了,随便吧,你想怎么画就怎么画。”

    推荐理由:这 prompt 把 GPT Image 2 从「精美」逼成了「小学生涂鸦」,是近期最有网感的玩法,做内容的可以直接抄。

4月29日周三
  1. SenseTime65

    是的,SenseNova U1 现已在 Hugging Face 和 GitHub 上发布! 探索它如何以语义精确性和像素级保真度实现复杂的 #信息图 创作。 Hugging Face: https://huggingface.co/collections/sensenova/sensenova-u1 GitHub: https://github.com/OpenSenseNova/SenseNova-U1 Discord: https://discord.gg/cxkwXWjp

    引用AK@_akhaliq

    SenseNova U1 已在 Hugging Face 上线 https://huggingface.co/collections/sensenova/sensenova-u1

    推荐理由:SenseNova U1 开源了,能生成像素级精准的信息图,对于做电商和可视化的人是个直接可用的工具,值得跑一下看看实际表现。

4月27日周一
  1. Rohan Paul71

    用户@doodlestein使用ChatGPT Images 2.0,以蒙娜丽莎为主题创建关于线性变换和谱定理的数学解释信息图。尽管使用了相同的详细提示词,模型在四次生成尝试中产出了布局、矩阵示例和解释结构明显不同的结果。虽然核心概念保持一致,但每次生成在特征向量和变换的可视化呈现方式上各有独特之处。这证实了即使输入不变,模型的输出也存在显著变化。因此,对于重要内容,建议进行多次生成以获取不同的视觉方案和创意角度。

    引用Jeffrey Emanuel@doodlestein

    我很好奇,在给出同样详细的提示来制作数学讲解信息图时,新的 ChatGPT 图像模型在输出上会有多大差异。 结果:差异相当大!如果这对你很重要,不妨多生成几次,即使第一次看起来很棒。

    推荐理由:ChatGPT Images 2.0的输出变异性比想象中大,做内容或设计的人别只看第一张就满意,多生成几次可能有意想不到的好结果。

4月23日周四
  1. HuggingFace Daily Papers(社区热门论文)79

    图像生成器是通用视觉学习者

    研究表明,图像生成训练能像大语言模型预训练一样,让模型学习到强大、通用的视觉表征。通过将视觉任务的输出参数化为RGB图像,研究团队将感知任务重构为图像生成任务。基于Nano Banana Pro指令微调构建的通用模型Vision Banana,在涉及2D和3D理解的一系列任务上取得了最先进的结果,在分割任务上媲美Segment Anything Model 3,在度量深度估计上超越Depth Anything系列。这些成果通过轻量级指令微调实现,且未损害基础模型的图像生成能力。图像生成预训练正成为一种通用的视觉学习范式,可能成为构建兼顾生成与理解的基础视觉模型的核心路径。

    推荐理由:Kaiming He团队证明图像生成器是通用视觉学习者,只用少量指令微调就让Nano Banana Pro在分割和深度估计上超过专用SOTA,且没忘生成本领。CV研究者不读这篇,可能错过一个范式转变。