跳到正文
北京时间

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

143条精选相关主题AI 视频多模态产品更新

最新精选

第 121–140 条 · 共 143 条
4月23日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)60

    ChatGPT Images 2.0 发布

    ChatGPT Images 2.0 推出了一个先进的图像生成模型,该模型在文本渲染、多语言支持和视觉推理能力方面均有显著提升。新版模型能够更精准地生成包含文字的图像,并支持多种语言文本输入。其视觉推理功能也得到增强,可更好地理解和执行复杂图像生成指令。此次升级标志着多模态AI生成质量的一次重要进步。

    推荐理由:ChatGPT Images 2.0 把文本渲染和多语言支持拉到了实用级别,对需要快速产出视觉素材的产品人是个实在的提升,只是缺乏效果对比让价值打了折扣。

4月20日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    Show HN: TRELLIS.2 图像转3D功能已在 Mac Silicon 上运行——无需 Nvidia GPU

    TRELLIS.2 图像转3D功能完成 Mac Silicon 适配,无需 Nvidia GPU 即可在苹果芯片上本地运行。开发者开源的移植版本打破了此前对英伟达显卡的硬件依赖。该项目在 Hacker News 发布当日获得 102 个点赞,标志着端侧 AI 3D 生成技术向跨平台部署迈出重要一步。

    推荐理由:TRELLIS.2的Mac移植让Apple Silicon用户终于能在本地跑图像转3D,5分钟出带PBR纹理的400K顶点网格,步骤简单,实测性能数据详实,做3D原型和资产的值得一试。

4月17日周五
  1. Google Blog:AI(RSS)71

    Gemini 应用推出个性化图像创建新功能

    Nano Banana 2 现支持结合个人上下文与 Google Photos 数据生成图像,通过分析用户独特的生活场景,创建反映个人经历的个性化视觉内容。该功能已在 Gemini 应用中上线,使 AI 图像生成能够基于真实生活语境,输出更贴合用户个人故事的定制化结果。

    推荐理由:Gemini把个人照片和偏好直接揉进图像生成,不用再写长篇提示,对想快速出个人化图片的用户挺实用,可惜目前只对美国部分订阅者开放。

4月15日周三
  1. HuggingFace Daily Papers(社区热门论文)75

    生成式细化网络 GRN:面向视觉合成的新一代范式

    研究团队提出生成式细化网络(GRN),通过分层二值量化(HBQ)突破自回归模型的离散化瓶颈,结合全局细化机制与熵引导采样策略,实现类似人类绘画的渐进式修正与复杂度自适应生成。该模型在ImageNet基准上创下图像重建0.56 rFID与类别条件生成1.81 gFID的新纪录,并成功扩展至文本到图像及视频生成任务。相关模型与代码已全面开源。

    推荐理由:GRN 提出了一种全新的视觉合成范式,用近无损分层二进制量化解决了 AR 模型的离散瓶颈,并且自适应步数生成效率很高,关键还把代码和模型都开源了,做图像和视频生成的很值得动手试一下。

  2. Midjourney:Updates(RSS)72

    V8.1 Alpha 发布

    V8.1 Alpha 版本正式发布,接替此前测试一个月的 V8.0 模型。该版本在视觉风格上回归 V7 的一致性审美,并针对 Moodboards 和 srefs 功能进行优化。此次迭代在保持熟悉交互体验的同时,进一步完善了模型的视觉生成能力。

    推荐理由:Midjourney V8.1 把 HD 模式提速 3 倍且变成默认,对设计师意味着每次出图成本骤降,探索速度接近 draft。加上图像提示回归,实用性跨了一大步。

4月2日周四
  1. Microsoft AI:官方博客(网页)66

    Microsoft AI 发布 MAI-Transcribe-1、MAI-Voice-1 与 MAI-Image-2 三款模型,上线 Microsoft Foundry

    Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,即日起所有开发者可在 Microsoft Foundry 和 MAI Playground 使用。

    推荐理由:官方同时给出三款模型的定价和 FLEURS 基准对比数据,开发者可以直接在 Foundry 上手评估适用性。

3月20日周五
  1. Satya Nadella

    MAI-Image-2 图像生成模型已在 MAI Playground 上线,竞技场排名第 3,支持从写实风格到详细信息图等多种生成需求。即将集成至 Copilot、Bing Image Creator 及 Microsoft Foundry,面向企业客户开放。

    引用Mustafa Suleyman@mustafasuleyman

    我们的新图像生成器 MAI-Image-2 发布了!现已在 MAI Playground 上线,从逼真的写实效果到详细的资讯图,样样都能胜任。 我们团队为这次发布付出了巨大的努力,现在我们已跻身顶尖模型之列:在 @arena 上排名第 3 的模型家族。 详情请见我们的博客:https://microsoft.ai/news/introducing-MAI-Image-2/ 它即将登陆 Copilot 和 Bing Image Creator,以及 Microsoft Foundry。 真的为我们模型和产品上的进展感到自豪——敬请期待新发布,并加入我们的超级智能使命!

    推荐理由:微软 CEO 宣布 Superintelligence 团队新图像模型 MAI-Image-2 发布,竞技场排名第三

3月4日周三
  1. Hugging Face:Blog(RSS)70

    PRX 第三部分 —— 24小时内训练一个文本到图像模型!

    Photoroom团队在Hugging Face上发布博客,宣布成功在24小时内完成一个文本到图像模型的训练。这一突破将此类模型的典型训练周期从数周大幅缩短至仅一天。实现的关键在于采用了名为PRX的高效训练方法,该方法优化了计算资源分配与数据处理流程。此举显著降低了模型训练的时间与成本门槛,为快速迭代和部署高质量的图像生成AI模型提供了新的可能性。

    推荐理由:Photoroom 分享 24h 内训练文生图模型的实战路径,想快速复现的团队可直接参考

2月27日周五
2月13日周五
  1. 字节 Seed:Research Feed(网页内嵌数据)

    "思考"更深,生成更准|Seedream 5.0 Lite 发布

    字节跳动发布 Seedream 5.0 Lite 图像生成模型,采用多模态统一架构,跨模态理解与推理能力显著提升,Elo 评分超越前代 4.5 版本。模型首次引入实时检索增强能力,可联网获取最新知识,突破训练数据时间限制。内置丰富世界知识库,在信息可视化、视觉推理、复杂多主体生成等场景表现突出,能根据模糊指令精准修图,支持风格迁移与多步逻辑推理。目前已上线即梦 AI、火山方舟体验中心及豆包内测。

    推荐理由:字节发布 Seedream 5.0 Lite,支持实时检索与深度推理的图像生成模型。

2月11日周三
  1. FireRedTeam:原创语音与多模态项目65

    小红书团队开源 FireRed-Image-Edit 图像编辑模型并发布 REDEdit-Bench

    小红书智能创作团队开源 FireRed-Image-Edit 图像编辑模型,权重采用 Apache 2.0 协议,并在 ImgEdit、GEdit 和自建 REDEdit-Bench 上取得开源模型中的最高分,如 ImgEdit_O 4.56。

    推荐理由:小红书团队开源图像编辑模型,README 给出完整基准对比表、训练与部署方案,读者可自行核对开源 SOTA 的成色。

  2. 蚂蚁百灵:Developer Blog(网页)83

    感知无界·创造有形:百灵全模态 Ming-flash-omni-2.0 焕新生活想象

    百灵全模态大模型Ming-flash-omni-2.0正式发布。该模型基于MoE架构,在视觉、语音、图像等全模态能力上实现代际跃迁,其核心突破在于一个统一模型同时具备了强大的通用泛化能力和特定模态的专家级表现。具体特色包括:视觉百科能精准识别万物并关联知识;语音生成可控制情绪、方言,提供百种音色,并能统一生成语音、音效与背景音乐;图像创作可实现氛围重构、场景合成与智能擦除。技术层面通过亿级数据细粒度感知、知识对齐及超低帧率音频表征等创新实现性能飞跃。模型已在多个平台开源。

    推荐理由:国产全模态模型开源,多模态能力达领先水准,开发者可直接体验或集成。

2月3日周二
  1. Hugging Face:Blog(RSS)73

    文本到图像模型训练设计:来自消融研究的经验

    Photoroom团队通过消融研究,总结了文本到图像模型训练的关键发现:混合高质量与多样化数据、在训练中后期引入强数据增强,以及调整无分类器引导的丢弃率,能有效优化模型性能。这些结论为Stable Diffusion等模型的训练提供了实用指导。

    推荐理由:为文本到图像模型训练提供实用优化建议,帮助开发者提升模型效果。

1月10日周六
  1. Midjourney:Updates(RSS)

    Niji V7 正式发布!

    Niji V7 图像模型正式上线。该版本专为亚洲及动漫场景优化,改进了动漫连贯性、提示词理解能力、文字渲染效果及 sref 性能。

    推荐理由:Midjourney 动漫专用模型 Niji V7 发布,生成质量再升级

12月16日周二
  1. Saining Xie

    新论文:iREPA 扩散模型是其底层表征的渲染器。通过这种新设置,我们能更清楚地洞察这些表征的真正含义。Jas 开始了一场自发的探索,过去三个月我们学到了很多 ps. 这也是我们对一种新型线上"饮水机效应"的小实验,我很喜欢看到这种现象。让我们争论、讨论,然后用真正的努力将其转化为正经科学 [引用 @1jaskiratsingh]:‼️ 表征对生成很重要!但事实证明,我们对表征如何帮助生成的理解一直都是错的 ‼️ 我们之前的想法:(我们错了) ❌ 更大的视觉编码器 → 更好的表征 → 更好的生成 ❌ 更好的全局语义 → 更好的表征 → 更好的生成 结果发现: 🤯 在表征对齐方面,小 20 倍以上的视觉编码器可以达到与更大模型相似或更好的性能 🤯 线性探测准确率约 20%(全局语义的衡量指标)的视觉编码器可以胜过准确率 >80% 的编码器 🤯 即使是 SiFT 和 HoG 这类经典特征也能带来与现代大得多的视觉编码器相媲美的提升 ‼️ 🚨 介绍:什么对表征对齐重要?全局信息还是空间结构 🚨 TL;DR: ✅ 更好的全局语义信息 ≠ 更好的生成 ✅ 空间结构(而非全局语义)驱动表征的生成性能 ✅ 我们提出 iREPA:仅需 3 行代码,强调空间结构迁移,并在 REPA、REPA-E、Meanflow、JiT 等方法上持续提高收敛速度 在 @AdobeResearch 的激动人心的项目,与 @xingjian_leng、@zongze_wu、@LiangZheng_06、@rzhang88、@elishechtman 和 @sainingxie 合作 🙏 对我来说这也是一次特别有趣且独特的经历,在项目的每一步我们都在证明自己的偏见是错误的 😆 还要大力感谢 @YouJiacheng、@ShumingHu 和 @gallabytes,他们在 X 上的评论开启了这一方向的探索 🫡 论文:https://arxiv.org/abs/2512.10794 代码:https://github.com/End2End-Diffusion/iREPA 项目页面:https://end2end-diffusion.github.io/irepa 更多细节见线程:[1/n] 🧵

    引用Jaskirat Singh@1jaskiratsingh

    ‼️ 表征对生成至关重要!但事实证明,我们一直以来对表征如何帮助生成的理解都是错的 ‼️ 我们原本以为的:(我们错了) ❌ 更大的视觉编码器 → 更好的表征 → 更好的生成 ❌ 更好的全局语义 → 更好的表征 → 更好的生成 事实证明: 🤯 小 20 倍以上的视觉编码器在表征对齐方面可以拥有与更大模型相似甚至更好的性能 🤯 线性探测准确率(衡量全局语义的指标)约 20% 的视觉编码器可以胜过准确率超过 80% 的编码器。 🤯 甚至像 SiFT 和 HoG 这样的经典特征也能带来与现代大得多的视觉编码器相当的竞争力提升 ‼️ 🚨 隆重介绍:表征对齐的关键是什么?全局信息还是空间结构 🚨 TL;DR: ✅ 更好的全局语义信息 ≠ 更好的生成 ✅ 空间结构(而非全局语义)驱动表征的生成性能 ✅ 我们提出 iREPA:仅 3 行代码,即可强化空间结构迁移,并在 REPA、REPA-E、Meanflow、JiT 等中持续提升收敛速度 令人兴奋的项目,来自 @AdobeResearch,并与 @xingjian_leng、@zongze_wu、@LiangZheng_06、@rzhang88、@elishechtman 和 @sainingxie 合作 🙏 对我来说,这也是一次特别有趣且独特的经历,我们在项目的每一步都在证明自己的偏见是错的 😆 还要特别感谢 @YouJiacheng、@ShumingHu 和 @gallabytes,他们在 X 上的评论开启了这一方向的探索 🫡 论文:https://arxiv.org/abs/2512.10794 代码:https://github.com/End2End-Diffusion/iREPA 项目主页:https://end2end-diffusion.github.io/irepa 更多细节见推文串:[1/n] 🧵

    推荐理由:颠覆认知:小20倍视觉编码器也能驱动高质量生成,空间结构才是关键

11月25日周二
  1. Together AI 研究与产品博客(RSS)64

    Together AI 上线 Black Forest Labs 的 FLUX.2 多参考图生图模型

    Together AI 将 Black Forest Labs 的 FLUX.2 图像模型接入 Model Library,面向 100 万以上开发者提供多参考输入、hex 色号颜色匹配和文本渲染能力。

    推荐理由:原文列出了多参考输入、hex 色号匹配和三个型号的具体参数,读者可据此判断是否接入现有生成工作流。

  2. Hugging Face:Blog(RSS)80

    Diffusers 集成 FLUX-2 模型

    Hugging Face 的 Diffusers 库正式集成 Black Forest Labs 开发的 FLUX-2 文生图模型。该模型拥有 120 亿参数,采用多模态扩散 Transformer 架构,在图像质量、提示遵循和分辨率方面表现优异,支持生成 1024x1024 像素图像。此次集成让开发者能通过 Diffusers API 便捷使用这一先进模型。

    推荐理由:FLUX-2 图像生成模型正式进入 Diffusers 生态,本地部署和微调更便捷

11月20日周四
  1. Google DeepMind:Blog(RSS)

    Google DeepMind 发布 Nano Banana Pro 图像生成模型

    Google DeepMind 发布 Nano Banana Pro 图像生成模型,基于 Gemini 3 Pro 构建,支持多语言可读文本直接渲染,可结合 Google Search 实时信息生成信息图表。该模型支持 14 张图像融合,保持 5 个人物形象一致性,输出 4K 分辨率。现已集成至 Gemini 应用、Google Ads、Google AI Studio 等产品,所有生成内容均嵌入 SynthID 水印以确保透明度。

    推荐理由:Google 发布 Nano Banana Pro 图像生成模型,支持多语言文本渲染与 4K 输出

10月21日周二
  1. Together AI 研究与产品博客(RSS)66

    Together AI 上线 40 多个图像与视频生成模型,新增视频生成 API

    Together AI 宣布扩展模型库,通过 Runware 合作集成 20 多个视频模型(含 OpenAI Sora 2、Google Veo 3、Minimax Hailuo、Kling v2.1)和 15 个以上图像模型(含 Google Imagen 4.0 Ultra、Nano Banana、Qwen Image),共 40 多个。

    推荐理由:Together AI 官方给出了 40 多个图像与视频模型的名称、时长和逐模型定价,开发者可据此评估能否用一个平台替代多家供应商。

7月2日周三
  1. Modal 官方工程博客(RSS)62

    Modal 如何用 evals 和推理时算力扩展生成既美观又可扫的 QArt 二维码

    Modal 团队复盘其 QArt codes 服务的工程过程,通过 evals 和推理时算力扩展将二维码扫描率提升到 95% 的 SLO,同时改善美观度并将 p95 端到端延迟控制在 20 秒内。

    推荐理由:Modal 团队复盘 QArt codes 从不可扫到 95% 扫描率的工程路径,evals 构建与推理时并行扩展的方法可迁移到其他生成模型应用。