跳到正文
北京时间

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

143条精选相关主题AI 视频多模态产品更新

最新精选

第 81–100 条 · 共 143 条
5月30日周六
  1. Runway72

    我们持续为 Runway API 添加新模型和端点,以便您能将最佳生成能力直接集成到应用、产品和平台中。通过 Runway API,您可以在一个地方获得所需的所有模型,包括 Seedance 2.0、GPT Image 2、HappyHorse 1.0、Nano Banana Pro、Magnific Precision Upscaler V2 等更多内容。请通过下方链接开始使用。

    推荐理由:Runway API 这次集中上新,Seedance 2.0 加入虽然方便了开发者,但没有模型能力的质变,更像是生态补全。

  2. Fei-Fei Li83

    我对这个适用于大规模生成模型新时代的视觉生成基准数据集感到非常兴奋!🤩

    引用Keshigeyan Chandrasegaran@keshigeyan

    1/ 介绍 GPIC:一个用于视觉生成的巨型宽松许可图像语料库和基准! 🚀1 亿 VLM 标注的图像-文本对用于训练 📊100 万图像-文本对用于基准测试 🖼️约 28 万亿像素 🤗集中托管 ✅完全允许用于研究 + 商业用途 数据集、基准和模型🧵👇 与 @KyleSargentAI 共同领导

    推荐理由:李飞飞都来站台,这个数据集不简单。完全允许商业用途是关键,对做视觉生成的团队来说,终于有了一个不用再为版权头疼的超级训练库。

5月29日周五
  1. HuggingFace Daily Papers(社区热门论文)74

    彩色噪声扩散采样

    扩散模型的生成轨迹具有频谱偏差,早期处理低频全局结构,后期处理高频细节。传统随机微分方程求解器在整个过程中均匀注入白噪声,能量分配效率低。本研究提出彩色噪声采样(CNS),一种免训练的即插即用采样器。它通过动态、随时间和频率调整的噪声调度,更高效地将能量分配给尚未解析的频段。在SiT、JiT、FLUX等架构上的实验表明,CNS作为推理时的替换采样器显著提升了生成质量:在ImageNet-256上,无引导FID在SiT-XL/2上从8.26降至6.27,在JiT-B/16上从32.39降至26.69,在JiT-H/16上从11.88降至8.31,并且在使用无分类器引导时带来一致改进。

    推荐理由:扩散模型采样时的白噪声注入一直很粗糙,这篇论文用动态调制的有色噪声把能量怼到未解析的频段,在多个模型上 FID 直接骨折,而且完全训练无关,拿来就能用。

  2. Google AI Developers71

    🍌 Nano Banana Pro [gemini-3-pro-image] 和 Nano Banana 2 [gemini-3.1-flash-image] 现已正式发布,可通过 Gemini API 投入生产使用。查看这些优秀的社区示例,了解两个模型的实际能力 🧵↓

    推荐理由:Google 把 Gemini 图像生成能力打包进 Nano Banana 系列并正式 GA,开发者现在可以稳定调用 Pro 和 Flash 级别的生图 API,对做图像应用的团队是个实在利好。

  3. SenseTime65

    SenseNova-U1-8B-MoT-Infographic 是一个升级后的8B参数信息图表生成模型。其核心提升在于:增强了文本的准确性与可读性,减少了重复和不自然的放大;改进了布局的一致性与合理性,背景更稳定;提升了图表与示意图的渲染质量;并新增了学术内容的渲染支持。

    推荐理由:商汤这个8B信息图生成模型升级了,文本和布局都更稳,对常做数据图表和学术配图的人算个实用的小迭代,没有到改变游戏规则的程度。

5月28日周四
  1. SenseTime68

    商汤科技介绍了其升级后的信息图生成模型 SenseNova-U1-8B-MoT-Infographic。该模型参数为8B,在四个关键维度进行了优化:文本准确性与可读性增强,减少了重复和不当放大;布局的一致性与合理性提升,背景更稳定;图表与示意图的质量提高;并新增了学术内容的渲染支持。推文提供了在 Hugging Face 上的模型页面链接及能力展示页面。

    推荐理由:信息图生成赛道又出新货,商汤这次把文本渲染和布局稳定性真正做好了,做学术图表或运营配图的人可以直接去HuggingFace试用,效果肉眼可见的提升。

  2. Krea73

    Krea 2现已登陆Comfy! KREA的首个基础图像模型——从零训练——具备可调节的创造力、风格参考和情绪板条件控制。

    引用ComfyUI@ComfyUI

    KREA 2 Image 现已成为 ComfyUI 中的合作伙伴节点 KREA 的首个基础图像模型——从零开始训练——具备可调创意、风格参考和情绪板条件控制。

    推荐理由:Krea 终于掏出自己的基础图像模型,不再只是包装别人模型。ComfyUI 原生节点让工作流玩家可以立刻上手折腾,自研模型的风格控制是个新鲜变量。

5月27日周三
  1. HuggingFace Daily Papers(社区热门论文)70

    MRT:用于大规模分层图像生成与编辑的掩码区域Transformer

    MRT是一个20B参数的掩码区域扩散模型,专为多层透明图像生成与编辑设计。它在超过1000万个多语言设计样本上训练,统一了文本到图层、图像到图层和图层到图层三项任务。模型通过选择性token掩码实现灵活的图层生成与编辑,并引入溢出感知画布图层以处理边界不一致问题,支持半透明背景合成。此外,应用扩散蒸馏实现了8步实时生成。实验表明,MRT在所有任务上显著优于先前先进方法与商业系统。用户研究显示,其图像到图层质量优于同期Qwen-Image-Layered模型,推理速度快10-100倍,GPU内存消耗降低50-90%。

    推荐理由:首次把分层图像生成统一到 20B 遮罩扩散框架,溢出画布层的设计挺巧,让图层可以超出边界编辑,蒸馏后能实时跑,做设计工具的团队该仔细读读。

5月26日周二
  1. HuggingFace Daily Papers(社区热门论文)75

    通过奖励倾斜分布匹配强化少步生成器

    本文提出奖励倾斜分布匹配蒸馏(RTDMD),这是一个将分布匹配蒸馏与奖励引导强化学习统一应用于少步流生成器的两阶段框架。该方法通过最小化到奖励倾斜教师分布的KL散度,自然分解为分布匹配项与奖励最大化项。第一阶段引入环境一致分布匹配蒸馏(AC-DMD),在子区间进行分布匹配,并通过一致性正则化辅助分数模型追踪生成器分布。第二阶段联合优化两项,并推导混合策略梯度及步子集GRPO(SubGRPO)以降低方差。在SD3、SD3.5和FLUX.2上的实验表明,RTDMD仅用4步推理即可在偏好、美学和组合指标上达到新的 state-of-the-art。

    推荐理由:这篇直接把分布匹配蒸馏和奖励建模拧在一起,在 SD3/3.5/FLUX.2 上用 4 步推理就压了之前所有文生图对齐方法,做图像生成训练和偏好对齐的该看。

5月22日周五
  1. Elon Musk73

    Grok 进展 Grok Imagine Agent Mode 现已在 Grok iOS 应用上推出。 借助 Agent Mode,你可以生成: • 跨代际一致的角色 • 同一角色的多场景画面 • 不同的镜头角度和环境 • 更具电影感和连贯性的叙事视觉效果 这是角色一致性和 AI 生成叙事方面的一次重大升级。 现在就在 Grok iOS 应用中尝试吧。

    引用X Freeze@XFreeze

    Grok Imagine Agent Mode 现已在 Grok iOS 应用上线 借助 Agent Mode,你可以生成: • 跨多次生成保持一致的角色 • 同一角色的多个场景 • 不同的镜头角度和环境 • 更具电影感且连贯的叙事画面 这是角色一致性和 AI 生成叙事方面的一次重大升级 现在就在 Grok iOS 应用里试试吧

    推荐理由:Grok Imagine Agent Mode把角色一致性从「抽卡」变成可控流程,做故事板、漫画创作的可以立刻上手,虽然目前仅限iOS,但这一步方向很对。

  2. HuggingFace Daily Papers(社区热门论文)70

    RiT:在表示空间中使用原生扩散变换器已足够

    本研究探讨预训练表示空间在流匹配学习中的优势。比较像素、SD-VAE与DINOv2特征后发现,尽管像素与DINOv2的内在维度相近,但DINOv2在几何统计特性(如有效秩、协方差条件等)上表现更优,使回归过程更稳定。基于此,我们提出了表示图像变换器(RiT),它使用冻结的DINOv2特征,通过x-prediction目标训练一个原生扩散变换器。在ImageNet 256×256生成任务上,RiT性能优于参数量更多的DiT^DH-XL模型,且生成的常微分方程仅需少量步骤即可高效求解。

    推荐理由:这篇论文没发明新架构,但通过剖析DINOv2特征的统计属性,证明简单结构在表示空间也能做出SOTA,对做图像生成的人来说是个省钱省参数的好思路。

  3. ViggleAI66

    介绍Fight Anyone 3D🥊一款3D派对格斗游戏,可能是上班时玩起来最爽的游戏。 上传任何人的照片 → 一个可玩的3D格斗角色,带有语音、个性+招牌动作,由Viggle自研游戏引擎+模型打造。 公测期间100%免费+赠送20张礼品卡。玩得越多,赢得越多! 和同事对战。和朋友对战。和任何人对战。链接+教程+更多内容见下方推文串 ↓

    推荐理由:Viggle把「上传照片生成3D格斗角色」做成了免费派对游戏,有声音有个性,交互感拉满,是近期最适合摸鱼的产品,但AI含量主要在娱乐侧,别当生产力工具。

  4. 美团 LongCat:HuggingFace 新模型73

    LongCat-Video-Avatar-1.5:升级版音频驱动数字人视频生成框架

    美团LongCat团队发布了LongCat-Video-Avatar-1.5,一个专注于音频驱动数字人视频生成的开源框架。其核心升级在于采用Whisper-Large音频编码器,显著优化了唇部动态的流畅度与自然度。该版本实现了精准的唇形同步、全身时序稳定性以及长视频中的身份一致性,并能泛化应用于动漫、动物及多人交互等复杂场景。通过基于DMD2的步蒸馏技术,模型仅需8步即可高效推理。团队还构建了一个涵盖多场景、多语言的人工评估基准,通过大规模主观评分与专家分析,验证了其在多项关键维度上的优异性能。

    推荐理由:美团把数字人模型升级到1.5版,换了Whisper做音频编码,唇形同步比之前自然不少,而且开源了训练代码,做电商直播和虚拟博主的朋友可以直接拿过来跟商业方案掰手腕。

5月21日周四
  1. Midjourney69

    今日小幅更新。许多用户要求为V8模型恢复“反向提示”功能(旧版本已有),我们称之为--no标志。该功能现已在V8.1中上线!如果您想从图像中排除某些元素(例如人物),可以尝试使用--no people。玩得开心!

    推荐理由:Midjourney 把老版本的反提示词带回到 V8.1 了,用 --no 就能剔除画面中不想要的东西,受够了多余路人甲的用户终于可以一键清场。

  2. Google AI69

    谷歌与创作者合作推出系列AI工具更新。Google Workspace新增图像创作编辑工具Pics;Google Flow支持Gemini Omni Flash模型,并推出Flow Agent作为多步骤创作伙伴;设计工具StitchbyGoogle支持实时文字或语音编辑布局并导出代码;音乐工具Google FlowMusic增加分段编辑、风格混音及视频生成功能。

    推荐理由:Google这次更新的不是单点工具,而是把AI能力像乐高一样嵌入到创意工作流的每一步,Flow Agent的多步骤推理尤其值得做设计的人试试看。

5月20日周三
5月19日周二