推荐理由:Runway API 这次集中上新,Seedance 2.0 加入虽然方便了开发者,但没有模型能力的质变,更像是生态补全。
图像生成
全部主题AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
最新精选
第 81–100 条 · 共 143 条
Runway@runwayml精选AI 评分7272
Fei-Fei Li@drfeifei精选AI 评分8383我对这个适用于大规模生成模型新时代的视觉生成基准数据集感到非常兴奋!🤩
引用Keshigeyan Chandrasegaran@keshigeyan1/ 介绍 GPIC:一个用于视觉生成的巨型宽松许可图像语料库和基准! 🚀1 亿 VLM 标注的图像-文本对用于训练 📊100 万图像-文本对用于基准测试 🖼️约 28 万亿像素 🤗集中托管 ✅完全允许用于研究 + 商业用途 数据集、基准和模型🧵👇 与 @KyleSargentAI 共同领导
推荐理由:李飞飞都来站台,这个数据集不简单。完全允许商业用途是关键,对做视觉生成的团队来说,终于有了一个不用再为版权头疼的超级训练库。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7474 彩色噪声扩散采样
扩散模型的生成轨迹具有频谱偏差,早期处理低频全局结构,后期处理高频细节。传统随机微分方程求解器在整个过程中均匀注入白噪声,能量分配效率低。本研究提出彩色噪声采样(CNS),一种免训练的即插即用采样器。它通过动态、随时间和频率调整的噪声调度,更高效地将能量分配给尚未解析的频段。在SiT、JiT、FLUX等架构上的实验表明,CNS作为推理时的替换采样器显著提升了生成质量:在ImageNet-256上,无引导FID在SiT-XL/2上从8.26降至6.27,在JiT-B/16上从32.39降至26.69,在JiT-H/16上从11.88降至8.31,并且在使用无分类器引导时带来一致改进。
推荐理由:扩散模型采样时的白噪声注入一直很粗糙,这篇论文用动态调制的有色噪声把能量怼到未解析的频段,在多个模型上 FID 直接骨折,而且完全训练无关,拿来就能用。
Google AI Developers@googleaidevs精选AI 评分7171
推荐理由:Google 把 Gemini 图像生成能力打包进 Nano Banana 系列并正式 GA,开发者现在可以稳定调用 Pro 和 Flash 级别的生图 API,对做图像应用的团队是个实在利好。
SenseTime@SenseTime_AI精选AI 评分6565
推荐理由:商汤这个8B信息图生成模型升级了,文本和布局都更稳,对常做数据图表和学术配图的人算个实用的小迭代,没有到改变游戏规则的程度。
SenseTime@SenseTime_AI精选AI 评分6868
推荐理由:信息图生成赛道又出新货,商汤这次把文本渲染和布局稳定性真正做好了,做学术图表或运营配图的人可以直接去HuggingFace试用,效果肉眼可见的提升。
Krea@krea_ai精选AI 评分7373Krea 2现已登陆Comfy! KREA的首个基础图像模型——从零训练——具备可调节的创造力、风格参考和情绪板条件控制。
引用ComfyUI@ComfyUIKREA 2 Image 现已成为 ComfyUI 中的合作伙伴节点 KREA 的首个基础图像模型——从零开始训练——具备可调创意、风格参考和情绪板条件控制。
推荐理由:Krea 终于掏出自己的基础图像模型,不再只是包装别人模型。ComfyUI 原生节点让工作流玩家可以立刻上手折腾,自研模型的风格控制是个新鲜变量。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7070 MRT:用于大规模分层图像生成与编辑的掩码区域Transformer
MRT是一个20B参数的掩码区域扩散模型,专为多层透明图像生成与编辑设计。它在超过1000万个多语言设计样本上训练,统一了文本到图层、图像到图层和图层到图层三项任务。模型通过选择性token掩码实现灵活的图层生成与编辑,并引入溢出感知画布图层以处理边界不一致问题,支持半透明背景合成。此外,应用扩散蒸馏实现了8步实时生成。实验表明,MRT在所有任务上显著优于先前先进方法与商业系统。用户研究显示,其图像到图层质量优于同期Qwen-Image-Layered模型,推理速度快10-100倍,GPU内存消耗降低50-90%。
推荐理由:首次把分层图像生成统一到 20B 遮罩扩散框架,溢出画布层的设计挺巧,让图层可以超出边界编辑,蒸馏后能实时跑,做设计工具的团队该仔细读读。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7575 通过奖励倾斜分布匹配强化少步生成器
本文提出奖励倾斜分布匹配蒸馏(RTDMD),这是一个将分布匹配蒸馏与奖励引导强化学习统一应用于少步流生成器的两阶段框架。该方法通过最小化到奖励倾斜教师分布的KL散度,自然分解为分布匹配项与奖励最大化项。第一阶段引入环境一致分布匹配蒸馏(AC-DMD),在子区间进行分布匹配,并通过一致性正则化辅助分数模型追踪生成器分布。第二阶段联合优化两项,并推导混合策略梯度及步子集GRPO(SubGRPO)以降低方差。在SD3、SD3.5和FLUX.2上的实验表明,RTDMD仅用4步推理即可在偏好、美学和组合指标上达到新的 state-of-the-art。
推荐理由:这篇直接把分布匹配蒸馏和奖励建模拧在一起,在 SD3/3.5/FLUX.2 上用 4 步推理就压了之前所有文生图对齐方法,做图像生成训练和偏好对齐的该看。
Google DeepMind@GoogleDeepMind精选AI 评分6767Project Genie 🤝 @GoogleMaps Street View 你现在可以将真实的美国地点转化为全新的交互式世界。🌍

推荐理由:Project Genie这次不是纸上谈兵了,直接吃进真实街景吐出来可玩世界,虽然暂时只限美国,但这是生成式游戏从能做走向普通人可玩的关键一步。
Elon Musk@elonmusk精选AI 评分7373引用X Freeze@XFreezeGrok Imagine Agent Mode 现已在 Grok iOS 应用上线 借助 Agent Mode,你可以生成: • 跨多次生成保持一致的角色 • 同一角色的多个场景 • 不同的镜头角度和环境 • 更具电影感且连贯的叙事画面 这是角色一致性和 AI 生成叙事方面的一次重大升级 现在就在 Grok iOS 应用里试试吧
推荐理由:Grok Imagine Agent Mode把角色一致性从「抽卡」变成可控流程,做故事板、漫画创作的可以立刻上手,虽然目前仅限iOS,但这一步方向很对。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7070 RiT:在表示空间中使用原生扩散变换器已足够
本研究探讨预训练表示空间在流匹配学习中的优势。比较像素、SD-VAE与DINOv2特征后发现,尽管像素与DINOv2的内在维度相近,但DINOv2在几何统计特性(如有效秩、协方差条件等)上表现更优,使回归过程更稳定。基于此,我们提出了表示图像变换器(RiT),它使用冻结的DINOv2特征,通过x-prediction目标训练一个原生扩散变换器。在ImageNet 256×256生成任务上,RiT性能优于参数量更多的DiT^DH-XL模型,且生成的常微分方程仅需少量步骤即可高效求解。
推荐理由:这篇论文没发明新架构,但通过剖析DINOv2特征的统计属性,证明简单结构在表示空间也能做出SOTA,对做图像生成的人来说是个省钱省参数的好思路。
ViggleAI@ViggleAI精选AI 评分6666
推荐理由:Viggle把「上传照片生成3D格斗角色」做成了免费派对游戏,有声音有个性,交互感拉满,是近期最适合摸鱼的产品,但AI含量主要在娱乐侧,别当生产力工具。
美团 LongCat:HuggingFace 新模型精选AI 评分7373 LongCat-Video-Avatar-1.5:升级版音频驱动数字人视频生成框架
美团LongCat团队发布了LongCat-Video-Avatar-1.5,一个专注于音频驱动数字人视频生成的开源框架。其核心升级在于采用Whisper-Large音频编码器,显著优化了唇部动态的流畅度与自然度。该版本实现了精准的唇形同步、全身时序稳定性以及长视频中的身份一致性,并能泛化应用于动漫、动物及多人交互等复杂场景。通过基于DMD2的步蒸馏技术,模型仅需8步即可高效推理。团队还构建了一个涵盖多场景、多语言的人工评估基准,通过大规模主观评分与专家分析,验证了其在多项关键维度上的优异性能。
推荐理由:美团把数字人模型升级到1.5版,换了Whisper做音频编码,唇形同步比之前自然不少,而且开源了训练代码,做电商直播和虚拟博主的朋友可以直接拿过来跟商业方案掰手腕。
Krea@krea_ai精选AI 评分6969为 Krea 2(测试版)引入 LoRA。 我们迄今最强大的微调系统;现在你可以用惊人的精度,在 Krea 2 上训练你自己的特定风格、对象或角色。 了解其工作原理 👇

推荐理由:Krea 2 把 LoRA 微调直接做进了产品,对需要固定角色或风格的设计师来说省事了,虽然不是新概念但低门槛就是好文明。
Midjourney@midjourney精选AI 评分6969推荐理由:Midjourney 把老版本的反提示词带回到 V8.1 了,用 --no 就能剔除画面中不想要的东西,受够了多余路人甲的用户终于可以一键清场。
Google AI@GoogleAI精选AI 评分6969
推荐理由:Google这次更新的不是单点工具,而是把AI能力像乐高一样嵌入到创意工作流的每一步,Flow Agent的多步骤推理尤其值得做设计的人试试看。
OpenAI@OpenAI精选AI 评分7070
推荐理由:OpenAI 首次把内部图像生成数据摊开聊,每周 15 亿张的量级说明这功能已经不是玩具了,做图像产品的可以对着用例风向调方向。
Krea@krea_ai精选AI 评分7373Krea 2深度解析。 学习如何使用风格参考、情绪板,以及如何用Krea 2进行提示。
引用Krea@krea_ai今天,Krea 2 向所有人开放上线。 为庆祝这一时刻,我们向所有订阅用户提供整周无限次 Krea 2 生成。 免费试用 👇
推荐理由:Krea 2 正式全量发布,这个 deep dive 把风格参考和情绪板玩法讲得很透,做视觉内容的朋友今天就能用上。
Claude@claudeai精选AI 评分7575现在你可以用 Claude Design 创作更多内容了。 我们已将所有套餐的 token 限制翻倍。

推荐理由:Claude Design 令牌加倍,做图做设计的人现在可以更放肆地挥霍上下文了,Anthropic 这波更新把设计工具的可用性拉高了一个档次。