跳到正文
北京时间

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

143条精选相关主题AI 视频多模态产品更新

最新精选

第 41–60 条 · 共 143 条
7月3日周五
  1. HuggingFace Daily Papers(社区热门论文)74

    表示分布匹配(RDM)用于一步视觉生成

    表示分布匹配(RDM)通过匹配冻结预训练编码器下的生成与参考特征分布来训练一步图像生成器。三个发现:经典MMD正确估计后成为可扩展目标;生成批次大小最优超过2048;单一表示可被欺骗,需匹配平衡编码器组合并采用独立于训练损失的SW_r14评估。改进的iRDM在ImageNet上以SW_r14 1.30达一步生成SOTA,PickScore在71.2%样本上偏好iRDM。该方法将四步FLUX.2后训练为一步生成器,在GenEval(0.826对0.794)和PickScore(22.76对22.58)上超越原版,仅需90 H200 GPU小时。

    推荐理由:这篇论文把MMD重新变成了一流的一步生成目标,用多编码器匹配防止作弊,并把FLUX.2四步模型浓缩成一步,性能不降反升,90 GPU小时就能复现,做视觉生成的人应该仔细看。

7月1日周三
  1. Apple:Newsroom(RSS)66

    Apple Creator Studio 更新:更智能、更快速、更互联

    Apple Creator Studio 推出多项 AI 增强更新。Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动转录音频生成字幕)和 Edit Detection(自动检测剪辑点)。Mac 版加入 Auto Mask(自动识别皮肤、天空等主体)、增强的 Match Color 和 Advanced Trimming。支持将帧发送至 Pixelmator Pro 编辑,并在 Keynote、Pages、Numbers 中直接调用 Pixelmator Pro 修改图片。Logic Pro 新增 Grammy 制作人制作的 Producer Project 及 Chord ID 改进。订阅价 $12.99/月或 $129/年,新用户免费试用一个月,教育用户 $2.99/月。

    推荐理由:Final Cut Pro 的自动字幕和遮罩是实打实的工作流提升,Pixelmator Pro 的深度整合也让设计更顺畅,虽然没有颠覆性突破,但创意工作者今天就能用上。

  2. Google DeepMind:Blog(RSS)70

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash

    Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为 Nano Banana 系列速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio、Gemini API 及消费者产品(AI Mode in Search、Gemini app 等)。同时推出 Gemini Omni Flash(gemini-omni-flash-preview),支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒,面向开发者开放 API。

    推荐理由:Nano Banana 2 Lite 把图像生成拉到 4 秒延迟和 0.034 美元单价,很适合高频草稿流,Omni Flash 首次对开发者开放视频生成和对话编辑,两个模型串起来的快速迭代工作流是这次最实用的更新。

6月26日周五
  1. Midjourney67

    Midjourney 带来两项更新。一是加入 `--preview` 参数可提前体验 V8.2 的美学与个性化效果;二是此前在 V8.1 推出的大批量草稿模式(生成 24 张低分辨率图,价格仅为标准 4 张的一半,点击 "Vary" 可升级为全分辨率)现在支持搭配 `--sref random` 使用,探索风格空间的速度比之前快 24 倍。

    引用Midjourney@midjourney

    我们为 V8.1 发布了一个新的大批量草稿模式。这个新模式可以让你生成 24 张较低分辨率的图像,价格仅为标准分辨率 4 图 Midjourney 任务的一半。当你喜欢某张图像时,只需按下 "Vary" 即可获得全分辨率的新版本。享受吧!

    推荐理由:新草稿模式让批量探索风格变得便宜又快速,配上 sref random 更是把试错效率拉满,设计师能直接用到工作流里。V8.2 预览只是小彩蛋,但暗示美学调校还在进化。

  2. Midjourney:Updates(RSS)62

    Midjourney V8.1 草稿模式新增随机风格功能

    Midjourney V8.1 的草稿模式(draft mode)添加了随机风格功能。用户在提示词中加入 `--sref random` 即可一键生成 24 张不同风格的图片。开启草稿模式可通过点击提示栏的 ⚡ 图标或添加 `--draft` 参数。

    推荐理由:Midjourney 在 V8.1 草稿模式加了随机风格,一键出 24 种草图,对找灵感的创作者算顺手小升级,但改变不了核心创作流程,只适合深度用户尝鲜。

6月25日周四
  1. 公众号:京东JoyAI62

    JoyAI 上线「欢乐足球季」:上传一张照片即可生成赛场动态视频

    JoyAI APP 上线「欢乐足球季」主题活动,用户上传一张人像照片即可生成沉浸式赛场动态视频,支持肢体动作拟合、环境动态渲染与专业运镜。活动提供近 20 款视频模板,覆盖看台抓拍、进球庆祝、足球手势舞等玩法,并同步上线近 50 款足球主题聊球智能体。上线首周互动量日均增长率超 158%。

    推荐理由:模板覆盖看台、进球、手势舞等场景,无需编辑技能即可产出氛围感短片,对丰富观赛社交内容有直接帮助。

6月24日周三
  1. OpenRouter:Announcements(RSS)73

    OpenRouter推出统一图像API

    OpenRouter推出统一图像API,整合Google、OpenAI、Black Forest Labs、Recraft、ByteDance、Sourceful、Microsoft、xAI等30+模型。新API提供标准化请求格式,通过`/api/v1/images/models`端点返回每个模型的分辨率、宽高比、输出数量、输入参考图数量、种子等能力描述;通过`/api/v1/images/models/{id}/endpoints`端点获取具体服务商的定价与参数支持(如Seedream 4.5每张$0.04、FLUX.2 Pro每百万像素$0.03、GPT-5.4 Image 2按token计费)。OpenAI的GPT 5系列图像模型支持SSE流式预览,启用`"stream": true`即可边生成边返回预览。新图像模型将仅添加至专用API,建议现有用户切换。

    推荐理由:OpenRouter 把 30+ 图像模型收进一个 API,参数自动发现和流式预览让频繁切换模型的开发者省去不少适配麻烦,尤其对 Agent 工作流很友好。

  2. Krea71

    我们的技术报告已发布。 深入解析创建 Krea 2 所用的数据、架构及训练技巧。 https://www.krea.ai/blog/krea-2-technical-report

    引用Krea@krea_ai

    今天,我们发布了 Krea 2 的开放权重。 欢迎 Krea 2 Raw 和 Krea 2 Turbo,一个来自训练中期的未蒸馏模型,旨在用于微调,以及一个具有广泛美学多样性的快速蒸馏版本。 阅读下面的详细信息 👇

    推荐理由:Krea 2 开源了两个图像模型权重,一个未蒸馏适合微调,一个快速蒸馏版覆盖多样审美。对于做图像生成应用和模型融合的团队,这次开放权重比很多大厂都实在。

6月21日周日
  1. 公众号:腾讯元宝64

    腾讯元宝父亲节活动:上传照片生成与年轻爸爸的合影

    腾讯元宝推出父亲节主题活动,用户可选择爸爸年轻时照片与自己的照片,输入提示词(如“帮我生成一张和爸爸的合影,将图2的我融合到图1爸爸的照片中,我想穿越回__年前,和他一起_____;保留爸爸照片的背景、动作及五官;人物姿态自然协调,整体光线与色调保持一致”),元宝即可生成合影。活动旨在让用户“回到过去”看到爸爸的青春模样。

    推荐理由:元宝的父亲节营销,但合影生成指令写得具体可复现,比普通AI写真教程更接地气,父亲节想整活的可以直接抄作业。

6月18日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)79

    ChatGPT 图像生成器可被绕过滤镜生成暴力和色情内容

    Mindgard 红队研究发现,ChatGPT 的图像生成器可通过简单提示词轻易绕过内容过滤器,在未直接请求的情况下自动生成性暴力、血腥谋杀等露骨图像。一个热门的“恢复照片”提示词因输入模糊而绕过输入过滤器,结果如同俄罗斯轮盘赌;进一步添加虚假图像 ID 和“不做审查”指令后,模型持续生成高度性化女性图像,甚至出现被捆绑殴打的尸体,并自动赋予惊悚标题。研究指出,OpenAI 此前声称修复的裸体问题仍未解决,暴露了 AI 工具广泛可及性与不足内容过滤的现实风险。

    推荐理由:这是自 ChatGPT 图片功能上线以来最严重的安全漏洞曝光,Mindgard 用简单句子就绕过所有 filter 直接生成极端暴力色情图片,OpenAI 的回应和处理令人失望,暴露了训练数据治理的根本问题。

  2. Midjourney71

    我们发布了 V8.1 的新大批次草稿模式。该新模式可让你生成 24 张低分辨率图像,价格仅为标准分辨率四图 Midjourney 任务的一半。当你喜欢某张图像时,只需按下 "Vary" 即可获得全分辨率的新版本。尽情享受吧!

    推荐理由:Midjourney 这个批量草稿模式把试错成本砍半,对高频出图的设计师是个实在的提速,但不算能力升级,更像效率补丁。

6月16日周二
  1. TechCrunch:AI(RSS)71

    Meta 在 Facebook 上线“AI Mode”,基于平台公开信息合成答案

    Meta 宣布在 Facebook 推出“AI Mode”搜索功能,利用 Meta AI 从公开帖子(含群组和 Reels)提取信息并合成答案,用户可用自然语言提问获得摘要。同时新增视频拼贴剪辑、过渡效果及 AI 照片预设(可更换服装、发型和配饰),体育迷可在 Stories 中点击“AI Edit”虚拟穿上队服。这些更新延续了此前动态头像、Marketplace 自动回复和创作者 AI 助手的部署节奏。此外,Meta 近期启动了 Facebook、Instagram 和 WhatsApp 的全球订阅计划(每月 3.99 美元起),更多 AI 订阅层级正在规划中。

    推荐理由:Facebook 的 AI 模式把社交搜索变成问答,想法不新但执行够快,对普通用户吸引力大,只是答案来自群聊,可靠性是个坑。配套的 AI 照片编辑也让玩梗更方便,Meta 在拼命给 Facebook 塞 AI 留住用户。

6月12日周五
6月11日周四
  1. Midjourney:Updates(RSS)64

    Midjourney V8.1 已成为默认模型

    Midjourney 已将默认模型从 V7 升级为 V8.1。V8.1 在智能性、连贯性、对详细提示的遵循度以及文本渲染效果上均有提升,HD 模式也已支持。

    推荐理由:虽然V8.1不是大版本,但设为默认后所有用户自动升级,尤其是文本和复杂提示词的理解增强,做设计的朋友值得重新测试一下关键词。

6月10日周三
  1. HuggingFace Daily Papers(社区热门论文)73

    Flow-DPPO: 面向流匹配模型的散度近端策略优化

    针对流匹配模型中在线强化学习比率裁剪策略约束不当的问题,Flow-DPPO 提出用散度近端约束替代。关键洞察是流模型每步策略为高斯分布,可精确计算新旧策略间的 KL 散度。Flow-DPPO 采用非对称散度掩码,仅在梯度更新偏离信任区域且超阈值时阻止更新。实验表明,Flow-DPPO 获得更高奖励,KL 近端效率更优,缓解了灾难性遗忘,促进多目标均衡,并能在比率裁剪失效时支持稳定的多轮训练。代码已开源。

    推荐理由:用 KL 散度代替比值裁剪来解决流匹配 RL 训练的不稳定,理论简洁,代码已开源,做图像/视频生成优化的同学可以跑一下。

  2. Fei-Fei Li78

    创意和想象力无与伦比!非常感谢@theworldlabs能与@withloreco的优秀人才合作,将他们不可思议的想法转化为用户可以享受的互动体验!🤩

    引用World Labs@theworldlabs

    我们将梦想化为世界。 然后用历史上最伟大的头脑填满它们。 不是视频。而是一个世界,直接在你的浏览器中运行。走进来 ↓

    推荐理由:World Labs把生成式空间智能做成了可走进的浏览器世界,不是看视频而是和历史伟人互动,技术想象力和产品落地都够惊艳,做虚拟世界和交互叙事的人值得直接点进去体验。

6月9日周二
  1. HuggingFace Daily Papers(社区热门论文)82

    i1:面向强文生图模型的简单且完全开源配方

    i1 是一个 3B 参数的文本到图像扩散模型,仅使用公开数据集训练。在 GenEval、DPG、PRISM、CVTG-2K 和 LongText 五个基准上,i1 性能与领先模型相当,平均比最佳现有完全开源模型高 29.5 个百分点。研究基于 300 余项控制实验(超 700K TPU v6e 小时),发现等权重混合 curated 数据集是强默认配置、更大文本编码器适配器以极少参数提升性能。i1 的检查点、训练与推理代码及数据处理流程已全部开源。

    推荐理由:i1 是第一个用全公开数据、完全开源代码/权重/数据管线打造的 3B 模型,直接把全开放模型的性能拉到可与闭源竞争,对做文生图研究的同行是个扎实起点。