跳到正文
北京时间

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

143条精选相关主题AI 视频多模态产品更新

最新精选

第 21–40 条 · 共 143 条
8月9日周日
8月7日周五
  1. 公众号:火山引擎81

    Seedance 2.5 API上线,视频生成开启「电影级长叙事」

    火山引擎正式上线 Seedance 2.5 API,将单次视频生成时长从15秒提升至30秒,并支持最高50个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。

    推荐理由:原生30秒时长和秒级时间戳控制,把长叙事视频从靠抽卡变为导演级调度;角色与光影的稳定提升让广告、影视等商业场景更接近实际生产标准。

8月5日周三
  1. Qwen68

    阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

    引用Qwen Cloud@qwen_cloud

    🔔 Qwen-Image-3.0 现已在 Qwen Cloud 上线! 在 Arena. ai 的文生图竞技场 @arena 中,位列中国模型第 1 名、主流模型第 2 名,现在只需一次 API 调用即可使用。 - 支持高达 4.5k token 的提示词:一次生成报纸、故事板、菜单、试卷 - 文字清晰度低至 10px,细节近乎照片级 - 支持 12 种语言、100+ 种艺术风格,逼真的 UI 模拟 - 生成 + 编辑集于一个模型 💰价格: Qwen-Image-3.0 Pro — 最适合复杂布局、精准文字渲染和商业级视觉,每张图起价 $0.04。 Qwen-Image-3.0 Standard — 适合批量、日常图像生成,每张图起价仅 $0.03。 Qwen-Image-3.0-Pro 与 Standard。从提示词到可直接投产的图像。 👉 在 Qwen Cloud 上试用并获取你的 API key:https://www.qwencloud.com/models/qwen-image-3.0-pro?utm_content=g_20000001188 - 主流模型 = 日均 MaaS API 调用量超过 10 万的模型系列 #QwenCloud #Qwen

    推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。

  2. HuggingFace Daily Papers(社区热门论文)76

    Any-OPD:面向流匹配模型的异构同策略蒸馏框架

    Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

    推荐理由:将异构流匹配蒸馏转化为在独立视觉空间求解固定点,配合噪声级对齐跨过VAE与架构差异,2.5B学生模型在偏好指标上逼近12B教师。

  3. SenseTime67

    商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。

    推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。

8月2日周日
  1. 公众号:卡尔的AI沃茨72

    实测MiniMax H3做后期和动效:视频届的审美王来了

    MiniMax H3视频模型实测覆盖广告TVC、短剧、创意片头、动态海报、UI动效和游戏实机六类场景,可生成5-15秒视频、原生双声道、直出2K,一次最多放9张图、3段视频和3段音频,提示语最高支持7000字符。

    推荐理由:多个场景测试显示 H3 在动态文字稳定性和动效克制上表现突出,提供的提示语结构可直接用于 UI、游戏宣传片等需要文字控制的视频生成。

7月31日周五
  1. Google AI69

    Google Earth 网页版上线基于 Nano Banana 2 的图像生成功能,用户可通过文本提示词将卫星与 3D 影像结合,重新想象全球任意地点(如百年前的城市风貌或社区新球场)。该功能现已面向所有用户开放。

    推荐理由:Google 把图像生成塞进地球,直接用 Nano Banana 2 在卫星图上创作,门槛低得谁都能玩,做城市设计或创意提案的人可以立刻试试。

7月25日周六
  1. Midjourney:Updates(RSS)73

    Midjourney V8.2 发布:专注美学提升与个性化理解

    Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。

    推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。

7月23日周四
  1. Black Forest Labs:Blog(网页)59

    FLUX 3 发布:Black Forest Labs 多模态模型,支持原生音频、图像生成与动作预测

    Black Forest Labs 发布多模态模型 FLUX 3,面向视频领域,原生支持音频、图像生成与动作预测。该模型旨在成为视觉智能的骨干,目前官方已展示其能力与早期结果。

    推荐理由:Black Forest Labs 把图像、视频、音频拉通到一个模型里,这比单纯提升画质更有想象力,但目前只有一句简介,像个预告片,想真评估的还得等技术细节。

7月22日周三
  1. 公众号:卡尔的AI沃茨71

    实测Qwen-Image-3.0:19大场景挑战GPT Image2,中文长文本与多图融合表现亮眼

    Qwen-Image-3.0上线,支持最高4.5k token输入、12种语言、20多种字体,以及多图融合、图中图和图片编辑。实测显示,其在中文长文本生成、多语言混合排版、UI设计、多图融合与图片编辑等19个场景中均能稳定输出,文字不崩且信息对应准确,图片质量已能与GPT Image2媲美。该模型在国内可直接使用,速度快且价格不贵。

    推荐理由:Qwen-Image-3.0 的实测效果在中文文字稳定性和多图融合上可以和 GPT Image2 掰手腕,看完这些案例,你会意识到国产图像模型已经能务实替代一部分工作流了。

7月21日周二
  1. Qwen:Blog Retrieval(API)77

    通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为“实”

    通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。

    推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。

7月14日周二
  1. HuggingFace Daily Papers(社区热门论文)74

    Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元

    Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。

    推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

7月11日周六
  1. The Verge:AI(RSS)76

    Meta 关闭 Instagram 用户可基于公开账户生成 AI 深度伪造图片的功能

    在遭到强烈反对后,Meta 关闭了本周早些时候推出的一项 Instagram 功能。该功能允许用户通过 @ 提及公开 Instagram 账户,基于其内容生成 AI 图片,且无需账户所有者许可。Meta 在关于其新 Muse Image AI 模型的博客文章更新中表示,其初衷是提供有用的创意工具并给予用户认可,但用户反馈表明该功能可能被滥用。

    推荐理由:Meta 在舆论压力下火速撤回刚发布的 AI 深度伪造功能,这次公关折返跑比功能本身更有信息量,平台对隐私反弹的优先级已经高于技术落地,但默认 opt-out 的根本矛盾还在。

7月10日周五
  1. Elon Musk68

    Elon Musk 转发用户 @0x0funky 对 Grok Build 的称赞。该用户称 Grok Build 是目前唯一集大成的 coding agentic workflow,内建图像生成和图片生视频功能,生图速度快且品质不输 Codex。Agent 可直接完成图像与视频生成,无需额外串接 MCP 或外部服务。用户结合 Agent Sprite Forge 工具,利用 Grok Build 的视频生成能力,先产出 6 秒角色动作视频再反编译为 game sprite,大幅减少对齐问题,制作 2D 横版游戏耗时不到 30 分钟,而此前用 Codex 需 1-2 小时且品质更优。

    引用0xFunky@0x0funky

    Grok Build is crazy. 先不管GPT-5.6是不是release到底好不好用。 先來大大稱讚一下 @grok 的 Grok Build,目前唯一集大成的 coding agentic workflow。 Grok Build 內建 Image 生圖,甚至還有圖片生影片的功能,生圖速度真的快到不行,圖片品質也完全不比 Codex 差。 更厲害的是,因為 Grok Build 本身就內建生圖和生影片能力,agent 可以直接完成圖像與影片生成,不需要再額外串其他 MCP 或外部服務,只要訂閱 Grok,就可以把這整套 creative coding workflow 跑起來。 我在 Agent Sprite Forge 上面也新增了Grok專用的 video2dsprite,因為 Grok Build 內建影片生成,現在可以先生成一段連續的 6 秒角色動作影片,再反編譯成 game sprite,這樣做出來的角色元素圖會非常順,而且大幅減少之前常見的對齊問題。 Grok Build搭配 Agent Sprite Forge 真的超好用,我做完這個2D橫向卷軸遊戲總共花了不到30分鐘... 之前叫Codex做,光生圖就要花不少時間,要做成這樣的遊戲大概需要1~2小時,重點是Grok的品質還比Codex做的還要更好... @elonmusk Grok Build is crazy. Grok Build + Agent Sprite Forge feels like the future of agentic game development.

    推荐理由:这个 Grok Build 加 Agent Sprite Forge 的工作流把做 2D 游戏的时间压到了 30 分钟,之前要 1-2 小时,而且品质更好,独立游戏开发者可以直接抄作业。

7月9日周四
7月8日周三
  1. 字节 Seed:Research Feed(网页内嵌数据)68

    字节跳动发布 Seedream 5.0 Pro,强化复杂信息可视化与精准编辑能力

    字节跳动正式发布多模态图像创作模型 Seedream 5.0 Pro。该版本在图文匹配、结构合理性及文字渲染上全面提升,核心突破包括:支持高密度数据与概念的专业排版可视化;基于空间位置理解的交互式精准编辑(如点选、图层分离、多图融合);还原真实光影与人像质感;以及原生支持十余种语言的输入与本地化特征生成。目前已在火山方舟、豆包及即梦上线体验。

    推荐理由:展示了 AI 图像生成从“好看”向“可用”的进阶,特别是其解决复杂信息图表生成和像素级局部编辑的能力,对专业设计工作流有显著价值。

  2. Krea66

    Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥

    引用Brie Wensleydale🧀🐭@SlipperyGem

    这正是我渴望的那种 ID 保留类功能。 我明天要出行,所以没法测试它。我很好奇它在风格化角色上的效果如何…… https://huggingface.co/conradlocke/krea2-identity-edit https://github.com/lbouaraba/comfyui-krea2edit

    推荐理由:Krea 2的ID保持终于被社区做出来了,附带ComfyUI节点,想稳定控制角色一致性的人可以立刻用起来。

  3. AI at Meta75

    Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现高视觉保真度并原生支持音频。

    推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。

7月6日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)70

    三周前,我不小心创办了一家小公司

    一位父亲为患有自闭症的非语言儿子开发了一款沟通应用,在言语治疗室的等候区展示时,所有非语言儿童的母亲看到后都忍不住流泪,言语治疗师也啜泣了五分钟。他意外发现产品市场匹配,决定腾出时间让更多孩子能用上,即使这意味着几周睡眠不足。应用本身是专为理解语言困难的儿童设计的,与传统的AAC设备不同——后者主要面向身体障碍但语言理解正常的成人。

    推荐理由:这篇文章读来会让人看天花板,一位父亲用 AI 图像和声音克隆为儿子创造了沟通工具,意外找到了产品市场契合。它比任何融资新闻都更让我相信,AI 的真正价值在于解决那些被忽视的具体问题。

7月3日周五
  1. 公众号:京东JoyAI65

    JoyAI App上线UGC数字人功能,一张照片即可“捏”出专属虚拟玩伴

    JoyAI App正式上线UGC数字人功能,用户上传一张照片即可生成高度还原的写实数字分身,或搭配模板重塑为卡通形象,并支持复刻音色。该功能复用“万能博士”技术底座,实现全双工对话能力,可随时打断、自然接话,同时提供点外卖、金融咨询等生活服务。

    推荐理由:照片生成数字人并不新鲜,但把全双工对话和京东生活服务(点外卖、金融咨询)集成进一个虚拟玩伴,让陪伴型智能体有了更直接的服务抓手。