Seedance 2.5 API 上线 Draft 模式,480P 试错后 1080P 一次成片
火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,先用 480P 快速生成样片验证创意,选中后再通过样片 ID 生成 1080P 成片,复用提示词、参考素材、seed、ratio、duration 等参数保证一致性。
推荐理由:官方给出了具体的成本节约数字和两阶段工作流说明,创作者可以据此判断是否把 Draft 模式接入自己的视频生成管线。
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,先用 480P 快速生成样片验证创意,选中后再通过样片 ID 生成 1080P 成片,复用提示词、参考素材、seed、ratio、duration 等参数保证一致性。
推荐理由:官方给出了具体的成本节约数字和两阶段工作流说明,创作者可以据此判断是否把 Draft 模式接入自己的视频生成管线。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
由 @Alibaba_Qwen 推出的 Qwen-Image-2.1 刚刚登顶图像编辑竞技场和文生图竞技场的开源模型第一名! Qwen-Image-2.1 在图像编辑竞技场中以 1367 分拿下了开源模型中的第一名。它在总榜上位列第 16,距离排名第 15 的 GPT-Image-1.5-high-fidelity 仅差 3 分。 请看下方文生图竞技场的排行榜。 祝贺 @Alibaba_Qwen 团队为开源生态做出的这一贡献!
推荐理由:原文给出 Arena 两个榜单的开源第一排名和具体分数,读者可以据此比较开源图像模型的当前水平。
腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。
推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。
Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。
推荐理由:官方详解了 7B 统一图像模型的透明图像生成、10 图参考编辑与推理优化,读者可据此评估在设计等场景的可用性。
OpenRouter 对其路由的 20 个图像生成模型用相同提示词实测计费,单张图片成本在 $0.006 到 $0.134 之间,相差 22 倍。
推荐理由:OpenRouter 用同一提示词实测 20 个图像生成模型的真实计费,读者可以借此绕开各不相同的计价单位直接比较成本。
Google 发布图像生成工具 Google Pics,基于 Nano Banana 构建,现已上线 pics.new。支持局部对象编辑、图内文字修改与翻译、多人协作创作和单提示词生成多个选项。
推荐理由:原文列出了 Pics 的四项具体编辑与协作能力及可用范围,读者可据此判断是否值得一试。
Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。
推荐理由:原文展示用 Gradio Workflow 重建 AUTOMATIC1111 主要功能的具体做法,并给出 REST 与 MCP 入口,读者可评估它与 ComfyUI 的取舍。
話題の「GPT-6 Astra × Blender」、実際に触ってみました。 これ、かなり衝撃です。 Blender初心者でもできる。ほぼ視点移動(ビュー)の操作だけでここまで作れました。 モデルはTripo製、ステージはBlender上で作ってます。 GPT-5.6 Solでは何度指示してもうまくいかなかった作業が、Astraでは普通に通るようになっててヤバい…! 今回は ・GPT-6 Astra ・Blender MCP ・Tripo スマートメッシュ P2.0 を組み合わせて、AI中心で制作しています。 ※モーションのみお借りしています Blender側で自分がやるのは、ほぼビュー操作。 基本的には、 「気になる箇所をビューで見せる」 ↓ 「AIに修正を指示」 ↓ 「結果を確認」 ↓ 「また修正」 これの繰り返しです。 もちろん、すべてが一発でうまくいくわけではありません。 意図通りになるまで何度も指示する必要があるので、根気よく詰めていく熱量は必要だと感じました。 それでも、 「Blenderをほぼ触れない人でも、AIと対話しながら3Dモデルを仕上げていける」 ところまで来たのは、かなり大きいと思います。 ざっくり制作手順👇 1. Images 2.5でキャラの全身リファレンスを生成 2. 髪・頭部・体(Tポーズ)に分けて画像を生成 3. 各パーツの右側面・左側面・背面図を生成 4. Tripo スマートメッシュ P2.0で3パーツを3D化 設定:四角形 / 25,000 5. Blender MCPでAstraに3パーツを渡して合体 6. 自然なシルエットになるようサイズ調整 7. メッシュの欠損・隙間・貫通を補修 8. リグ・ウェイト設定 9. まばたき・口パクをシェイプキーで作成 10. 髪や衣装などの揺れものを設定 11. モーションを適用して、足の接地・衣装貫通・揺れを調整 12. テクスチャを修正(どのタイミングでもいい) 使うツールはざっくり、 1〜3 → Images 2.5 4 → Tripo 5〜12 → Astra × Blender × Images 2.5 という感じです。 そして今回、かなり有効だったのが、 「修正したい箇所をスクショ → その画像を元に理想形のリファレンス画像を生成 → Astraで修正」 という方法。 これが形状修正にもテクスチャ修正にもかなり効きました。 長文で細かく説明するより、 リファレンス画像を添付して 「ここをこれに寄せて」 くらいの指示の方が、意図が伝わりやすい場面も多いです。 ただ、テクスチャ修正は普通に沼です。ある程度で妥協した方が良さそう。細かく見ると、まだ粗いです。 3D制作のハードル、AIでかなり下がってきた感があります。 Blender初心者の方こそ、一度試してみてほしいです。
推荐理由:原文给出完整的 12 步 3D 角色制作工作流和截图生成参考图的修正方法,Blender 初学者可以照着复用。
OpenRouter 发布教程,演示通过 API 向 google/gemini-3.1-flash-image(即 Nano Banana 2)发送源图和文本指令完成图像编辑,编辑结果以 base64 形式在响应中返回。教程给出 Python 和 TypeScript 示例、提示词写法、多轮小步编辑方法,以及更换模型只需改一个字段,并介绍了 Nano Banana 系列四个成员的价格与质量差异。
推荐理由:原文给出完整可运行的图像编辑请求代码和提示词写法,读者可以照搬并把模型换成其他供应商做对比。
Runway 发布 Runway Plugins,面板可直接嵌入 Premiere Pro 和 After Effects,无需导出导入即可在时间线内生成图像和视频、重渲染片段并一键放置结果。
推荐理由:原文给出了插件的功能范围、付费条件与下载方式,剪辑工作流用户可据此评估是否把生成环节搬进时间线。
OpenAI 推出 API 新图像模型 GPT-Image-2.5 Flare 和 Sunburst,主要改进包括更锐利的细节、更强的风格遵循,以及更多对图像编辑的控制。
推荐理由:原文给出两款新图像模型在细节、风格遵循和编辑控制上的能力变化,读者可以据此判断 API 图像工作流的升级点。
推荐理由:官方列出了速度、保真度和多次编辑一致性等具体改进点,读者可据此评估是否更新自己的图像生成工作流。
OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。
推荐理由:官方原文给出与 Images 2.0 的具体对比数据、新功能入口和 API 双模型分工,读者可以据此评估是否迁移现有图像工作流。
Microsoft 于 9 月 4 日发布 MAI-Image-2.6,称其为迄今最强的图像模型,并面向开发者上线 Microsoft Foundry,同时推出面向低延迟、高吞吐场景的 MAI-Image-2.6-Flash。
推荐理由:原文给出排名、速度和效率数字,并说明两个版本分别面向精度与吞吐的不同场景,便于开发者按工作流选型。
Google 发布 Workspace 图像创作与编辑工具 Google Pics,将在未来数周内面向所有 Google AI Pro 和 Ultra 订阅者及多数 Workspace 商业客户推出。
推荐理由:官方发布详解 Pics 的编辑控制与 Workspace 集成节奏,读者可据此判断它如何嵌入现有文档和幻灯片工作流。
Midjourney 开始向所有用户开放其首个 V8.2 图像编辑模型的测试。该模型支持指令编辑、以图生图(最多同时引用 4 张参考图)、局部重绘与扩画,并兼容个性化、moodboards 和 srefs 功能。用户可通过网页端或 Discord 的 `--edit` 命令使用,官方同步更新了 midjourney.com 与 alpha.midjourney.com 的界面。
推荐理由:这一版把图像引用数量从单参考提升到最多四张,做多素材融合时不必先拼接成单图再喂给模型,能减少中间步骤。
蚂蚁集团 inclusionAI 开源 ConceptEdit,一个基于概念缩放与密集监督的图像编辑数据生成管线。该管线通过三阶段流程(VLM 生成指令、FLUX 执行编辑、VQA 评估筛选)构建大规模、基于分类法的图像编辑数据集,并提供单概念与多概念两种变体。项目采用 MIT 许可证,支持断点续跑,需 OpenAI 兼容 VLM 端点与本地 FLUX 检查点。
推荐理由:流水线把图像编辑数据生成拆为指令生成、FLUX 编辑、VLM 评判三步,多概念版本将多个并行编辑合并为一条指令并支持断点续跑,为构建带质检的编辑训练数据提供可复用框架。
Microsoft 发布 MAI-Image-2.6,在 Arena 文生图排行榜上位列第二,超过 Meta、Google 和 xAI 的模型。该模型相较 MAI-Image-2.5 整体提升 +79 Elo,文本渲染单项提升 +91 Elo,各测量类别均有改进;现已可在 Arena 体验,本周后续登陆 MAI Playground,并将逐步推广到 Microsoft Foundry 等产品。
推荐理由:官方给出 Arena 排名、Elo 提升幅度和上线入口,读者可据此对比各家用图像生成模型的表现。
Seedance 2.5 上线一周后,国内外社区涌现出时间静止、超级英雄变身、创意广告、K-pop MV、电商广告、拉片复刻等六类热门玩法。经实测,该版本人物面部告别“AI 油腻感”,动作自然度与镜头切换较 2.0 更合理,单次生成超长视频时长拉至 300 秒,并支持片段重拍与智能续写。通过 LibTV 年费会员,生成成本最低可至 0.4 元/秒。
推荐理由:把时间静止、口香糖广告等创意拆成可复用的镜头语言和提示词,直接降低同类效果的试错成本。