Grok Imagine 图像编辑功能重大升级 [引用 @XFreeze]:你可以直接悬停在 Grok Imagine 中的任意特定区域,并即时进行编辑
你完全可以直接将鼠标悬停在 Grok Imagine 中的任意特定片段上,并立即对其进行编辑
推荐理由:悬停选中并即时编辑把图层和遮罩等概念替换为手势,降低了图像修改的操作门槛。
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
Grok Imagine 图像编辑功能重大升级 [引用 @XFreeze]:你可以直接悬停在 Grok Imagine 中的任意特定区域,并即时进行编辑
你完全可以直接将鼠标悬停在 Grok Imagine 中的任意特定片段上,并立即对其进行编辑
推荐理由:悬停选中并即时编辑把图层和遮罩等概念替换为手势,降低了图像修改的操作门槛。
火山引擎正式上线 Seedance 2.5 API,将单次视频生成时长从15秒提升至30秒,并支持最高50个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。
推荐理由:原生30秒时长和秒级时间戳控制,把长叙事视频从靠抽卡变为导演级调度;角色与光影的稳定提升让广告、影视等商业场景更接近实际生产标准。
🔔 Qwen-Image-3.0 现已在 Qwen Cloud 上线! 在 Arena. ai 的文生图竞技场 @arena 中,位列中国模型第 1 名、主流模型第 2 名,现在只需一次 API 调用即可使用。 - 支持高达 4.5k token 的提示词:一次生成报纸、故事板、菜单、试卷 - 文字清晰度低至 10px,细节近乎照片级 - 支持 12 种语言、100+ 种艺术风格,逼真的 UI 模拟 - 生成 + 编辑集于一个模型 💰价格: Qwen-Image-3.0 Pro — 最适合复杂布局、精准文字渲染和商业级视觉,每张图起价 $0.04。 Qwen-Image-3.0 Standard — 适合批量、日常图像生成,每张图起价仅 $0.03。 Qwen-Image-3.0-Pro 与 Standard。从提示词到可直接投产的图像。 👉 在 Qwen Cloud 上试用并获取你的 API key:https://www.qwencloud.com/models/qwen-image-3.0-pro?utm_content=g_20000001188 - 主流模型 = 日均 MaaS API 调用量超过 10 万的模型系列 #QwenCloud #Qwen
推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。
Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。
推荐理由:将异构流匹配蒸馏转化为在独立视觉空间求解固定点,配合噪声级对齐跨过VAE与架构差异,2.5B学生模型在偏好指标上逼近12B教师。
推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。
MiniMax H3视频模型实测覆盖广告TVC、短剧、创意片头、动态海报、UI动效和游戏实机六类场景,可生成5-15秒视频、原生双声道、直出2K,一次最多放9张图、3段视频和3段音频,提示语最高支持7000字符。
推荐理由:多个场景测试显示 H3 在动态文字稳定性和动效克制上表现突出,提供的提示语结构可直接用于 UI、游戏宣传片等需要文字控制的视频生成。
推荐理由:Google 把图像生成塞进地球,直接用 Nano Banana 2 在卫星图上创作,门槛低得谁都能玩,做城市设计或创意提案的人可以立刻试试。
Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。
推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。
Black Forest Labs 发布多模态模型 FLUX 3,面向视频领域,原生支持音频、图像生成与动作预测。该模型旨在成为视觉智能的骨干,目前官方已展示其能力与早期结果。
推荐理由:Black Forest Labs 把图像、视频、音频拉通到一个模型里,这比单纯提升画质更有想象力,但目前只有一句简介,像个预告片,想真评估的还得等技术细节。
Qwen-Image-3.0上线,支持最高4.5k token输入、12种语言、20多种字体,以及多图融合、图中图和图片编辑。实测显示,其在中文长文本生成、多语言混合排版、UI设计、多图融合与图片编辑等19个场景中均能稳定输出,文字不崩且信息对应准确,图片质量已能与GPT Image2媲美。该模型在国内可直接使用,速度快且价格不贵。
推荐理由:Qwen-Image-3.0 的实测效果在中文文字稳定性和多图融合上可以和 GPT Image2 掰手腕,看完这些案例,你会意识到国产图像模型已经能务实替代一部分工作流了。
通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。
推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。
Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。
推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。
在遭到强烈反对后,Meta 关闭了本周早些时候推出的一项 Instagram 功能。该功能允许用户通过 @ 提及公开 Instagram 账户,基于其内容生成 AI 图片,且无需账户所有者许可。Meta 在关于其新 Muse Image AI 模型的博客文章更新中表示,其初衷是提供有用的创意工具并给予用户认可,但用户反馈表明该功能可能被滥用。
推荐理由:Meta 在舆论压力下火速撤回刚发布的 AI 深度伪造功能,这次公关折返跑比功能本身更有信息量,平台对隐私反弹的优先级已经高于技术落地,但默认 opt-out 的根本矛盾还在。
Grok Build is crazy. 先不管GPT-5.6是不是release到底好不好用。 先來大大稱讚一下 @grok 的 Grok Build,目前唯一集大成的 coding agentic workflow。 Grok Build 內建 Image 生圖,甚至還有圖片生影片的功能,生圖速度真的快到不行,圖片品質也完全不比 Codex 差。 更厲害的是,因為 Grok Build 本身就內建生圖和生影片能力,agent 可以直接完成圖像與影片生成,不需要再額外串其他 MCP 或外部服務,只要訂閱 Grok,就可以把這整套 creative coding workflow 跑起來。 我在 Agent Sprite Forge 上面也新增了Grok專用的 video2dsprite,因為 Grok Build 內建影片生成,現在可以先生成一段連續的 6 秒角色動作影片,再反編譯成 game sprite,這樣做出來的角色元素圖會非常順,而且大幅減少之前常見的對齊問題。 Grok Build搭配 Agent Sprite Forge 真的超好用,我做完這個2D橫向卷軸遊戲總共花了不到30分鐘... 之前叫Codex做,光生圖就要花不少時間,要做成這樣的遊戲大概需要1~2小時,重點是Grok的品質還比Codex做的還要更好... @elonmusk Grok Build is crazy. Grok Build + Agent Sprite Forge feels like the future of agentic game development.
推荐理由:这个 Grok Build 加 Agent Sprite Forge 的工作流把做 2D 游戏的时间压到了 30 分钟,之前要 1-2 小时,而且品质更好,独立游戏开发者可以直接抄作业。
Seedream 5.0 Pro 现已登陆 Runway。可通过提示词或参考图生成高细节图像,图像内文字清晰可读,支持多达14种语言。立即点击下方链接尝试。
推荐理由:Seedream 5.0 Pro 的集成让 Runway 的图像生成多了一个强力选择,14 种语言的可读文字生成是实用亮点,做多语言海报的设计师可以试试。
字节跳动正式发布多模态图像创作模型 Seedream 5.0 Pro。该版本在图文匹配、结构合理性及文字渲染上全面提升,核心突破包括:支持高密度数据与概念的专业排版可视化;基于空间位置理解的交互式精准编辑(如点选、图层分离、多图融合);还原真实光影与人像质感;以及原生支持十余种语言的输入与本地化特征生成。目前已在火山方舟、豆包及即梦上线体验。
推荐理由:展示了 AI 图像生成从“好看”向“可用”的进阶,特别是其解决复杂信息图表生成和像素级局部编辑的能力,对专业设计工作流有显著价值。
Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥
这正是我渴望的那种 ID 保留类功能。 我明天要出行,所以没法测试它。我很好奇它在风格化角色上的效果如何…… https://huggingface.co/conradlocke/krea2-identity-edit https://github.com/lbouaraba/comfyui-krea2edit
推荐理由:Krea 2的ID保持终于被社区做出来了,附带ComfyUI节点,想稳定控制角色一致性的人可以立刻用起来。
推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。
一位父亲为患有自闭症的非语言儿子开发了一款沟通应用,在言语治疗室的等候区展示时,所有非语言儿童的母亲看到后都忍不住流泪,言语治疗师也啜泣了五分钟。他意外发现产品市场匹配,决定腾出时间让更多孩子能用上,即使这意味着几周睡眠不足。应用本身是专为理解语言困难的儿童设计的,与传统的AAC设备不同——后者主要面向身体障碍但语言理解正常的成人。
推荐理由:这篇文章读来会让人看天花板,一位父亲用 AI 图像和声音克隆为儿子创造了沟通工具,意外找到了产品市场契合。它比任何融资新闻都更让我相信,AI 的真正价值在于解决那些被忽视的具体问题。
JoyAI App正式上线UGC数字人功能,用户上传一张照片即可生成高度还原的写实数字分身,或搭配模板重塑为卡通形象,并支持复刻音色。该功能复用“万能博士”技术底座,实现全双工对话能力,可随时打断、自然接话,同时提供点外卖、金融咨询等生活服务。
推荐理由:照片生成数字人并不新鲜,但把全双工对话和京东生活服务(点外卖、金融咨询)集成进一个虚拟玩伴,让陪伴型智能体有了更直接的服务抓手。