上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型
上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。
推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。
推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。
Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。
推荐理由:官方完整披露了模型机制、用户研究和局限,读者可以据此理解去除中间表示后界面生成与智能体训练的路径。
DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。
推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。
智谱宣布开源 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,并与 Kimi K3 并列开源模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查。
推荐理由:许可条款把强制安全审查限定在百亿美元级外部模型服务,自有部署和中小团队实际不受影响,开源可用性比表面限制更宽。
推荐理由:开放权重让需要私有化部署的编码智能体与安全防御场景可以直接下载、运行和定制模型,不再受闭源 API 限制。
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并在腾讯云 TokenHub 和 OpenRouter 上线。
推荐理由:官方盲测中它与 GLM-5.3、Kimi K3 的分差不足 0.1,选型时 1M 上下文和开源部署成本可能比榜单排名更实际。
Midjourney 开始向所有用户开放其首个 V8.2 图像编辑模型的测试。该模型支持指令编辑、以图生图(最多同时引用 4 张参考图)、局部重绘与扩画,并兼容个性化、moodboards 和 srefs 功能。用户可通过网页端或 Discord 的 `--edit` 命令使用,官方同步更新了 midjourney.com 与 alpha.midjourney.com 的界面。
推荐理由:这一版把图像引用数量从单参考提升到最多四张,做多素材融合时不必先拼接成单图再喂给模型,能减少中间步骤。
Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。
推荐理由:360p 预览的成本降到 720p 的三分之一并提速最多 60%,让视频生成的前期探索可以低成本多版本比较,改变的是创意工具迭代的节奏。
Ox Alpha = GLM-5.3 Flash AA = 57,以1/100的前沿价格, 由纯国产芯片驱动。在OpenRouter上实现了近20%的周token份额(第一)。 感谢大家的支持。
推荐理由:OpenRouter 周 token 份额近两成说明开发者已在用真实调用投票,低价模型正从价格敏感场景切入,团队评估模型成本时会更多参考实际使用量而非榜单单项分。
Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。
推荐理由:相较于上一代 Chirp 3,流式词错率降到 4.0% 且最终转录延迟改善 70%,会影响语音代理和实时字幕方案的成本与体验取舍。
⚡️认识一下 Qwen3.8-Flash,一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,现已开放权重! 生产版本的 Qwen3.8-Flash 即将通过 QwenCloud API 提供,价格仅为每 100 万输入 token 0.16 美元,每 100 万输出 token 0.47 美元。 125B 参数 + 51B N-gram 嵌入,每个 token 仅激活 6B 参数。性价比无与伦比。 新特性:🥳 - 下一代架构:GDN + QSA 混合注意力、门控残差、N-gram 嵌入和 Muon 优化器,作为 Qwen4 所用架构的前身。 - 训练和推理成本大幅降低:训练成本仅为 Qwen3.7-Plus 的 1/9,同时在各方面表现均优于后者,在编程和办公任务上尤其突出。 - 性能强劲:在 DeepSWE 1.1 上得分 58.7,在 SWE-bench Pro 上得分 62.5,在 CoWorkBench 上得分 73.9,在 AndroidWorld 上得分 84.5,在 MathVision(带 CI)上得分 95.7。 - 原生 262K 上下文,可通过 YaRN 扩展至 1M。 我们还发布了 Qwen3.8-Flash-Next 的权重,让社区提前一睹我们为 Qwen4 探索的新架构。🚀 我们迫不及待想看看你用 Qwen3.8-Flash 构建出什么!👀👇 - 博客:https://qwen.ai/blog?id=qwen3.8-flash-next - 技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf - Hugging Face:https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next - ModelScope:https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next
推荐理由:原文给出了本地运行所需的内存档位与量化精度权衡,读者可据此判断自己的设备能否跑动这个 MoE 模型。
⚡️认识一下 Qwen3.8-Flash,一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,现已开放权重! 生产版本的 Qwen3.8-Flash 即将通过 QwenCloud API 提供,价格仅为每 100 万输入 token 0.16 美元,每 100 万输出 token 0.47 美元。 125B 参数 + 51B N-gram 嵌入,每个 token 仅激活 6B 参数。性价比无与伦比。 新特性:🥳 - 下一代架构:GDN + QSA 混合注意力、门控残差、N-gram 嵌入和 Muon 优化器,作为 Qwen4 所用架构的前身。 - 训练和推理成本大幅降低:训练成本仅为 Qwen3.7-Plus 的 1/9,同时在各方面表现均优于后者,在编程和办公任务上尤其突出。 - 性能强劲:在 DeepSWE 1.1 上得分 58.7,在 SWE-bench Pro 上得分 62.5,在 CoWorkBench 上得分 73.9,在 AndroidWorld 上得分 84.5,在 MathVision(带 CI)上得分 95.7。 - 原生 262K 上下文,可通过 YaRN 扩展至 1M。 我们还发布了 Qwen3.8-Flash-Next 的权重,让社区提前一睹我们为 Qwen4 探索的新架构。🚀 我们迫不及待想看看你用 Qwen3.8-Flash 构建出什么!👀👇 - 博客:https://qwen.ai/blog?id=qwen3.8-flash-next - 技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf - Hugging Face:https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next - ModelScope:https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next
推荐理由:训练成本降到前代的九分之一,同时编码和办公任务基准分数更高,对成本敏感的 API 调用场景提供了一个新的权衡参考点。
通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。
推荐理由:这次提前开放 Qwen4 架构权重,关键在于 QSA 稀疏注意力与 N-gram 查表参数同时降低长上下文成本、扩大容量,为评估下一代模型提供早期样本。
腾讯混元将端侧翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 量化方案压缩至 574MB 和 440MB,翻译质量几乎无损,在 FLORES-200 上优于 Microsoft Translator 等商业 API。该模型已联合英特尔完成 x86 适配,并在哔哩哔哩直播弹幕实时翻译中落地,单条弹幕翻译耗时 500~800ms。
推荐理由:相比精度数字,这套量化给出 x86 优化和直播弹幕实测数据,让端侧替代云翻译 API 的成本与隐私权衡有了可对照的工程基线。
推荐理由:把路径、强度和尺度放进同一模型,省去过去切换全球与区域模型的步骤,对需要快速判断登陆风险的预报流程是种简化。
阿里巴巴发布 Qwen3.8-Flash-Next 模型权重,作为即将到来的 Qwen4 架构预览。
推荐理由:原文给出 GDN 与 QSA 混合架构的设计细节和长上下文吞吐数据,可帮助读者评估该模型在智能体编码场景的部署价值。
GPT-5.6 模型家族现已登陆软件开发智能体 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在 Kiro 内完成任务成本降低约 82%。该更新由 OpenAI 与 AWS 合作优化,旨在以更少迭代和更高 token 价值帮助开发者产出更高质量的代码。
推荐理由:在 Terminal-Bench 2.1 上,GPT‑5.6 Terra 在 Kiro 中完成任务的成本约下降 82%,为长周期编码任务的投入产出评估提供了一个量化基准。
FireRedTeam 发布 FireRedAudio 的代码与模型,一个基于 9B 参数 LLM 的通用音频语言模型,采用理解与生成解耦的连续表征设计。单模型支持 ASR、音频理解、零样本 TTS、指令 TTS、语义与声学语音编辑,以及最长一小时录音的时序定位理解,在 MMAU、Seed-TTS-Eval 等基准上取得竞争性或领先结果。
推荐理由:官方发布了代码和权重,读者可以据此了解用一个 9B 骨干同时覆盖语音理解与生成的解耦表征设计。


推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。
DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,可通过设置 model='deepseek-v4-flash-vision-exp' 在 API 平台访问。
推荐理由:实验版在纯文本能力与正式版持平的基础上补齐视觉,多模态 Agent 基准接近 Opus-4.8,让依赖视觉的 DeepSeek 工作流无需切换后端即可评估更强感知能力。