跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 341–360 条 · 共 710 条
6月8日周一
  1. IT之家(RSS)73

    全球首个:高德发布3D原生城市世界模型ABot-Earth0.5

    阿里巴巴旗下高德发布全球首个3D原生城市世界模型ABot-Earth0.5,已建成覆盖190多个国家和地区的3D地图。用户输入卫星图或文字描述,10分钟即可在消费级GPU上生成公里级3D城市,输出可编辑3DGS格式,可直接导入Unity等引擎。制图成本为传统百分之一,效率提升约千倍,可为具身智能、低空经济、应急救援等提供支撑。目前已开放内测,可前往abot-earth.amap.com提交申请。

    推荐理由:第一个把分钟级 3D 城市重建拉进消费级 GPU 的世界模型,成本打到了传统方案的百分之一,对具身智能和低空经济是底层能力补全,值得内测试试。

6月7日周日
  1. MarkTechPost(RSS)73

    Harness-1:基于强化学习训练的有状态搜索20B检索子智能体

    UIUC与Chroma联合推出Harness-1,一个20B参数的检索子智能体。它通过强化学习在一个有状态搜索框架中训练,该框架维护候选池、重要性标注集、证据图和验证记录,由策略决定搜索、筛选、验证及停止的时机。Harness-1在8个基准测试上达到0.730平均curated recall,比下一个最佳开源子智能体高出11.4个百分点,仅落后于Opus-4.6。模型权重和框架代码均已公开。

    推荐理由:UIUC和Chroma放出的这个20B检索子代理,用RL训练出了0.73的平均召回,把开源竞品甩开11.4分,只比Opus-4.6低一点。权重、Harness全开源,搞RAG的可以真刀真枪试试了。

6月6日周六
  1. Google AI Developers72

    谷歌发布 Gemma 4 量化感知训练 (QAT) 检查点,支持在消费级 GPU 和移动设备上本地运行,质量损失极小。新检查点提供 GGUF(Q4_0)格式,覆盖所有尺寸及起草模型,实现最佳本地性能。自定义移动模式采用混合精度方案,将 Gemma 4 压缩至 1GB 以下,包含 2-bit 解码层、优化 KV 缓存和静态激活。通过在训练中模拟压缩(而非训练后量化),大幅降低内存占用并加速解码,同时保持推理质量。

    推荐理由:Gemma 4 的量化版把模型压到 1GB 以下,手机本地跑大模型的门槛又低了一大截。Google 这次没用传统的训练后量化,而是把压缩直接嵌进训练里,效果比 PTQ 好一截,搞端侧部署的可以拿 checkpoint 试起来了。

6月5日周五
  1. Elon Musk67

    更新后的 Grok-build 模型(仍是 0.5T 那个)比以前好很多。它不那么偷懒、更自主、更准确。我们仍在改进长时任务。请期待并在我们漂亮的 TUI 中使用新的使用限制!🚀

    引用Bill Yuchen Lin@billyuchenlin

    更新后的 Grok-build 模型(仍然是 0.5T 那个)比以前好多了。它没那么懒了,更自主,也更准确。我们还在继续改进它在长周期任务上的表现。敬请期待,并在我们漂亮的 TUI 中享受它吧,还有新的使用限制!🚀

    推荐理由:马斯克亲口确认Grok模型更新,虽然还是0.5T参数,但改进后更自主、更准确,做长期任务的开发者可以看看。

  2. 公众号:京东JoyAI72

    京东开源JoyAI-Echo长音视频生成框架

    6月3日,京东开源JoyAI-Echo框架,解决长视频生成中角色身份崩坏、音色突变和生成缓慢三大难题。该框架通过跨模态音视频记忆库保持5分钟内角色外观与音色一致,记忆驱动后训练结合DMD技术带来约7.5倍推理加速。新增Director Agent支持自然语言对话式局部修订,无需重跑整条视频。配套轻量化实时超分模块,支持736×1280→1152×1920及1472×2560两档分辨率。评测集显示,语音内容准确率0.8646,用户偏好多项领先。代码与权重已开源至GitHub。

    推荐理由:长视频生成一直被角色崩塌和龟速生成卡死,JoyAI-Echo 开源给出了角色一致性方案和 7.5 倍加速,Director Agent 对话式编辑的思路很先进,做 AI 视频的朋友可以直接去 GitHub 开跑。

  3. Hugging Face:Blog(RSS)78

    Nemotron 3.5 Content Safety:面向全球企业AI的可定制多模态安全

    Nemotron 3.5 Content Safety基于Gemma 3 4B IT,提供128K上下文窗口,支持用户提示、可选图像与助手响应的统一多模态安全评估。新增自定义策略执行,允许企业用自然语言定义专属安全规则;THINK模式可输出可审计的逐步推理痕迹。显式训练覆盖12种语言,并借助基座模型零样本泛化至约140种语言。输出提供低延迟二分类、带分类标签、THINK推理痕迹三种模式。安全分类遵循Aegis 2.0框架(13核心类别+10细分类别)。同步发布多模态、多语言安全数据集,可在8GB+ VRAM GPU上实时部署。

    推荐理由:Nemotron 3.5 把内容安全从「单模态英文」拉到「多语言多模态可定制」,自定义策略和推理 trace 让企业能审计决策,做安全平台的值得细看。

  4. Google AI Developers70

    Google AI for Developers 宣布推出开放权重的实时音乐模型 Magenta RealTime 2 (MRT2)。该模型可通过 MIDI 键盘、实时文本提示甚至手势进行演奏。MRT2 在 MacBook 上原生运行,延迟低于 200ms,提供开放权重、开源推理引擎以及配套应用和插件套件。

    引用Google Magenta Project@GoogleMagenta

    介绍 Magenta RealTime 2 (MRT2):你可以像演奏乐器一样演奏的实时音乐模型。 MRT2 提供 MIDI 和提示控制,并可在 MacBook 上原生运行,延迟低于 200ms。 开放权重。开源推理引擎。一整套应用和插件。 在下方听听它能做什么,并亲自试一试 🧵

    推荐理由:Magenta RealTime 2 把音乐生成从「后期制作」拉到了「实时演奏」,开放权重且延迟低于 200ms,音乐创作者值得立刻上手试试。

6月4日周四
  1. SiliconFlow72

    neolab 推出 Nex-N2-Pro,基于 Qwen3.5-397B-A17B,总参数 397B 的 MoE 推理模型,支持 262K 上下文与多模态(VLM),性能达到 GPT-5.5 和 Claude Opus 4.7 级别。模型可自动调节推理深度,减少 30-50% 思考 token 且无性能折损,在 Terminal Bench 2.1、GDPVal、SWE-Verified 上取得 SOTA。擅长智能体编码、深度搜索和工具使用,兼容 Claude Code、Cursor 等工具。硅基流动已提供 T+0 支持,前两周免费使用。

    推荐理由:后训练模型能直追 GPT-5.5 和 Claude 4.7,免费两周,对做 agent 和 deep search 的人来说是难得的低成本试错机会。

  2. SenseTime69

    商汤 SenseTime 推出 SenseNova U1 开源多模态模型,实现原生理解与生成文本和图像,可一键将提示词转化为专业信息图。该模型被开发者 @gurru_tech 评价为“非常令人印象深刻”。项目已开源,提供 SenseNova Studio 在线试用,并公开 HuggingFace 模型集合、GitHub 源码仓库及 Discord 社区入口。

    推荐理由:商汤这回把图文统一模型开源了,SenseNova U1的infographic功能比市面上大多数文生图工具更懂文字和布局,做内容的朋友可以上手试试。

  3. StepFun77

    阶跃星辰的 Step 3.7 Flash 已上架 Fireworks AI。该模型为 198B 稀疏 MoE 多模态大模型(VLM),含 196B 语言骨干和 1.8B 视觉编码器,从设计之初优化推理效率,采用硬件友好架构与 MTP 辅助解码,速度达 400 tokens/s。具备原生多模态理解与行动、可靠工具使用、增强搜索能力,面向真实智能体工作负载,采用 Apache 2.0 开源许可。

    引用Fireworks AI@FireworksAI_HQ

    许多研究实验室只在事后才考虑推理效率。Step 3.7 Flash 是一个 198B 稀疏 MoE VLM,由 @StepFun_ai 从一开始就为推理而设计。196B 语言主干,搭配 1.8B 视觉编码器。 为真实世界的智能体工作负载而构建,运行速度最高可达 400 tok/sec。原生多模态理解与行动、可靠的工具使用,以及增强的网页与视觉搜索。 Apache 2.0。立即试用 → https://fireworks.ai/models/fireworks/step-3p7-flash-nvfp4

    推荐理由:198B稀疏MoE加MTP解码把速度推到400 tok/s,还开源Apache 2.0,这规格做agent的大脑正合适,做实时应用的可以试试手。

  4. xAI:News(网页)75

    xAI 发布 Grok Imagine 1.5 预览版(图像转视频模型)

    xAI 通过 API 发布了图像转视频模型 `grok-imagine-video-1.5-preview`(Grok Imagine 1.5 预览版)。该模型能将单张静态图片转为流畅的电影感视频,用户提供起始帧和描述运动的提示词后,模型可生成包含相机移动、氛围和物理效果的动画,并保持对源图像的忠实。支持生成 720p 片段,可使用自然语言指令控制镜头、节奏和音效,并支持逐帧拼接成长场景。模型目前通过 xAI API 提供预览使用。

    推荐理由:xAI的新视频模型从单张图像生成电影级短片,支持自然语言控制运镜和氛围,对视频创作者和开发者是个值得一试的工具。

  5. Elon Musk72

    Vercel 的 AI Gateway 上现已推出 Grok Imagine Video 1.5。该服务支持图生视频并同步音频,一次性完成。示例代码: `await generateVideo({ model: 'xai/grok-imagine-video-1.5-preview', prompt: 'a rabbit sprinting through nyc' });`

    引用Vercel Developers@vercel_dev

    Grok Imagine Video 1.5 上线 AI Gateway。 一次生成即可完成带同步音频的图生视频。 𝚊𝚠𝚊𝚒𝚝 𝚐𝚎𝚗𝚎𝚛𝚊𝚝𝚎𝚅𝚒𝚍𝚎𝚘({ 𝚖𝚘𝚍𝚎𝚕: '𝚡𝚊𝚒/𝚐𝚛𝚘𝚔-𝚒𝚖𝚊𝚐𝚒𝚗𝚎-𝚟𝚒𝚍𝚎𝚘-𝟷.𝟻-𝚙𝚛𝚎𝚟𝚒𝚎𝚠', 𝚙𝚛𝚘𝚖𝚙𝚝: '𝚊 𝚛𝚊𝚋𝚋𝚒𝚝 𝚜𝚙𝚛𝚒𝚗𝚝𝚒𝚗𝚐 𝚝𝚑𝚛𝚘𝚞𝚐𝚑 𝚗𝚢𝚌' });

    推荐理由:Grok Imagine Video 1.5 把同步音频塞进了图生视频,一条 prompt 直接出带声短片,做短视频和创意的可以换上这条流水线了。

  6. vLLM 官方博客(RSS)61

    NVIDIA 发布开源推理模型 Nemotron 3 Ultra,vLLM 提供 Day-0 支持

    NVIDIA 发布开源模型 Nemotron 3 Ultra,采用 Hybrid Transformer-Mamba MoE 架构,总参数 550B、激活 55B,上下文最长 1M token,主打长时程自主智能体工作流,vLLM 提供 Day-0 支持。

    推荐理由:原文给出架构细节、部署配置和与 GLM 5.1、Kimi K2.6、Qwen3.5 的基准对比,读者可据此评估其在长时程智能体工作流中的适用性。

  7. MiniMax (official)78

    Mem0 是 MiniMax M3 的官方启动合作伙伴! M3 的 1M token 上下文窗口 + @mem0ai 的记忆层 = 真正记住的 AI 应用。 构建具有持久记忆的个性化 AI 智能体,现在启动周内 M3 享五折优惠。 开始使用 Minimax → https://platform.minimax.io/docs/guides/models-intro 注册 mem0 → http://app.mem0.ai/?utm_source=minimax_x_post

    推荐理由:MiniMax 把 1M 上下文和 Mem0 记忆层绑在一起,不是单纯秀参数,是给 Agent 装了个硬盘,做长期记忆产品的该关注一下。

  8. Greg Brockman71

    GPT-Rosalind 重大升级,药物发现、分析、设计和实验工作流的智能大幅提升:

    引用OpenAI@OpenAI

    我们正在为 GPT-Rosalind 带来新能力,这是一个专为企业级生命科学研究打造的模式系列。 它将 GPT-5.5 的智能体编程和工具使用能力,与更强的药物发现、分析、设计和实验工作流智能结合在一起。 https://openai.com/index/introducing-new-capabilities-to-gpt-rosalind

    推荐理由:OpenAI 把 GPT-5.5 的 agentic coding 能力塞进了生命科学专用模型,制药行业的老铁们可以关注一下,可能比通用模型更懂实验设计。

  9. OpenAI:官网动态(RSS · 排除企业/客户案例)66

    GPT-Rosalind 新功能发布

    GPT-Rosalind 在生命科学研究领域推出新功能,增强了生物推理、药物化学专业知识、基因组学分析以及实验工作流处理能力。

    推荐理由:GPT-Rosalind 把 GPT-5.5 的智能带进了生命科学核心流程,从分子设计到 FDA 审评准备都能直接参与,是行业模型走向实用化的一个关键节点,虽然现在只对机构开放,但未来可能重塑药物研发工具链。

  10. Sundar Pichai73

    Gemma 4 系列累计下载量突破1.5亿次,Google随之推出新成员Gemma 4 12B。该模型仅12B参数,可在16GB VRAM笔记本上本地运行,兼顾尺寸与性能,支持多步推理和智能体工作流。采用Apache 2.0开源许可,供社区使用。

    引用Demis Hassabis@demishassabis

    庆祝 Gemma 4 下载量突破 1.5 亿次这一里程碑,同时发布全新的 Gemma 4 12B 模型! 对于如此小巧的模型来说,它性能极其强大,而且体积足够小,仅需 16GB 显存就能在笔记本电脑上本地运行。 采用 Apache 2.0 许可证——祝大家构建愉快!

    推荐理由:Gemma 4 12B 把多步推理塞进笔记本能跑的尺寸,Apache 2.0 开源,对想做本地 agent 的开发者是实实在在的新弹药,小模型的可用性正在逼近临界点。

  11. Demis Hassabis74

    Demis Hassabis 宣布 Gemma 4 系列下载量突破 1.5 亿,并正式发布新版 Gemma 4 12B 模型。该模型是一个统一的、无编码器的多模态模型,兼具边缘端效率与高级推理能力。尽管参数规模仅为 12B,但性能强劲,且足够小巧,可在仅需 16GB VRAM 的笔记本上本地运行。采用 Apache 2.0 开源许可证,方便开发者自由构建。

    引用Google Gemma@googlegemma

    认识 Gemma 4 12B! 一个统一的、无编码器的多模态模型,旨在将高性能智能直接带到你的笔记本电脑上,并以 Apache 2.0 许可证发布。 弥合边缘效率与高级推理之间的差距。以下是 Gemma 4 12B 的新内容:👇

    推荐理由:Gemma 4 12B 用 Apache 2.0 许可把多模态模型压进笔记本,16GB 显存就能跑,端侧智能的性价比又一次被 Google 拉高,做本地推理的可以马上试试。