跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 561–580 条 · 共 710 条
3月31日周二
  1. Meta Engineering Blog(RSS)71

    AI助力美国产水泥与混凝土

    Meta发布了名为贝叶斯优化的新AI模型,用于设计混凝土配比。该模型旨在帮助建筑行业生产更高质量、更可持续的混凝土混合物,并特别聚焦于美国本土生产的产品。此次发布与2026年美国混凝土学会春季大会同步进行,是Meta长期路线图的一部分,旨在推动建筑业利用人工智能优化材料性能与环保指标。

    推荐理由:Meta 将 AI 应用于传统建筑行业,展示垂直领域落地案例,启发其他行业探索 AI 应用。

3月30日周一
  1. 美团 LongCat:HuggingFace 新模型

    LongCat-AudioDiT-1B:高保真波形潜空间扩散式文本转语音模型

    美团 LongCat 团队开源的扩散式 TTS 模型摒弃传统的 mel-spectrogram 中间表示,直接在波形潜空间操作,仅通过 Wav-VAE 与扩散骨干网络即可合成语音。该模型修复了训练-推理不匹配问题,并以自适应投影引导替代无分类器引导。最大版本 3.5B 在 Seed 基准实现 SOTA 零样本语音克隆,说话人相似度(SIM)在 Seed-ZH 达 0.818、Seed-Hard 达 0.797,超越此前最优的 Seed-TTS。研究还发现 Wav-VAE 的重建保真度与最终合成质量并非正相关。

    推荐理由:美团开源 1B 语音克隆模型,Seed 基准超 Seed-TTS,零样本推理可用

3月27日周五
  1. Demis Hassabis

    Google 发布 Gemini 3.1 Flash Live,称其迄今最高质量音频模型,具备更低延迟、更高精度和更自然的对话体验,改进了函数调用能力。现已在 Gemini App 和 Google AI Studio 上线。

    引用Google DeepMind@GoogleDeepMind

    欢迎 Gemini 3.1 Flash Live。🗣️ 我们最新的音频模型带来了更自然的对话体验,并改进了函数调用——使其更加实用且信息更丰富。以下是新功能介绍 🧵

    推荐理由:Google发布Gemini 3.1 Flash Live,支持低延迟语音交互与Agent构建

3月26日周四
  1. Artificial Analysis

    OpenAI发布GPT-5.4 mini与nano轻量模型,保留多档推理能力与400K上下文窗口,价格降至$0.20/$1.25每百万token。基准测试显示,GPT-5.4 nano在τ²-Bench等多项测试中领先Claude Haiku 4.5与Gemini 3.1 Flash-Lite Preview,但幻觉率较高且token消耗量大。得益于极低单价,nano在Intelligence Index测试中的有效成本反而低于竞品,展现出优秀的性价比优势。

    推荐理由:OpenAI 发布 GPT-5.4 mini/nano,性价比突出且评测数据详实,nano 性能超越同级竞品。

  2. Cohere Labs:官方研究博客65

    Cohere 发布开源语音识别模型 Cohere Transcribe,登顶 HuggingFace Open ASR Leaderboard

    Cohere 发布开源 ASR 模型 Cohere Transcribe,基于 Conformer 编码器-解码器架构,参数量 2B,支持英语、法语、中文、日语、阿拉伯语等 14 种语言,采用 Apache 2.0 许可证。

    推荐理由:原文给出了模型规格、WER 数据和推理吞吐表现,读者可以据此评估它在语音识别工作流中的实际可用性。

3月23日周一
  1. Mistral AI:News(网页)70

    Mistral AI 发布首个文本转语音模型 Voxtral TTS

    Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。

    推荐理由:官方公布了模型架构、延迟数据和与 ElevenLabs 的人类评测对比,可据此评估其在语音智能体场景的适用性。

3月20日周五
  1. Artificial Analysis

    Mistral发布开源权重模型Mistral Small 4,采用119B参数MoE架构(每token激活6.5B参数),支持可切换的推理/非推理模式及图像输入。推理模式在Artificial Analysis Intelligence Index获27分,超越Mistral Large 3,但低于gpt-oss-120B等竞品。模型token效率优于同类,幻觉率更低(AA-Omniscience -30分),支持256K上下文窗口,采用Apache 2.0许可证。

    推荐理由:Mistral 开源 Small 4,支持混合推理与多模态,Agent 任务表现大幅提升

  2. Satya Nadella

    MAI-Image-2 图像生成模型已在 MAI Playground 上线,竞技场排名第 3,支持从写实风格到详细信息图等多种生成需求。即将集成至 Copilot、Bing Image Creator 及 Microsoft Foundry,面向企业客户开放。

    引用Mustafa Suleyman@mustafasuleyman

    我们的新图像生成器 MAI-Image-2 发布了!现已在 MAI Playground 上线,从逼真的写实效果到详细的资讯图,样样都能胜任。 我们团队为这次发布付出了巨大的努力,现在我们已跻身顶尖模型之列:在 @arena 上排名第 3 的模型家族。 详情请见我们的博客:https://microsoft.ai/news/introducing-MAI-Image-2/ 它即将登陆 Copilot 和 Bing Image Creator,以及 Microsoft Foundry。 真的为我们模型和产品上的进展感到自豪——敬请期待新发布,并加入我们的超级智能使命!

    推荐理由:微软 CEO 宣布 Superintelligence 团队新图像模型 MAI-Image-2 发布,竞技场排名第三

3月19日周四
  1. Cursor Blog

    Composer 2 正式发布

    Composer 2 登陆 Cursor,定价 $0.50/M(输入)和 $2.50/M(输出),Terminal-Bench 2.0 得分 61.3,SWE-bench Multilingual 达 73.7,显著优于前代。支持数百步长周期编码任务,团队同步发布训练技术报告。

    推荐理由:Cursor发布Composer 2编程Agent,性能大幅提升且定价极具竞争力

  2. Qwen:Blog Retrieval(API)

    Qwen3.5-Max-Preview 现已上线 Arena

    Qwen3.5-Max-Preview 已登陆 LMSYS Chatbot Arena。Qwen Studio 提供聊天机器人、图像与视频理解、图像生成、文档处理、网页搜索、工具调用及 artifacts 等全栈功能。

    推荐理由:阿里 Qwen3.5-Max 预览版上线 Arena,支持多模态理解与工具调用

3月18日周三
  1. Greg Brockman

    OpenAI 发布 GPT-5.4 mini,已在 ChatGPT、Codex 及 API 上线。针对编程、计算机使用、多模态理解与 subagents 优化,速度较 GPT-5 mini 提升 2 倍。

    引用OpenAI@OpenAI

    GPT-5.4 mini 现已登陆 ChatGPT、Codex 和 API。 针对编程、计算机使用、多模态理解和子智能体进行了优化。而且它的速度是 GPT-5 mini 的 2 倍。 https://openai.com/index/introducing-gpt-5-4-mini-and-nano/ https://t.co/sirArgn37L

    推荐理由:OpenAI 发布 GPT-5.4 mini,针对编码和 Agent 优化且速度翻倍

  2. MiniMax:Blog(网页)61

    MiniMax M2.7:自我进化的早期回声

    M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架,完成精细的生产力任务,尤其在软件工程方面表现突出,其SWE-Pro基准测试得分56.22%,接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先,GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率,处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架,实现了“分析-修改-评估”的自主迭代优化循环,在内部评估中提升了性能。

    推荐理由:MiniMax M2.7 让模型参与自身进化,在 SWE-Pro 和 VIBE-Pro 上接近 Opus 水平,Agent Teams 设计也值得看,但整体仍是追赶者姿态。

3月17日周二
  1. Hugging Face:Blog(RSS)83

    Holotron-12B - 高吞吐计算机使用智能体

    H公司发布了多模态计算机使用模型Holotron-12B。该模型基于NVIDIA开源的Nemotron-Nano-12B-VL模型,使用专有数据混合进行训练,专注于在交互环境中高效感知、决策和行动。其采用混合状态空间模型与注意力机制架构,在单张H100 GPU上实现了比前代Holo2-8B高2倍以上的吞吐量,在100并发基准测试中达到每秒8900个token。在WebVoyager基准测试中,性能从基线的35.1%提升至80.5%,在定位和导航基准上也显著提升。模型已通过NVIDIA开放模型许可在Hugging Face发布。

    推荐理由:高效推理的计算机使用代理模型,适合生产部署,开发者可直接试用。