跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 601–620 条 · 共 710 条
2月13日周五
  1. 字节 Seed:Research Feed(网页内嵌数据)

    "思考"更深,生成更准|Seedream 5.0 Lite 发布

    字节跳动发布 Seedream 5.0 Lite 图像生成模型,采用多模态统一架构,跨模态理解与推理能力显著提升,Elo 评分超越前代 4.5 版本。模型首次引入实时检索增强能力,可联网获取最新知识,突破训练数据时间限制。内置丰富世界知识库,在信息可视化、视觉推理、复杂多主体生成等场景表现突出,能根据模糊指令精准修图,支持风格迁移与多步逻辑推理。目前已上线即梦 AI、火山方舟体验中心及豆包内测。

    推荐理由:字节发布 Seedream 5.0 Lite,支持实时检索与深度推理的图像生成模型。

2月12日周四
  1. FireRedTeam:原创语音与多模态项目61

    FireRedTeam 开源 FireRedASR2S 一体化语音识别系统,含 ASR、VAD、LID 和标点四个模块

    FireRedTeam 发布开源工业级一体化语音识别系统 FireRedASR2S,集成 FireRedASR2(支持中文普通话、20+ 方言口音、英文、中英混说及歌声转写)、FireRedVAD、FireRedLID 和 FireRedPunc 四个模块,均开源权重与推理代码。

    推荐理由:官方开源的一体化语音识别系统,给出与 Doubao-ASR、Silero-VAD 等的对比数字和完整推理代码,便于直接部署验证。

  2. MiniMax:Blog(网页)67

    MiniMax 发布 MiniMax M2.5 模型,专为现实世界生产力打造

    MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。

    推荐理由:MiniMax M2.5 把 SWE-bench 拉到 80.2%,成本只有 Claude Opus 4.6 的十分之一,速度还翻倍,对做 agent 的团队来说是个高性价比选择。

  3. 字节 Seed:Research Feed(网页内嵌数据)

    Seedance 2.0 正式发布

    Seedance 2.0 视频生成模型正式发布,综合性能达业界 SOTA 水平。新版本支持多模态输入,可同时参考 9 张图片、3 段视频、3 段音频及文本指令,精准迁移构图、动作、运镜与音效。模型支持 15 秒高质量多镜头生成,集成双声道立体声技术,并新增视频延长与编辑功能,可定向修改片段、角色及剧情。目前已在即梦 AI、豆包及火山方舟平台上线,适用于影视、广告、电商等工业级内容创作场景。

    推荐理由:字节Seedance 2.0发布,支持多模态输入与物理稳定生成,已上线豆包即梦

2月11日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库65

    inclusionAI发布新一代即时大模型Ling-2.5-1T

    inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合“正确性”与“过程冗余”的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先的开源性能。

    推荐理由:蚂蚁把 1T 参数的即时模型开源了,63B 活跃参数加 1M 上下文,主打效率而非堆算力,对国内做开源推理模型的团队来说是个值得对标的基线。

  2. 蚂蚁 inclusionAI:GitHub 新仓库78

    inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T

    inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。

    推荐理由:蚂蚁把万亿参数的开源 thinking model 放出来了,混合线性注意力架构是真新路线而非换皮,IMO/CMO 金牌级数学推理说明这不是纯堆参数。做开源大模型部署的团队值得认真看看它的架构选择。

  3. FireRedTeam:原创语音与多模态项目65

    小红书团队开源 FireRed-Image-Edit 图像编辑模型并发布 REDEdit-Bench

    小红书智能创作团队开源 FireRed-Image-Edit 图像编辑模型,权重采用 Apache 2.0 协议,并在 ImgEdit、GEdit 和自建 REDEdit-Bench 上取得开源模型中的最高分,如 ImgEdit_O 4.56。

    推荐理由:小红书团队开源图像编辑模型,README 给出完整基准对比表、训练与部署方案,读者可自行核对开源 SOTA 的成色。

  4. 蚂蚁百灵:Developer Blog(网页)83

    感知无界·创造有形:百灵全模态 Ming-flash-omni-2.0 焕新生活想象

    百灵全模态大模型Ming-flash-omni-2.0正式发布。该模型基于MoE架构,在视觉、语音、图像等全模态能力上实现代际跃迁,其核心突破在于一个统一模型同时具备了强大的通用泛化能力和特定模态的专家级表现。具体特色包括:视觉百科能精准识别万物并关联知识;语音生成可控制情绪、方言,提供百种音色,并能统一生成语音、音效与背景音乐;图像创作可实现氛围重构、场景合成与智能擦除。技术层面通过亿级数据细粒度感知、知识对齐及超低帧率音频表征等创新实现性能飞跃。模型已在多个平台开源。

    推荐理由:国产全模态模型开源,多模态能力达领先水准,开发者可直接体验或集成。

2月5日周四
  1. Claude Platform:开发者版本说明(RSS)72

    Claude Opus 4.6 发布:最智能模型,专为复杂智能体任务设计

    Anthropic 发布 Claude Opus 4.6,定位为最智能模型,专为复杂智能体任务和长周期工作设计。新模型推荐使用自适应思考模式(`thinking: {type: "adaptive"}`),弃用手动思考,且不支持预填充助手消息。

    推荐理由:Opus 4.6 把长上下文和智能体推理推向实用,加上压缩 API 和数据驻留控制,这是 Anthropic 面向企业落地的完整答卷,做 agent 的开发者值得认真评估。

2月4日周三
  1. Hugging Face:Blog(RSS)73

    H公司新模型Holo2在UI本地化领域取得领先

    H公司在Hugging Face发布博客,正式推出新一代模型Holo2。该模型在用户界面本地化任务上表现突出,实现了技术领先。其核心改进在于显著提升了多语言UI元素的识别与适配能力,能够更精准地处理图标、布局、文本标签等组件的文化适配与翻译。这一进展有望帮助全球应用和软件更高效地实现界面本地化,降低跨区域运营成本。

    推荐理由:UI本地化领域新标杆,开发者可关注其多模态能力。

2月1日周日
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)62

    MOVA 发布:32B MoE 端到端同步视频-音频生成模型全栈开源

    OpenMOSS 团队发布 MOVA 音视频基础模型,总参数 32B MoE、激活 18B,支持文本或图像到音视频的端到端同步生成,最高 720p、单段 8 秒。模型采用非对称双塔架构(14B Wan 2.2 I2V 视频塔与 1.3B 音频塔)加双向 Bridge 和 Aligned ROPE 对齐时间轴,并开放模型权重、训练与推理代码及微调方案。

    推荐理由:原文给出架构、训练策略和开源范围,读者可以了解端到端音视频生成如何处理同步问题并可复现研究。

1月28日周三
  1. xAI:News(网页)

    xAI发布Grok Imagine API

    xAI推出Grok Imagine API,提供文本/图像转视频及高精度编辑功能,支持物体增删、风格转换与原生音频生成。在Artificial Analysis和LMArena基准测试中排名首位,720p视频生成延迟与成本均低于Veo 3和Sora 2;在IVEBench评测中整体表现超越Kling o1与Runway Aleph。API已开放xAI及第三方平台接入。

    推荐理由:xAI发布Grok Imagine视频生成API,性能宣称超越Sora与Veo,支持端到端视频创作工作流

  2. Nathan Lambert:Interconnects(RSS)

    Arcee AI 全力投入在美国构建的开放模型

    Arcee AI 发布开源大模型 Trinity Large,标志着其全面投入在美国本土构建开放模型的战略布局。该发布作为 Interconnects 第16期访谈的核心内容,彰显该公司对开源生态与数据主权的承诺。Trinity Large 的推出代表 Arcee AI 在本土 AI 基础设施建设上的关键进展,强调模型训练与开发的地理合规性及技术自主性。

    推荐理由:开源模型Trinity Large发布,美国本土训练的企业级合规新选择

1月27日周二
  1. 公众号:月之暗面(Kimi)61

    Kimi 发布并开源 K2.5 模型,带来全新视觉理解、代码和 Agent 集群能力

    Kimi 发布并开源迄今最智能、最全能的 K2.5 模型,原生多模态架构支持视觉与文本输入、思考与非思考模式,在 Agent、代码、图像、视频及通用智能任务上取得开源 state-of-the-art 表现。

    推荐理由:Kimi K2.5把视觉理解和Agent集群能力打包开源,国内模型里比较早做这个组合的,虽然参数规模争议不小,但对想搭多模态Agent的团队是个可用的起点。

1月23日周五
  1. MiniMax:Blog(网页)

    MiniMax Speech 2.8 语音模型

    MiniMax 发布新一代语音模型 MiniMax Speech 2.8,通过原生声音标签技术模拟人类口语中的"嗯"、"啊"等填充词及呼吸停顿,显著提升对话自然度。该模型支持10秒样本高保真声音克隆,精准还原音色与语速,同时消除背景噪音与数字伪影,输出录音室级纯净音质。此外,模型优化了跨语言表现,从普通话-日语对开始解决口音渗透问题,实现更接近母语者的发音效果。

    推荐理由:10秒样本克隆真人声线,AI说话带'嗯啊'呼吸声,MiniMax语音模型上新

1月20日周二
  1. Hugging Face:Blog(RSS)83

    差分Transformer V2

    差分Transformer V2发布,其核心是改进的差分注意力机制。相较于V1,V2将查询头数量翻倍而保持键值头不变,差分操作后将维度缩减,从而在解码时能达到与标准Transformer相当的速度,且无需定制内核。新版本还解决了V1中因注意力分布均匀化导致的数值不稳定问题,特别是消除了RMSNorm层所需的巨大缩放因子(如在长序列下),从而避免了梯度爆炸,旨在实现更稳定的大规模预训练。

    推荐理由:新注意力架构提升解码效率与训练稳定性,开发者可低成本集成优化模型。

  2. Hugging Face:Blog(RSS)73

    Overworld发布实时交互式视频扩散模型Waypoint-1

    Overworld推出实时交互式视频扩散模型Waypoint-1,用户可通过文本、鼠标和键盘实时控制生成可步入的虚拟世界。该模型基于帧因果校正流变换器架构,在1万小时游戏视频及对应控制数据上训练,从一开始就专注于交互体验,支持零延迟的自由操控。其配套的高性能推理库WorldEngine在消费级硬件上可实现流畅运行,例如Waypoint-1-Small在RTX 5090上能以30 FPS(4步去噪)或60 FPS(2步去噪)生成画面。模型采用扩散强制预训练和自我强制后训练来确保生成长序列的稳定性。

    推荐理由:零延迟交互式视频生成,游戏和创意应用开发者的福音。

1月16日周五
1月14日周三
  1. 美团 LongCat:HuggingFace 新模型

    美团LongCat发布重思考模式总结模型

    美团LongCat推出基于5600亿参数MoE架构大模型LongCat-Flash-Thinking-2601的重思考模式(Heavy Thinking Mode),并发布LongCat-HeavyModel-Summary模型。该模式通过并行思考与总结两阶段协同扩展推理能力:前者以高温度并行生成多路径扩展宽度,后者将精炼轨迹递归反馈形成迭代循环延伸深度。模型经额外强化学习优化总结能力,已在Longcat AI平台上线。

    推荐理由:美团开源 560B 参数 MoE 推理模型,Heavy Thinking 模式支持并行多路径探索,已上线可体验