跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 581–600 条 · 共 710 条
3月17日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)

    推出 GPT-5.4 mini 和 nano

    GPT-5.4 mini 与 nano 发布,为 GPT-5.4 的轻量高速版本,针对编程、工具调用、多模态推理及高并发 API 和子代理任务优化。

    推荐理由:OpenAI 发布 GPT-5.4 mini/nano,针对编码与 Agent 场景优化

3月16日周一
  1. Mistral AI:News(网页)72

    Mistral 发布 Mistral Small 4:统一推理、多模态与编码能力并开源

    Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可开源。

    推荐理由:原文给出完整的架构参数、推理档位设置和与 GPT-OSS 120B 的输出长度对比,读者可以据此评估部署成本和适用场景。

3月8日周日
3月6日周五
  1. Sarvam AI(网页)65

    Sarvam AI 开源发布 Sarvam 30B 和 Sarvam 105B 推理模型

    Sarvam AI 以 Apache 2.0 协议开源 Sarvam 30B 和 Sarvam 105B 两款从零训练的推理模型,采用 MoE 架构,训练全部在 IndiaAI mission 提供的算力上于印度完成。

    推荐理由:原文给出两款从零训练的开源推理模型的架构、训练流程和基准数据,并说明针对印度语言的优化与部署效率,可据此评估其与同类模型的差异。

3月5日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)

    GPT-5.4 发布

    OpenAI 推出 GPT-5.4,面向专业工作的最强高效前沿模型,支持 100 万 token 长上下文,具备顶尖编程、计算机使用与工具搜索能力。

    推荐理由:OpenAI 发布 GPT-5.4,支持 1M 上下文与增强 Agent 能力

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)

    GPT-5.4 Thinking 系统卡

    OpenAI 发布 GPT-5.4 Thinking 系统卡,披露新一代推理模型的架构细节、安全评估框架及能力边界。文档详述思维链优化机制、长上下文推理性能指标,明确数学推导与代码生成准确率数据,分析幻觉风险与偏见控制措施,并列出越狱攻击防护策略及企业级部署的安全限制建议。

    推荐理由:OpenAI 发布 GPT-5.4 Thinking 系统卡,详述模型安全与能力评估

3月4日周三
3月3日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)

    GPT-5.3 Instant:日常对话更流畅、更实用

    GPT-5.3 Instant 模型升级,针对日常对话场景优化响应流畅度与实用性。新版本在保持即时响应速度的同时,输出更顺滑自然,提升普通用户高频问答体验。

    推荐理由:OpenAI 发布 GPT-5.3 Instant,针对日常对话体验优化

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)

    GPT-5.3 Instant 系统卡

    OpenAI 发布 GPT-5.3 Instant 系统卡,概述该快速响应模型的安全评估、能力边界及使用限制,明确低延迟场景下的技术规范与风险管控措施。

    推荐理由:OpenAI发布GPT-5.3 Instant系统卡,披露新模型能力与安全评估

3月1日周日
  1. Cognition 模型 / Devin 博客(网页)60

    Cognition 发布 SWE-1.6 早期预览并分享 RL 训练研究进展

    Cognition 发布 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,达到 51.7%,速度同为 950 tok/s,并向小部分用户开放早期访问。

    推荐理由:官方给出 SWE-1.6 预览版成绩与 RL 训练细节,并提出基准之外的 Model UX 问题,对做智能体训练的人有参考价值。

2月28日周六
  1. FireRedTeam:原创语音与多模态项目60

    FireRedTeam 发布 FireRed-OCR-2B 结构化文档解析模型,OmniDocBench v1.5 得分 92.94

    FireRedTeam 发布 FireRed-OCR-2B 权重,基于 Qwen3-VL-2B-Instruct,在 OmniDocBench v1.5 上取得 92.94 的总成绩,高于 DeepSeek-OCR 2 的 91.09、PaddleOCR-VL 的 92.86 等模型。

    推荐理由:原文给出了 OmniDocBench v1.5 具体分数、对比模型和三阶段训练方法,读者可以据此判断这个 2B 文档解析模型的实际位置。

2月27日周五
2月25日周三
  1. Jim Fan

    SONIC是一个4200万参数的Transformer模型(规模仅半个GPT-1),通过1亿+动作捕捉帧和50万+并行机器人在NVIDIA Isaac Lab中训练,以密集帧级监督替代手工奖励函数。训练3天后零样本迁移至真实G1机器人,在50种动作序列上达100%成功率。单一策略支持VR遥操作、视频动捕、文本指令、音乐响应及VLA模型控制。项目已完全开源。

    推荐理由:42M小模型实现人形机器人全身控制,零样本迁移真实硬件且完全开源,开发者可复现

2月24日周二
  1. Liquid AI 模型与工程博客(网页)64

    Liquid AI 发布早期检查点 LFM2-24B-A2B,24B 总参数仅 2.3B 激活

    Liquid AI 发布 LFM2 系列最大模型 LFM2-24B-A2B 的早期检查点,为 MoE 架构,24B 总参数、每 token 约 2.3B 激活,可放进 32GB 内存部署于云端和边缘设备。

    推荐理由:官方给出架构配方和与 Qwen3、gpt-oss 的吞吐对比,读者可以据此评估这款 24B MoE 在笔记本和边缘部署上的实际可行性。

2月20日周五
  1. Noam Shazeer78

    上周我们升级了 Gemini 3 Deep Think。今天,我们正式推出实现这些突破的核心智能:Gemini 3.1 Pro。一个明显更智能、能力更强的基线,应对你最艰巨的挑战。现已可用:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro

    推荐理由:Noam Shazeer 宣布 Gemini 3.1 Pro,作为 Deep Think 突破背后的核心基座升级,全行业该关注的信号。

2月14日周六
  1. 字节 Seed:Research Feed(网页内嵌数据)

    Seed2.0 正式发布

    Seed2.0系列正式发布,推出Pro、Lite、Mini三款通用Agent模型及专用Code模型,针对复杂多模态任务与长链路Agent场景优化。模型在视觉理解、数学推理与长上下文处理方面达SOTA水平,SuperGPQA分数超越GPT-5.2,并在ICPC、IMO、CMO测试中获金牌。支持科学研究级任务,token成本较顶尖模型降低约一个数量级。目前已上线豆包App、TRAE及火山引擎API。

    推荐理由:字节 Seed2.0 正式发布,Agent 与多模态能力全面升级,已接入豆包和 TRAE