推出 GPT-5.4 mini 和 nano
GPT-5.4 mini 与 nano 发布,为 GPT-5.4 的轻量高速版本,针对编程、工具调用、多模态推理及高并发 API 和子代理任务优化。
推荐理由:OpenAI 发布 GPT-5.4 mini/nano,针对编码与 Agent 场景优化
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
GPT-5.4 mini 与 nano 发布,为 GPT-5.4 的轻量高速版本,针对编程、工具调用、多模态推理及高并发 API 和子代理任务优化。
推荐理由:OpenAI 发布 GPT-5.4 mini/nano,针对编码与 Agent 场景优化
GPT-5.4 上线一周内日处理 token 量达 5T,超过去年同期整个 API 的总量,年化新增净收入达 10 亿美元,增速创历史纪录。模型质量出色,值得试用。
推荐理由:OpenAI史上增长最快模型,API周处理量超去年全年,开发者正大规模迁移
Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可开源。
推荐理由:原文给出完整的架构参数、推理档位设置和与 GPT-OSS 120B 的输出长度对比,读者可以据此评估部署成本和适用场景。
GPT-5.4 在编程、知识工作、计算机使用等方面表现出色,很高兴看到大家如此喜欢它。 但它也是我最喜欢聊天的模型!我们在模型个性方面已经偏离目标有一段时间了,所以能朝着正确方向前进感觉特别好。
推荐理由:GPT-5.4获Sam Altman盛赞,对话体验与Agent能力双双突破
GPT-5.4 Thinking 和 GPT-5.4 Pro 开始向 ChatGPT 用户推出,同时通过 API 和 Codex 开放。该版本将推理、编程与智能体工作流能力整合为单一前沿模型。
推荐理由:GPT-5.4 正式发布,集推理、编程与 Agent 能力于一体,全平台上线
Sarvam AI 以 Apache 2.0 协议开源 Sarvam 30B 和 Sarvam 105B 两款从零训练的推理模型,采用 MoE 架构,训练全部在 IndiaAI mission 提供的算力上于印度完成。
推荐理由:原文给出两款从零训练的开源推理模型的架构、训练流程和基准数据,并说明针对印度语言的优化与部署效率,可据此评估其与同类模型的差异。
OpenAI 推出 GPT-5.4,面向专业工作的最强高效前沿模型,支持 100 万 token 长上下文,具备顶尖编程、计算机使用与工具搜索能力。
推荐理由:OpenAI 发布 GPT-5.4,支持 1M 上下文与增强 Agent 能力
OpenAI 发布 GPT-5.4 Thinking 系统卡,披露新一代推理模型的架构细节、安全评估框架及能力边界。文档详述思维链优化机制、长上下文推理性能指标,明确数学推导与代码生成准确率数据,分析幻觉风险与偏见控制措施,并列出越狱攻击防护策略及企业级部署的安全限制建议。
推荐理由:OpenAI 发布 GPT-5.4 Thinking 系统卡,详述模型安全与能力评估
官方暗示5.4版本发布时间将早于外界普遍预期,新版本即将到来。具体发布日期及新增功能细节有待后续正式公布,玩家可关注官方渠道获取最新动态。
推荐理由:OpenAI官方预告GPT-5.4即将发布,暗示新模型上线在即引发热议
GPT-5.3 Instant 现已向所有 ChatGPT 用户推出,响应准确性提升,且减少了令人尴尬的 AI 味。
推荐理由:OpenAI 向所有用户开放 GPT-5.3 Instant,响应更快且回答更准确自然
GPT-5.3 Instant 模型升级,针对日常对话场景优化响应流畅度与实用性。新版本在保持即时响应速度的同时,输出更顺滑自然,提升普通用户高频问答体验。
推荐理由:OpenAI 发布 GPT-5.3 Instant,针对日常对话体验优化
OpenAI 发布 GPT-5.3 Instant 系统卡,概述该快速响应模型的安全评估、能力边界及使用限制,明确低延迟场景下的技术规范与风险管控措施。
推荐理由:OpenAI发布GPT-5.3 Instant系统卡,披露新模型能力与安全评估
Cognition 发布 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,达到 51.7%,速度同为 950 tok/s,并向小部分用户开放早期访问。
推荐理由:官方给出 SWE-1.6 预览版成绩与 RL 训练细节,并提出基准之外的 Model UX 问题,对做智能体训练的人有参考价值。
FireRedTeam 发布 FireRed-OCR-2B 权重,基于 Qwen3-VL-2B-Instruct,在 OmniDocBench v1.5 上取得 92.94 的总成绩,高于 DeepSeek-OCR 2 的 91.09、PaddleOCR-VL 的 92.86 等模型。
推荐理由:原文给出了 OmniDocBench v1.5 具体分数、对比模型和三阶段训练方法,读者可以据此判断这个 2B 文档解析模型的实际位置。
我们推出 Nano Banana 2,基于最新的 Gemini Flash 模型构建。🍌 它在创建和编辑图像方面达到最先进水平,将专业级功能与闪电般的速度相结合。🧵
推荐理由:端侧手机本地实现Pro级图像生成与编辑,AI创作无需云端等待
推荐理由:42M小模型实现人形机器人全身控制,零样本迁移真实硬件且完全开源,开发者可复现
Liquid AI 发布 LFM2 系列最大模型 LFM2-24B-A2B 的早期检查点,为 MoE 架构,24B 总参数、每 token 约 2.3B 激活,可放进 32GB 内存部署于云端和边缘设备。
推荐理由:官方给出架构配方和与 Qwen3、gpt-oss 的吞吐对比,读者可以据此评估这款 24B MoE 在笔记本和边缘部署上的实际可行性。
推荐理由:Noam Shazeer 宣布 Gemini 3.1 Pro,作为 Deep Think 突破背后的核心基座升级,全行业该关注的信号。
Gemini 3.1 Pro 发布,专为无法通过简单回答解决的复杂任务设计,提供更智能的深度推理与处理能力。
推荐理由:Google 发布 Gemini 3.1 Pro,强化复杂任务推理能力
Seed2.0系列正式发布,推出Pro、Lite、Mini三款通用Agent模型及专用Code模型,针对复杂多模态任务与长链路Agent场景优化。模型在视觉理解、数学推理与长上下文处理方面达SOTA水平,SuperGPQA分数超越GPT-5.2,并在ICPC、IMO、CMO测试中获金牌。支持科学研究级任务,token成本较顶尖模型降低约一个数量级。目前已上线豆包App、TRAE及火山引擎API。
推荐理由:字节 Seed2.0 正式发布,Agent 与多模态能力全面升级,已接入豆包和 TRAE