跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 481–500 条 · 共 710 条
5月6日周三
  1. OpenAI86

    GPT-5.5 Instant 正在 ChatGPT 中逐步推出。 这是一次重大升级,以更温暖、更自然的语调为您提供更智能、更清晰、更个性化的答案。 同时它也更加简洁,这正是我们所了解到的用户需求。我们相信您会喜欢与它对话。

    推荐理由:GPT-5.5 Instant 是 OpenAI 给所有人的即时升级,更聪明更自然还更简洁,这可能是 ChatGPT 推出以来最接地气的版本迭代。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)82

    GPT-5.5 Instant:更智能、更清晰、更个性化

    ChatGPT的默认模型已更新为GPT-5.5 Instant。新版模型能提供更智能、更准确的答案,并有效减少了幻觉现象。同时,用户获得了更强的个性化控制能力,使交互体验更贴合个人需求。此次升级标志着模型在理解精度与响应定制化方面取得了显著进步。

    推荐理由:ChatGPT默认模型替换为GPT-5.5 Instant,不只是变聪明,幻觉减少和个性化控制才是真改进,每个用户都能马上感觉到不同。

  3. xAI80

    Grok 4.3 现已在 xAI API 上线。这是我们迄今为止最快、最智能的模型。 它在 @ArtificialAnlys 排行榜上的智能体工具调用和指令遵循方面位居榜首,并在 @ValsAI 的企业领域(如判例法和公司金融)中排名第一。 Grok 4.3 支持 100 万令牌的上下文窗口,定价为输入每百万令牌 1.25 美元,输出每百万令牌 2.50 美元。 创建 API 密钥并开始构建:http://console.x.ai/team/default/api-keys

    推荐理由:Grok 4.3 登顶 agentic tool calling 榜,定价有竞争力,做 agent 的值得认真看。虽然不算顶级发布,但 xAI 靠性能价格组合可能抢下不少性价比敏感开发者。

5月2日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)74

    DeepSeek V4——性能几乎达到前沿水平,价格却仅为其一小部分

    DeepSeek发布了V4版本模型,其性能已接近行业最前沿水平,但在价格上具有显著优势,仅为主要竞争对手的一小部分。该模型在多项基准测试中表现出色,能以极低的成本提供顶级的AI能力,有望大幅降低企业和开发者的使用门槛,推动AI技术的更广泛普及。

    推荐理由:Simon Willison 实测结论很直白,DeepSeek V4 性能几乎摸到前沿,价格却便宜一个量级,对预算卡死的团队是重大利好。

5月1日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    Grok 4.3

    x.ai 正式发布了 Grok 4.3 模型,开发者可通过官方文档获取详细信息。该模型在 Hacker News 社区获得关注,相关帖子收获了 100 点热度。此次发布标志着 Grok 系列模型的持续迭代更新。

    推荐理由:xAI 的 Grok 4.3 如期而至,性能和对标都写在文档里了,想了解最新大模型实力的开发者值得花五分钟看一眼。

  2. OpenRouter68

    @xai 的新模型 Grok-4.3 现已在 OpenRouter 上线! Grok-4.3 以比 Grok-4.2 更低的价格发布,同时在代理性能上实现大幅跃升:在 @ArtificialAnlys 的 GDPval-AA 基准上 ELO 分数提升 321 点至 1500,尽管价格更低,但仍超越了其他顶级模型。

    推荐理由:Grok-4.3 降价但性能反升,agentic 跑分直接到 1500,如果之前觉得 Grok 贵而没试过,这次可以上车了。

  3. Midjourney:Updates(RSS)56

    V8.1 更新

    Midjourney V8.1 版本现已登陆 Discord 平台及其官方网站。本次更新重点提升了图像的清晰度与整体画质,这一改进在风格参考(SREF)和情绪板(Moodboards)功能中效果最为显著,同时所有类型的图像生成质量均有所增强,为用户带来更精细的视觉体验。

    推荐理由:Midjourney V8.1 只是个小版本迭代,主要提升锐度和图像质量,用惯了 V8 的可以不急着换,但玩 SREF 和 Moodboard 的值得试一下,细节确实有提升。

  4. Google Developers Blog(RSS)62

    基于Gemini Embedding 2构建:智能多模态RAG及其他应用

    Google正式发布Gemini Embedding 2统一嵌入模型,该模型能将文本、图像、视频、音频和文档映射到同一语义空间。开发者可通过单请求处理交织多模态输入,显著提升智能RAG、视觉搜索等内容审核任务的性能。模型支持超100种语言,并提供任务特定前缀和马特廖什卡降维等特性,为构建复杂AI智能体提供高效精准的基础。

    推荐理由:开发者做多模态RAG的苦日子结束了,Gemini Embedding 2把文本、图片、视频塞进同一个语义空间,还自带Matryoshka降维,直接省掉一堆胶水代码。

  5. Ant Ling76

    AntLingAGI团队宣布Ling-2.6-1T模型正式开源,已登陆Hugging Face平台,并通过Novita Labs提供官方推理体验。该模型采用混合专家架构,总参数1万亿、激活参数630亿,核心优化方向为“令牌效率”以满足真实生产需求。具体表现为:低令牌开销,能在无需冗长推理链的情况下保持强大智能;可靠的多步执行能力,提升指令、工具、上下文和工作流的控制水平;生产就绪的部署特性,覆盖从代码生成到错误修复的任务,并广泛兼容各类智能体框架。团队旨在通过降低测试、部署、定制和构建的难度,为开发者创造价值。

    引用Ant Ling@AntLingAGI

    上周,我们发布了 Ling-2.6-1T。今天,Ling-2.6-1T 正式成为开源模型~ 🤗 总参数 1T · 激活参数 63B 我们通过让测试、部署、定制和构建变得更简单,为开发者带来价值。 这款模型针对实际生产需求进行了“模型 token 效率”优化: • 更低的 token 开销:无需长推理链即可实现强大的智能 • 可靠的多步执行:更好的指令、工具、上下文和工作流控制 • 生产级部署:从代码生成到 bug 修复,兼容广泛的 Agent 框架 提前一瞥 @opencode 中的智能体能力

    推荐理由:1T参数开源模型不是天天有,蚂蚁这个Ling-2.6-1T强调token效率和Agent能力,做Agent的可以直接去Hugging Face上跑一下,看看是不是真的在生产环境省token。

  6. Google AI69

    谷歌上周正式向公众发布了其首个原生多模态嵌入模型Gemini Embedding 2。该模型如同“通用翻译器”,能将文本、图像、视频和音频数据转化为独特的数字向量。其核心突破在于不再依赖关键词匹配,而是基于语义将不同模态的数据映射到同一空间,从而理解内容间的深层联系。开发者已利用该模型构建视频分析工具、视觉购物助手等应用,实现通过拍照或描述场景进行智能搜索的功能。模型现可通过Gemini API或Gemini Enterprise Agent平台使用。

    推荐理由:Google 第一个原生多模态嵌入模型,把文本、图像、视频拉到同一个向量空间,做跨模态搜索的开发者可以不用再手动打标签了,但离「无感理解」还有距离。

4月30日周四
  1. Baidu Inc.65

    百度ERNIE 5.1 Preview模型正式上线。该模型采用更轻量高效的架构,在总参数量压缩至前代约1/3、激活参数量约1/2的同时,仅消耗可比模型约6%的预训练成本,实现了在其规模下的领先基础性能。根据@arena的Text Arena榜单,ERNIE 5.1 Preview在全球总排名第13位,并位列中国实验室第一。其在多个细分领域进入全球前十,特别是在法律与政府领域排名第一。百度预告将在2026年的Baidu Create大会上发布更多ERNIE模型更新。

    引用ERNIE for Developers@ErnieforDevs

    隆重推出 ERNIE 5.1 Preview —— 现已上线!🚀 在 @arena 的 Text Arena 中全球排名第 13,在中国实验室中排名第 1。 在以下领域跻身全球前 10: 📐 数学 —— 第 9 ⚖️ 法律与政府 —— 第 1 💼 商业、管理与金融运营 —— 第 4 💻 软件与 IT 服务 —— 第 7 基于 ERNIE 5.0 强大的预训练基础构建,ERNIE 5.1 Preview 将总参数量压缩至前代的约 1/3,激活参数量压缩至约 1/2,同时仅使用同类模型约 6% 的预训练成本 —— 在其规模下实现了领先的基础性能。 立即体验 👉 https://ernie.baidu.com/ 更多新模型即将推出 —— 敬请期待 👀

    推荐理由:ERNIE 5.1 Preview 把参数量砍到前代的 1/3,性能还稳住了,6% 的训练成本近乎白嫖,国产模型打榜的意义不大,但这效率提升对做应用落地的人来说是实打实的好处。

  2. 公众号:蚂蚁百灵(Ling)62

    Ling-2.6-1T 正式开源:面向复杂任务的万亿级综合旗舰模型

    Ling-2.6-1T 于上周发布,今日正式开源。该模型定位为面向复杂任务的万亿级综合旗舰模型。

    推荐理由:蚂蚁开源万亿参数模型 Ling-2.6-1T,虽然一个多月后才看到,但这是目前国内参数最大的综合性基座,做复杂多模态 agent 的团队可以直接拿来用,省去从头训练的麻烦。

  3. Ant Ling72

    SGLang团队(隶属于LMSYS Org)揭示了其旗舰指令模型实现快速、高效、大规模执行的关键在于可靠的基础设施与针对性优化。团队宣布对AntLingAGI发布的Ling-2.6-1T万亿参数模型提供Day-0支持。该模型采用快速思考方法,在保持质量的同时,成本可比同类模型降低约4倍,并在AIME26和SWE-bench基准测试中达到SOTA水平。它专为高级编码、复杂推理和大规模智能体工作流设计,具备万亿参数能力与即时模型延迟。团队正持续进行优化,以进一步提升性能。

    引用LMSYS Org@lmsysorg

    👏 认识来自 @AntLingAGI 的 Ling-2.6-1T,这是一款万亿参数旗舰即时指令模型,专为大规模下的快速执行与高效率而打造。Day-0 支持现已在 SGLang 上线! 1️⃣ 快速思考方式:比同类模型便宜约 4 倍,质量毫不妥协 2️⃣ 在 AIME26 与 SWE-bench Verified 上达到 SOTA 3️⃣ 专为高级编程、复杂推理与大规模智能体工作流而打造 4️⃣ 万亿参数能力,即时模型延迟 Cookbook:https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-2.6

    推荐理由:万亿参数做到即时延迟和4倍成本优势,还有SWE-bench SOTA,这份承诺如果兑现,会改变大规模Agent部署的性价比计算。值得去cookbook跑一下验证。

  4. Ant Ling61

    AntLingAGI 开源了 Ling-2.6-1T 模型,这是一个面向现实世界智能体工作流程的新旗舰模型。作为 1T 参数规模模型的先驱,团队强调了硬件、软件与 LLM 协同设计的重要性。vLLM 项目从发布首日(Day-0)起即提供支持,体现了顶尖工程生态系统的协作。这种合作旨在实现最佳的优化效果与用户体验,共同推动技术进步。

    引用vLLM@vllm_project

    恭喜 @AntLingAGI 开源发布 Ling-2.6-1T!🎉 面向真实世界智能体工作流的新旗舰——Day-0 vLLM 支持已就绪。 📖 http://recipes.vllm.ai/inclusionAI/Ling-2.6-1T

    推荐理由:vLLM 对 1T 模型的 Day-0 适配,说明开源推理栈对大尺寸模型的跟进速度越来越快,做私有化部署的可以直接参考官配 recipe 跑起来。

  5. Mistral AI:News(网页)72

    Mistral 发布 Mistral Medium 3.5 及云端异步智能体

    Mistral 发布 128B 稠密模型 Mistral Medium 3.5,采用修改版 MIT 许可开放权重,SWE-Bench Verified 得分 77.6%,成为 Mistral Vibe 与 Le Chat 的默认模型。

    推荐理由:原文给出具体跑分、定价和开放权重细节,能帮助读者评估这款 128B 模型在自托管与智能体场景的可用性。

4月29日周三
  1. Ant Ling71

    AntLingAGI正式开源其万亿参数旗舰模型Ling-2.6-1T。该模型采用总参数1万亿、激活参数630亿的架构,核心设计理念是“令牌高效”,旨在以极低的令牌开销实现顶尖智能。它通过“快速思考”机制优化,具备可靠的多步骤执行能力,在指令遵循、工具使用和上下文控制方面表现优异。模型为实际生产需求优化,部署便捷,兼容广泛的智能体框架,适用于从代码生成到错误修复等多种任务。

    引用Ant Ling@AntLingAGI

    🚀 今天,我们推出 Ling-2.6-1T,一款专为精确执行指令任务而设计的万亿参数旗舰模型。通过优先采用“快速思考”机制,它以超低 token 开销实现 SOTA 智能,让 token 效率成为一等公民。

    推荐理由:蚂蚁把万亿参数模型开源了,但强调的不是大,而是省 token,这对成本敏感的生产环境是真正的性价比之选,做 agent 的可以上手测测。

  2. Tencent Hy67

    腾讯开源了Hy-MT1.5-1.8B-1.25bit翻译模型,其参数量为18亿,经量化后仅440MB,可在手机上完全离线运行。该模型支持33种语言、5种方言及1056个翻译方向,包括藏语、蒙古语等少数语言。在标准测试中,其性能媲美商业翻译API和2350亿参数的大模型。通过量化至1.25比特,模型内存占用从FP16格式的3.3GB大幅降低,比之前的1.67比特方法体积缩小25%、速度提升约10%,且无精度损失。该模型已在国际机器翻译竞赛中获得30项第一,并部署于腾讯多个产品中。

    推荐理由:440MB的模型能在手机上跑33种语言翻译,还宣称比谷歌翻译强,这个量化技术让离线翻译不再是‘能看不能用’,出差党可以试试看。

  3. Xiaomi MiMo60

    小米MiMo-V2.5-Pro模型在最新Arena排行榜中表现卓越。在Text Arena(Expert)榜单中,它位列全球第六,同时是开源模型与中文模型的双料第一,其所属实验室全球排名第三。该模型在Text Arena(Overall)总榜中排名开源全球第二,在Code Arena(WebDev)前端开发榜单中位列开源全球第三。此外,它在Text Arena的四个关键子类别(Hard Prompts、英文Hard Prompts、指令遵循与长查询)中均获得开源全球第一。这些成绩均基于真实用户偏好与社区盲投评估,体现了模型在复杂任务上的强大综合能力。

    推荐理由:小米MiMo-V2.5-Pro冲到Arena开源第一,虽然排名更新晚了几天,但这是国产模型在硬核评测里最好的成绩,做选型的现在该认真看看小米。

  4. SenseTime65

    是的,SenseNova U1 现已在 Hugging Face 和 GitHub 上发布! 探索它如何以语义精确性和像素级保真度实现复杂的 #信息图 创作。 Hugging Face: https://huggingface.co/collections/sensenova/sensenova-u1 GitHub: https://github.com/OpenSenseNova/SenseNova-U1 Discord: https://discord.gg/cxkwXWjp

    引用AK@_akhaliq

    SenseNova U1 已在 Hugging Face 上线 https://huggingface.co/collections/sensenova/sensenova-u1

    推荐理由:SenseNova U1 开源了,能生成像素级精准的信息图,对于做电商和可视化的人是个直接可用的工具,值得跑一下看看实际表现。