GPT-5.5 Instant 开始向所有 ChatGPT 用户推出。 更简洁。记忆更佳。更个性化。 而且对话体验顺畅得多。真的。
推荐理由:GPT-5.5 Instant 不是 GPT-5,但对每天用 ChatGPT 的人来说,更简洁、更好记忆这些改动比跑分提升更实在,值得等推送。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
GPT-5.5 Instant 开始向所有 ChatGPT 用户推出。 更简洁。记忆更佳。更个性化。 而且对话体验顺畅得多。真的。
推荐理由:GPT-5.5 Instant 不是 GPT-5,但对每天用 ChatGPT 的人来说,更简洁、更好记忆这些改动比跑分提升更实在,值得等推送。
推荐理由:GPT-5.5 Instant 是 OpenAI 给所有人的即时升级,更聪明更自然还更简洁,这可能是 ChatGPT 推出以来最接地气的版本迭代。
ChatGPT的默认模型已更新为GPT-5.5 Instant。新版模型能提供更智能、更准确的答案,并有效减少了幻觉现象。同时,用户获得了更强的个性化控制能力,使交互体验更贴合个人需求。此次升级标志着模型在理解精度与响应定制化方面取得了显著进步。
推荐理由:ChatGPT默认模型替换为GPT-5.5 Instant,不只是变聪明,幻觉减少和个性化控制才是真改进,每个用户都能马上感觉到不同。
推荐理由:Grok 4.3 登顶 agentic tool calling 榜,定价有竞争力,做 agent 的值得认真看。虽然不算顶级发布,但 xAI 靠性能价格组合可能抢下不少性价比敏感开发者。
DeepSeek发布了V4版本模型,其性能已接近行业最前沿水平,但在价格上具有显著优势,仅为主要竞争对手的一小部分。该模型在多项基准测试中表现出色,能以极低的成本提供顶级的AI能力,有望大幅降低企业和开发者的使用门槛,推动AI技术的更广泛普及。
推荐理由:Simon Willison 实测结论很直白,DeepSeek V4 性能几乎摸到前沿,价格却便宜一个量级,对预算卡死的团队是重大利好。
x.ai 正式发布了 Grok 4.3 模型,开发者可通过官方文档获取详细信息。该模型在 Hacker News 社区获得关注,相关帖子收获了 100 点热度。此次发布标志着 Grok 系列模型的持续迭代更新。
推荐理由:xAI 的 Grok 4.3 如期而至,性能和对标都写在文档里了,想了解最新大模型实力的开发者值得花五分钟看一眼。
推荐理由:Grok-4.3 降价但性能反升,agentic 跑分直接到 1500,如果之前觉得 Grok 贵而没试过,这次可以上车了。
Midjourney V8.1 版本现已登陆 Discord 平台及其官方网站。本次更新重点提升了图像的清晰度与整体画质,这一改进在风格参考(SREF)和情绪板(Moodboards)功能中效果最为显著,同时所有类型的图像生成质量均有所增强,为用户带来更精细的视觉体验。
推荐理由:Midjourney V8.1 只是个小版本迭代,主要提升锐度和图像质量,用惯了 V8 的可以不急着换,但玩 SREF 和 Moodboard 的值得试一下,细节确实有提升。
Google正式发布Gemini Embedding 2统一嵌入模型,该模型能将文本、图像、视频、音频和文档映射到同一语义空间。开发者可通过单请求处理交织多模态输入,显著提升智能RAG、视觉搜索等内容审核任务的性能。模型支持超100种语言,并提供任务特定前缀和马特廖什卡降维等特性,为构建复杂AI智能体提供高效精准的基础。
推荐理由:开发者做多模态RAG的苦日子结束了,Gemini Embedding 2把文本、图片、视频塞进同一个语义空间,还自带Matryoshka降维,直接省掉一堆胶水代码。
上周,我们发布了 Ling-2.6-1T。今天,Ling-2.6-1T 正式成为开源模型~ 🤗 总参数 1T · 激活参数 63B 我们通过让测试、部署、定制和构建变得更简单,为开发者带来价值。 这款模型针对实际生产需求进行了“模型 token 效率”优化: • 更低的 token 开销:无需长推理链即可实现强大的智能 • 可靠的多步执行:更好的指令、工具、上下文和工作流控制 • 生产级部署:从代码生成到 bug 修复,兼容广泛的 Agent 框架 提前一瞥 @opencode 中的智能体能力
推荐理由:1T参数开源模型不是天天有,蚂蚁这个Ling-2.6-1T强调token效率和Agent能力,做Agent的可以直接去Hugging Face上跑一下,看看是不是真的在生产环境省token。
推荐理由:Google 第一个原生多模态嵌入模型,把文本、图像、视频拉到同一个向量空间,做跨模态搜索的开发者可以不用再手动打标签了,但离「无感理解」还有距离。
隆重推出 ERNIE 5.1 Preview —— 现已上线!🚀 在 @arena 的 Text Arena 中全球排名第 13,在中国实验室中排名第 1。 在以下领域跻身全球前 10: 📐 数学 —— 第 9 ⚖️ 法律与政府 —— 第 1 💼 商业、管理与金融运营 —— 第 4 💻 软件与 IT 服务 —— 第 7 基于 ERNIE 5.0 强大的预训练基础构建,ERNIE 5.1 Preview 将总参数量压缩至前代的约 1/3,激活参数量压缩至约 1/2,同时仅使用同类模型约 6% 的预训练成本 —— 在其规模下实现了领先的基础性能。 立即体验 👉 https://ernie.baidu.com/ 更多新模型即将推出 —— 敬请期待 👀
推荐理由:ERNIE 5.1 Preview 把参数量砍到前代的 1/3,性能还稳住了,6% 的训练成本近乎白嫖,国产模型打榜的意义不大,但这效率提升对做应用落地的人来说是实打实的好处。
Ling-2.6-1T 于上周发布,今日正式开源。该模型定位为面向复杂任务的万亿级综合旗舰模型。
推荐理由:蚂蚁开源万亿参数模型 Ling-2.6-1T,虽然一个多月后才看到,但这是目前国内参数最大的综合性基座,做复杂多模态 agent 的团队可以直接拿来用,省去从头训练的麻烦。
👏 认识来自 @AntLingAGI 的 Ling-2.6-1T,这是一款万亿参数旗舰即时指令模型,专为大规模下的快速执行与高效率而打造。Day-0 支持现已在 SGLang 上线! 1️⃣ 快速思考方式:比同类模型便宜约 4 倍,质量毫不妥协 2️⃣ 在 AIME26 与 SWE-bench Verified 上达到 SOTA 3️⃣ 专为高级编程、复杂推理与大规模智能体工作流而打造 4️⃣ 万亿参数能力,即时模型延迟 Cookbook:https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-2.6
推荐理由:万亿参数做到即时延迟和4倍成本优势,还有SWE-bench SOTA,这份承诺如果兑现,会改变大规模Agent部署的性价比计算。值得去cookbook跑一下验证。
恭喜 @AntLingAGI 开源发布 Ling-2.6-1T!🎉 面向真实世界智能体工作流的新旗舰——Day-0 vLLM 支持已就绪。 📖 http://recipes.vllm.ai/inclusionAI/Ling-2.6-1T
推荐理由:vLLM 对 1T 模型的 Day-0 适配,说明开源推理栈对大尺寸模型的跟进速度越来越快,做私有化部署的可以直接参考官配 recipe 跑起来。
Mistral 发布 128B 稠密模型 Mistral Medium 3.5,采用修改版 MIT 许可开放权重,SWE-Bench Verified 得分 77.6%,成为 Mistral Vibe 与 Le Chat 的默认模型。
推荐理由:原文给出具体跑分、定价和开放权重细节,能帮助读者评估这款 128B 模型在自托管与智能体场景的可用性。
🚀 今天,我们推出 Ling-2.6-1T,一款专为精确执行指令任务而设计的万亿参数旗舰模型。通过优先采用“快速思考”机制,它以超低 token 开销实现 SOTA 智能,让 token 效率成为一等公民。
推荐理由:蚂蚁把万亿参数模型开源了,但强调的不是大,而是省 token,这对成本敏感的生产环境是真正的性价比之选,做 agent 的可以上手测测。


推荐理由:440MB的模型能在手机上跑33种语言翻译,还宣称比谷歌翻译强,这个量化技术让离线翻译不再是‘能看不能用’,出差党可以试试看。




推荐理由:小米MiMo-V2.5-Pro冲到Arena开源第一,虽然排名更新晚了几天,但这是国产模型在硬核评测里最好的成绩,做选型的现在该认真看看小米。
SenseNova U1 已在 Hugging Face 上线 https://huggingface.co/collections/sensenova/sensenova-u1
推荐理由:SenseNova U1 开源了,能生成像素级精准的信息图,对于做电商和可视化的人是个直接可用的工具,值得跑一下看看实际表现。