跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 521–540 条 · 共 710 条
4月23日周四
  1. 公众号:腾讯混元67

    Hy3 preview发布并开源:混元重建后首个模型,Agent能力大幅提升

    腾讯混元发布并开源Hy3 preview,这是其重建预训练与强化学习基础设施后训练的首个模型,也是迄今最智能的版本。该模型为快慢思考融合的混合专家架构,总参数295B,激活参数21B,支持256K上下文,在SWE-Bench Verified等代码与搜索智能体基准上取得强竞争力结果。模型权重已开源,腾讯云API个人版定价最低28元/月。

    推荐理由:混元重建后的第一枪,Agent能力大幅提升且直接开源,虽然已过首发热度,但对关注国产模型Agent能力的人还是个值得拉下来跑的repo。

  2. IT之家(RSS)70

    混元迄今最智能的模型:腾讯发布并开源 Hy3 preview 语言模型

    腾讯发布并开源其混元系列迄今最智能的Hy3 preview语言模型。该模型采用快慢思考融合的混合专家架构,总参数达2950亿,最大支持256K上下文长度。作为基础设施重建后首个模型,其在复杂推理、指令遵循、代码等能力上实现大幅提升,已应用于元宝、QQ、腾讯文档等内部产品,并支持OpenClaw等开源智能体。腾讯云同步推出API服务,输入价格最低每百万tokens 1.2元,同时提供个人版Token Plan套餐,月费最低28元可获3500万tokens额度。

    推荐理由:腾讯混元重建训练体系后的首个模型,295B总参但推理时只激活21B,性价比思路很实际,定价比同体量模型便宜一截,开发者值得试试。

  3. 蚂蚁百灵:Developer Blog(网页)67

    Ling-2.6-flash 发布:更快响应、更强执行、更高 Token Efficiency

    针对智能体任务中Token消耗快速增长的问题,Ling-2.6-flash模型正式发布。该模型采用混合线性架构等技术进行系统性优化,旨在实现更高推理效率和更低使用成本。其推理速度在4卡H20条件下最快可达340 tokens/s,在Artificial Analysis评测中仅消耗约对比模型1/10的Tokens。模型在多个Agent相关基准测试中达到同尺寸SOTA水平,保持了强大的任务执行与工具调用能力。

    推荐理由:蚂蚁百灵这次打的是「省 token」这张牌,104B 总参但只激活 7.4B,Agent 场景评测对齐同尺寸 SOTA,输出 token 消耗只有竞品的 1/10。做 Agent 产品、被推理成本卡脖子的团队值得认真看看这个路线。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)60

    ChatGPT Images 2.0 发布

    ChatGPT Images 2.0 推出了一个先进的图像生成模型,该模型在文本渲染、多语言支持和视觉推理能力方面均有显著提升。新版模型能够更精准地生成包含文字的图像,并支持多种语言文本输入。其视觉推理功能也得到增强,可更好地理解和执行复杂图像生成指令。此次升级标志着多模态AI生成质量的一次重要进步。

    推荐理由:ChatGPT Images 2.0 把文本渲染和多语言支持拉到了实用级别,对需要快速产出视觉素材的产品人是个实在的提升,只是缺乏效果对比让价值打了折扣。

  5. Simon Willison 博客71

    Qwen3.6-27B:27B 稠密模型实现旗舰级编程能力

    Qwen 发布 Qwen3.6-27B 开源模型,这款 27B 参数的稠密模型在编码基准测试中超越了上一代 397B 总参数/17B 激活参数的 MoE 旗舰模型 Qwen3.5-397B-A17B。模型体积从 807GB 大幅缩减至 55.6GB,16.8GB 的量化版本即可在本地运行,生成速度约 25 tokens/s。实测显示其能生成复杂的 SVG 图形代码,展现出旗舰级的编程能力。

    推荐理由:通义千问 3.6 27B 用 55GB 瘦身换来了超 397B MoE 的编码能力,Simon 亲手跑出的 SVG 效果惊艳,2026 年最值得本地部署的开源小模型。

  6. 公众号:小米 MiMo79

    Xiaomi MiMo-V2.5 系列大模型开启公测

    Xiaomi MiMo-V2.5 系列正式公测,包含 MiMo-V2.5、V2.5-Pro、TTS 与 ASR 等模型。其中 V2.5-Pro 在通用智能体、复杂软件工程等维度对标 Claude Opus 4.6、GPT-5.4,曾用 4.3 小时、672 次工具调用完成北大编译原理课程项目并获满分。

    推荐理由:在自主完成编译器构建和视频编辑器开发的长程任务演示中,展示了结构化的逐层搭建和自我修正能力,其效率对比数据有助于判断复杂Agent任务的成本边界。

  7. 字节 Seed:Research Feed(网页内嵌数据)61

    字节 Seed 发布 Seed3D 2.0,几何与 PBR 材质生成达 SOTA

    字节 Seed 正式发布 3D 生成大模型 Seed3D 2.0,在几何生成、纹理材质生成两项核心指标对比中均取得 SOTA 结果。模型采用 Coarse-to-Fine 两阶段 DiT 提升几何精度,统一 PBR 生成架构并引入 MoE 与 VLM 先验,还支持部件级生成、关节化建模与场景组合,输出可兼容 Isaac Sim 等仿真引擎;技术报告已公开,API 已上线火山引擎。

    推荐理由:官方博客给出两阶段 DiT、统一 PBR 等架构细节与人类盲评结果,读者可了解 3D 生成走向生产可用的具体路径。

4月21日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)81

    Kimi K2.6:推动开源编程发展

    Kimi发布K2.6版本,专注提升开源编程能力。新版本在代码生成与理解方面实现优化,发布后在Hacker News获得132个点赞。此次更新强化了Kimi在开发者工具领域的布局,通过改进编程辅助功能,为开源社区提供更高效的代码编写支持。

    推荐理由:Kimi K2.6 把长程编程和 Agent Swarm 能力带到了开源模型里,那几个 12 小时自主优化、13 小时重构旧代码库的工程案例比基准表更有说服力,做 Agent 的可以认真看看。

  2. Hacker News 热门(buzzing.cc 中文翻译)74

    Qwen 3.6-Max-Preview:更智能、更精准,仍在不断进化

    阿里通义千问团队发布Qwen 3.6-Max-Preview预览版大模型,主打更智能的推理能力与更精准的输出表现,目前仍处于快速迭代阶段。该版本在Hacker News社区获得121个赞,用户可通过官方博客了解详情并体验最新功能。作为Max系列的最新预览版本,模型在保持高性能的同时持续优化,具体技术细节和基准测试成绩尚未完全公布。

    推荐理由:通义千问新旗舰模型预览,agentic coding 多个 bench 冲到第一,虽然还不是正式版,但已经能通过 Studio 试用了,对做 coding agent 的团队是个实在信号。

4月20日周一
  1. 蚂蚁 inclusionAI:GitHub 新仓库69

    DR-Venus:基于开放数据的边缘级深度研究智能体

    DR-Venus 是一个仅用1万条开放数据训练的40亿参数深度研究智能体,基于Qwen3-4B-Thinking-2507架构,支持200步工具调用和超20万tokens的上下文。它通过监督微调与强化学习两阶段训练,在BrowseComp、GAIA等多个深度研究基准上树立了小模型性能新标杆。其SFT版本已超越多数同类开源模型,而RL版本进一步将长程任务可靠性和工具使用校准度提升2-3个百分点。项目已全面开源模型、代码与训练流程。

    推荐理由:4B 参数、仅用 1 万条公开数据就能在多个 deep research benchmark 上碾压 8B 对手,蚂蚁 inclusionAI 这次证明了小模型做 Agent 的关键不在参数量而在数据管线,做端侧 Agent 的团队值得拆一下它的 SFT+RL 流程。

4月17日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库56

    inclusionAI发布LLaDA2.0-Uni模型

    LLaDA2.0-Uni是一个统一的多模态模型,具备对世界的理解与生成能力。该模型通过整合视觉、语言等多模态信息,实现了跨模态的语义理解和内容生成。其架构支持从图像理解到文本生成、跨模态检索等复杂任务,标志着多模态人工智能向更通用、统一的方向演进。

    推荐理由:蚂蚁 inclusionAI 推出 LLaDA2.0-Uni,主打理解与生成统一架构,但距发布已过两周且信息极少,建议等官方技术报告出来再决定是否跟进。

  2. HuggingFace Daily Papers(社区热门论文)81

    Qwen3.5-Omni技术报告

    阿里通义千问团队发布Qwen3.5-Omni,模型拥有数百亿参数和256k上下文,基于超1亿小时音视频数据训练,在215项基准测试中达SOTA水平,关键音频任务超越Gemini-3.1 Pro。采用混合注意力MoE架构,支持10小时音频与400秒720P视频理解。提出ARIA技术优化流式语音合成稳定性,支持10种语言。模型具备Audio-Visual Vibe Coding能力,可直接基于音视频指令生成代码。

    推荐理由:Qwen3.5-Omni把语音、视频、文本全模态做到一个模型里,且在215项音频任务上超越Gemini 3.1 Pro,这是国内团队在全模态模型上的里程碑,做交互产品的值得关注。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)73

    OpenAI 发布 GPT-Rosalind,面向生命科学研究

    OpenAI发布面向生命科学的专业推理模型GPT-Rosalind。该模型专门针对药物发现、基因组学分析、蛋白质推理及科学研究工作流设计,旨在加速生物医药研发进程。作为前沿推理模型,GPT-Rosalind将AI能力深度应用于生命科学场景,为科研人员提供从基因数据分析到药物筛选的智能支持,提升复杂生物信息处理效率。

    推荐理由:OpenAI 第一个垂直领域推理模型,把前沿推理带进药物研发和基因组学,性能压过人类专家,生命科学工具链可能要从头搭起。

4月16日周四
  1. Anthropic:Newsroom(网页)79

    Claude Opus 4.7 正式发布

    Claude Opus 4.7 全面上线,在高级软件工程任务上实现重大飞跃,93项编码基准测试解决率较 Opus 4.6 提升 13%,并首次解决四项前代无法完成的难题。新版本支持更高分辨率图像识别,在研究代理基准测试中总分达 0.715,长上下文性能表现最为稳定。模型定价维持每百万输入 token 5 美元、输出 25 美元不变。出于安全考量,其网络攻击能力较 Claude Mythos Preview 有所削弱,并配备自动拦截高风险网络安全请求的防护机制,合法安全研究人员可通过 Cyber Verification Program 申请使用权限。

    推荐理由:Opus 4.7 不是最炫的模型,但多家真实用户反馈指出它在复杂工程任务上的可靠性提升是实打实的,尤其长链自主执行和指令遵循,对开发 Agent 的团队是一次直接的生产力升级。

  2. Hacker News 热门(buzzing.cc 中文翻译)84

    Qwen3.6-35B-A3B:具有能动编码能力的模型,现已向所有人开放

    阿里巴巴通义千问团队发布Qwen3.6-35B-A3B代码模型,总参数350亿、激活参数30亿,具备能动编码(Agentic Coding)能力,可自主规划并执行复杂编程任务。该模型采用MoE架构平衡性能与成本,现已完全开源并向公众免费开放。

    推荐理由:Qwen 这台 3B 活跃参数的 MoE 在 coding agent 上追平 27B 密集模型,效率惊人,对端侧部署和低成本 agent 应用是实打实的利好。

  3. 公众号:通义实验室(千问)62

    Qwen3.6-35B-A3B 开源!

    通义千问开源 Qwen3.6-35B-A3B,一款总参数 350 亿、推理仅激活 30 亿参数的稀疏 MoE 模型。其在 SWE-bench、Terminal-Bench 等编程基准上显著超越前代,并超越 270 亿参数的稠密模型;原生多模态,在 RefCOCO 上得分 92.0。

    推荐理由:千问又推轻量 MoE 模型,35B 总参激活仅 3B,小团队能跑,但正文就一句宣传语,缺技术细节,先观望。

  4. HuggingFace Daily Papers(社区热门论文)71

    Seedance 2.0:推进面向复杂世界的视频生成

    Seedance 2.0于2026年2月初在国内发布,作为原生多模态音视频生成模型,采用统一高效架构支持文本、图像、音频、视频四种输入。可生成4-15秒、480p/720p音视频,开放平台支持3视频+9图像+3音频的多模态参考,并提供Fast加速版本。相比前代全面提升基础生成与多模态性能,专家评估显示其已达行业领先水平。

    推荐理由:Seedance 2.0 把音视频联合生成真正推到了可用级别,支持多片段、多图片、多音频参考输入,对做视频的创作者是直接的生产力提升。

  5. Claude Platform:开发者版本说明(RSS)82

    Claude Opus 4.7 发布:复杂推理与智能体编码能力升级,定价不变

    Anthropic 发布 Claude Opus 4.7,定位为最强大的通用模型,擅长复杂推理与智能体编码,定价保持与 Opus 4.6 相同的 $5/$25 per MTok。

    推荐理由:Opus 4.7 发布,定价不变但加入了 task budgets 和高分辨率支持,对于构建 coding agent 的团队,这次更新相当于给模型装了进度条和显微镜。

  6. Google Blog:AI(RSS)70

    Gemini 3.1 Flash TTS:下一代表现力AI语音技术

    Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

    推荐理由:Google 把 TTS 的控制权交给了文本指令,音频标签这个设计让语音应用从'选择预设'变成'现场导演',对多模态应用是个实在的增强。

4月15日周三
  1. Midjourney:Updates(RSS)72

    V8.1 Alpha 发布

    V8.1 Alpha 版本正式发布,接替此前测试一个月的 V8.0 模型。该版本在视觉风格上回归 V7 的一致性审美,并针对 Moodboards 和 srefs 功能进行优化。此次迭代在保持熟悉交互体验的同时,进一步完善了模型的视觉生成能力。

    推荐理由:Midjourney V8.1 把 HD 模式提速 3 倍且变成默认,对设计师意味着每次出图成本骤降,探索速度接近 draft。加上图像提示回归,实用性跨了一大步。