跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 161–180 条 · 共 710 条
7月27日周一
  1. Modal 官方工程博客(RSS)78

    Moonshot 发布 2.8T 参数开源多模态模型 Kimi K3,Modal 实现发布当天 460 tokens/s 推理

    Moonshot 发布 Kimi K3,总参数 2.8T、每 token 激活 16/896 专家,支持 1M token 上下文窗口和原生视觉。Modal 与 Moonshot、vLLM 合作提供 Day 0 支持,通过定制的 DFlash 投机解码模型将智能体负载交互速度从 100 提升到 460 tokens/s,吞吐从 800k 提升到 1.5M TPM/GPU。

    推荐理由:Modal 作为发布当天的托管方,给出了 K3 架构细节与推理加速数据,读者可据此评估运行这级开源模型的工程门槛。

7月25日周六
  1. 公众号:数字生命卡兹克64

    Claude Opus 5 发布,以一半价格逼近 Fable 5

    Anthropic 发布 Claude Opus 5,已全量上线,支持 100 万上下文,知识截止至 2026 年 5 月。在 ARC-AGI-3 上得分 30.2%,接近 GPT-5.6 Sol(7.8%)的四倍;输入每百万 Token 5 美元、输出每百万 Token 25 美元,价格与 Opus 4.8 相同,仅为 Fable 5 的一半。

    推荐理由:卡兹克第一时间上手 Claude Opus 5,用实测撕开官方跑分的伪装,发现它在实际工程中的漏洞,并点出 Anthropic 删掉 80% 系统提示的趋势——模型变聪明了,过去那些繁琐的 Skill 该扔了。

  2. Midjourney:Updates(RSS)73

    Midjourney V8.2 发布:专注美学提升与个性化理解

    Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。

    推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。

  3. Anthropic:Newsroom(网页)92

    Anthropic 发布 Claude Opus 5

    Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

    推荐理由:Anthropic 这次把 Opus 的性价比条拉满了,性能翻倍价格减半,实际编码和知识工作基准已经超越所有模型。最打动我的是它自查自纠的严谨,写代码像真开发者一样审自己的页面,这种责任心以前只在人身上见过。

7月24日周五
  1. 公众号:蚂蚁百灵(Ling)75

    蚂蚁百灵发布Ling-3.0-flash原生混合推理模型

    蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,并扩展至10,000+可交互训练环境,长输入下TTFT降低60%至80%以上。

    推荐理由:蚂蚁百灵用124B总参、5.1B激活做到对标1T模型,还开源加免费API,想要低成本跑强Agent的团队可以立刻试。

  2. HuggingFace Daily Papers(社区热门论文)77

    SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

    SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。

    推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。

  3. IT之家(RSS)73

    Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

    Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。

    推荐理由:FLUX 3 把图像、视频、音频塞进同一个架构,单次能出 20 秒带声视频,对比 Grok Video 胜率 69%,视频生成赛道的竞争又升温了。

  4. 蚂蚁百灵:Developer Blog(网页)55

    蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰

    蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。

    推荐理由:蚂蚁把124B模型的激活参数压到5.1B,还敢对标上代1T旗舰,如果实测不翻车,这个智能密度对端侧和低成本部署是个真信号。

7月23日周四
  1. Qwen79

    阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如[whisper]、[angry])、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。

    推荐理由:TTS 模型终于学会控制情感和语调了,Qwen 这次把自然语言提示和细粒度标签一起放进去,做语音助手的可以直接从‘能说话’跳进‘有性格’。

  2. Google AI:DEV 作者专属(RSS)73

    Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

    Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。

    推荐理由:Gemini 3.6 Flash 降本增效,3.5 Flash-Lite 主打低成本高速,弃用 temperature 等参数是个硬变更,使用 Gemini 的开发者必须检查迁移。

  3. Hacker News 热门(buzzing.cc 中文翻译)70

    Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

    Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。

    推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。

  4. Black Forest Labs:Blog(网页)59

    FLUX 3 发布:Black Forest Labs 多模态模型,支持原生音频、图像生成与动作预测

    Black Forest Labs 发布多模态模型 FLUX 3,面向视频领域,原生支持音频、图像生成与动作预测。该模型旨在成为视觉智能的骨干,目前官方已展示其能力与早期结果。

    推荐理由:Black Forest Labs 把图像、视频、音频拉通到一个模型里,这比单纯提升画质更有想象力,但目前只有一句简介,像个预告片,想真评估的还得等技术细节。

7月22日周三
  1. Josh Woodward69

    Google 推出三款新模型,旨在提升性能、降低延迟和成本。其中,3.6 Flash 在复杂编码任务上 token 用量最高减少 65%,3.5 Flash-Lite 速度达 350 输出 token/秒。3.6 Flash 和 3.5 Flash-Lite 已在 Gemini 应用上线,3.5 Pro 进入合作伙伴测试。

    引用Google DeepMind@GoogleDeepMind

    我们正在推出三款新模型,旨在让 AI 智能体在大规模应用中更快、更智能、更经济: 🔵 Gemini 3.6 Flash:它比 Gemini 3.5 Flash 使用更少的模型 token,就能以完全相同的成本提供更高质量的工作成果。 🔵 Gemini 3.5 Flash-Lite:一款快速、经济高效的选择,适用于处理文档和智能体搜索等日常任务。 🔵 Gemini 3.5 Flash Cyber:一款专为网络安全打造的模型,用于发现并修补关键软件漏洞。

    推荐理由:Google一口气扔出三个Gemini Flash新模型,3.6 Flash把复杂编码token砍了65%,做Agent的成本敏感型选手可以直接收益,Cyber模型专攻漏洞修复是个有意思的细分信号。

7月21日周二
  1. Google DeepMind:Blog(RSS)57

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 三款新模型

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 Gemini 3.6 Flash 为最新主力模型,3.5 Flash-Lite 主打更低成本与更高效率,3.5 Flash Cyber 则针对网络安全场景优化。三款模型均通过 Google AI 开发者平台提供 API 访问。

    推荐理由:Gemini Flash 系列常规更新,Flash-Lite 和 Cyber 变体值得 API 开发者留意,但细节还没出来,目前只能先标记。

  2. 公众号:小红书技术(dots.llm)81

    小红书 dots 模型获 IMO 2026 满分金牌

    小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。

    推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。

  3. 公众号:小红书技术(dots.llm)77

    小红书dots模型取得IMO 2026满分金牌成绩

    小红书dots团队携dots-note-3.0内部版本参加IMO 2026,六题均获满分7分,以42/42分取得满分金牌,全球仅7位人类选手获满分。该模型不依赖形式化语言,直接读取原始LaTeX题目,通过Proof、Verify、Refine三环节递归自我批判完成解题。dots-note-3.0是dots3系列最轻量级模型,预期将开源。

    推荐理由:dots模型在IMO满分验证了递归自我批判方法的有效性,这种不依赖形式化验证、通过自我质疑改进推理的路径,可能为科学研究等难以量化的复杂任务提供新的解决思路。

  4. Qwen:Blog Retrieval(API)77

    通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为“实”

    通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。

    推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。