推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。
模型发布
全部主题新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
最新精选
第 241–260 条 · 共 710 条
AI at Meta@AIatMeta精选AI 评分7575
Cognition 模型 / Devin 博客(网页)精选AI 评分6767 Cognition 发布 SWE-1.7 模型并详解 RL 训练方法
Cognition 发布 SWE-1.7,称其以更低成本达到前沿智能水平。模型基于 Kimi K2.7 底座训练,FrontierCode 1.1 Main 通过率 42.3%,Terminal-Bench 2.1 为 81.5%,已在 Devin(Web、Desktop 和 CLI)中经 Cerebras 以 1000 TPS 提供。
推荐理由:官方既公布基准成绩也详解训练方法,读者可以了解多集群 RL 训练、熵稳定和自压缩等具体做法。
公众号:腾讯混元精选AI 评分7070 腾讯混元 Hy3 正式发布:智能体与产品体验显著提升
腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。
推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。
公众号:腾讯混元精选AI 评分8585 腾讯混元正式发布 Hy3,Agent 能力与产品体验跃升
腾讯混元正式发布 Hy3,在推理、智能体、长上下文等任务上比肩参数规模 2~5 倍的旗舰模型。内部盲测中 Hy3 均分 2.67/4,优于 GLM5.1 的 2.51/4;幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。
推荐理由:Hy3 用 8 个业务线的实测数值(幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 升至 90%)说明模型从榜单到生产可用的差距具体落在哪里。
公众号:通义实验室(千问)精选AI 评分7373 Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先
通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。
推荐理由:Fun-ASR Realtime把多语言方言和流式一体化做得很扎实,特别是对东亚东南亚的优化,准确率提升明显,做语音应用的产品人可以直接关注。
公众号:通义实验室(千问)精选AI 评分6565 Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言,流式识别准确率接近离线水平
通义实验室发布 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,在工业级方言测评 inhouse 上取得 87.8% 的语义准确率。该模型支持动态注入热词与对话上下文实现语义消歧,首字延迟控制在百毫秒级别,流式识别准确率接近离线水平,并支持多语言无缝切换。API 现已上线阿里云百炼平台。
推荐理由:多语言方言的流式识别将语音交互的可用边界从英语推向了东亚与方言市场,使原先因识别不准而难以落地的本地化客服、语音助手等应用获得了新的技术基础。
公众号:龙猫LongCat(美团)精选AI 评分7171 美团开源万亿参数模型 LongCat-2.0,同步开放国产卡推理代码
美团正式开源万亿参数大模型 LongCat-2.0,总参数 1.6T、平均激活约 48B,面向真实 Agentic Coding 任务,官方称在五万卡国产算力集群上完成推理。
推荐理由:官方公布模型参数结构、三项关键优化和开源链接,可据此评估其在国内存量算力上的部署可行性。
Meituan LongCat@Meituan_LongCat精选AI 评分8181
引用Meituan LongCat@Meituan_LongCat正式推出 LongCat-2.0 🐱 1.6T 参数 · MoE 架构,约 48B 活跃参数 · 1M 上下文窗口 这是 @OpenRouter 上 Owl Alpha 背后的完整模型——现已开放使用。 从头为智能体编码而构建: ◆ LongCat 稀疏注意力(LSA)——高效扩展至 1M 上下文 token ◆ 零计算专家——每个 token 动态激活 33B–56B 参数,零计算浪费 ◆ MOPD——三个专精专家组(智能体 / 推理 / 交互),按任务通过门控路由 性能对比: → Terminal-Bench 2.1:70.8 → SWE-bench Pro:59.5(GPT-5.5:58.6) → SWE-bench Multilingual:77.3 → FORTE:73.2 · RWSearch:78.8 · BrowseComp:79.9 📖 技术博客:https://longcat.chat/blog/longcat-2.0/ 在不同场景中试用 🧵👇
推荐理由:国内大厂首个在 SWE-bench Pro 上超过 GPT-5.5 的开源模型,MIT 协议无任何限制,搞 agentic coding 的团队可以直接用,是个重要转折。
公众号:生数科技(Vidu·视频)精选AI 评分7070 生数科技发布 Vidu S1,推动视频生成迈向“实时交互”新时代
7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。
推荐理由:Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。
Mistral AI:News(网页)精选AI 评分6565 Mistral AI 发布 Leanstral 1.5:6B 激活参数的 Lean 4 形式化证明模型
Mistral AI 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活参数 6B,用于 Lean 4 形式化证明工程。
推荐理由:原文给出基准成绩、成本对比和真实仓库找 bug 的案例,读者可评估它在形式化验证工作流中的实际可用性。
腾讯混元:Research(API)精选AI 评分6969 腾讯混元正式发布Hy3模型
腾讯混元于7月6日正式发布Hy3模型。相比preview版,任务解决率从72%升至90%,平均耗时缩短34%;幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮问题率从17.4%降至7.9%,长对话基准MRCR从42.9%升至75.1%。在270位专家盲测中均分2.67/4,优于GLM5.1的2.51/4。API价格为输入1元/百万tokens、输出4元、缓存命中0.25元。模型已基于Apache 2.0协议开源。
推荐理由:腾讯混元重建后的正式版,幻觉率砍半,工具调用稳定性大幅提升,内部盲测压过GLM5.1。做Agent和内部工具的团队值得重新评估这个高性价比选项。
MarkTechPost(RSS)精选AI 评分7373 NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型
NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。
推荐理由:NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。
公众号:龙猫LongCat(美团)精选AI 评分8282 美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型
美团于6月30日发布新一代万亿参数大模型LongCat-2.0并开源。总参数1.6T,平均激活约48B,原生支持1M超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用LSA稀疏注意力、零计算专家、ScMoE及MOPD多专家融合(Agent/Reasoning/Interaction三组专家)架构。评测中SWE-bench Pro获59.5,SWE-bench Multilingual获77.3。预览版已通过OpenRouter和longcat.ai开放,月调用量跻身OpenRouter全球前三。
推荐理由:国产算力上首个全流程自训的万亿开源模型,1M上下文和动态专家架构直指Agentic Coding场景,OpenRouter调用量已经冲到前三,不是Demo是生产力。
Anthropic:Newsroom(网页)精选AI 评分7171 重新部署 Claude Fable 5
美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。
推荐理由:Fable 5重新上线只是表面,真正重要的是Anthropic借机提出了一套行业通用的jailbreak严重性框架,并拉上亚马逊、微软、谷歌,这可能会成为前沿模型发布的新安全标杆。
公众号:龙猫LongCat(美团)精选AI 评分7878 美团发布 LongCat-2.0:五万卡国产算力集群训练与推理的万亿参数开源模型
美团6月30日发布并开源万亿参数大模型 LongCat-2.0,总参数1.6T、平均激活约48B,为业界首个在五万卡国产算力集群上完成全流程训练与推理的模型,原生支持1M超长上下文。
推荐理由:在五万卡国产算力集群上稳定训练万亿参数 MoE 并达到前沿编程能力的工程实践,为算力受限场景下的模型架构设计提供了可参照的技术路线。
Claude Code:GitHub Releases(RSS)精选AI 评分8181 Claude Code v2.1.197 发布:默认模型升级为 Claude Sonnet 5,支持原生 1M-token 上下文窗口
Claude Code v2.1.197 更新将 Claude Sonnet 5 设为默认模型,原生支持 1M-token 上下文窗口。该版本提供促销定价,输入 $2/M tokens、输出 $10/M tokens,持续至 8 月 31 日。用户更新至 v2.1.197 即可启用。
推荐理由:Sonnet 5 把中端模型的上下文干到 1M token,促销价让 Claude Code 性价比突然很能打,用 Claude 写代码的可以无脑升了。
Claude@claudeai精选AI 评分7373介绍 Claude Sonnet 5,这是迄今为止最具智能体能力的 Sonnet。 它会制定计划、使用浏览器和终端等工具,并以几个月前还需要更大、更昂贵模型才能达到的水平自主运行。

推荐理由:Sonnet 5 把浏览器和终端直接内建为工具,中端模型首次跑通自主执行链路,我觉得很多之前因为成本没上的 agent 方案可以重新算账了。
OpenRouter@OpenRouter精选AI 评分7373
推荐理由:Anthropic 把旗舰智能放进 Sonnet 定价,代理编码的可靠性明显提升,这个早期信号对做 AI 产品的团队意味着成本与性能需要重新计算。
Anthropic:Newsroom(网页)精选AI 评分8181 Claude Sonnet 5 发布
Claude Sonnet 5 是 Anthropic 推出的最新 Sonnet 模型,具备计划、浏览器和终端工具使用能力,可自主运行。性能接近 Opus 4.8,定价更低:即日起至 2026 年 8 月 31 日,输入 token $2/百万,输出 $10/百万,之后恢复为 $3/百万输入和 $15/百万输出。相比 Sonnet 4.6,在推理、工具使用、编程和知识工作等智能体能力上大幅提升。在 BrowseComp 和 OSWorld-Verified 评测中严格优于 Sonnet 4.6。安全评估显示不良行为率更低,幻觉和谄媚减少,但网络安全能力弱于 Opus 4.8。即日起在所有套餐及 Claude Code、Claude API 中可用。
推荐理由:Claude Sonnet 5 把代理能力从 Opus 下放到了 Sonnet,性能接近 Opus 4.8 但价格只有三分之一,这对开发者来说性价比飞跃。虽然还不是最强,但已经能让许多复杂任务从勉强可用变成可靠。
Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash
Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为 Nano Banana 系列速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio、Gemini API 及消费者产品(AI Mode in Search、Gemini app 等)。同时推出 Gemini Omni Flash(gemini-omni-flash-preview),支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒,面向开发者开放 API。
推荐理由:Nano Banana 2 Lite 把图像生成拉到 4 秒延迟和 0.034 美元单价,很适合高频草稿流,Omni Flash 首次对开发者开放视频生成和对话编辑,两个模型串起来的快速迭代工作流是这次最实用的更新。