跳到正文
北京时间

全部动态

今日 39 条
5月6日周三
  1. X:ChatGPT (@ChatGPT)83

    GPT-5.5即时版全面推送 更简洁智能

    GPT-5.5 Instant 开始向所有 ChatGPT 用户推出。 更简洁。记忆更佳。更个性化。 而且对话体验顺畅得多。真的。

    推荐理由:GPT-5.5 Instant 不是 GPT-5,但对每天用 ChatGPT 的人来说,更简洁、更好记忆这些改动比跑分提升更实在,值得等推送。

  2. X:OpenAI (@OpenAI)86

    GPT-5.5即时版开始推送升级

    GPT-5.5 Instant 正在 ChatGPT 中逐步推出。 这是一次重大升级,以更温暖、更自然的语调为您提供更智能、更清晰、更个性化的答案。 同时它也更加简洁,这正是我们所了解到的用户需求。我们相信您会喜欢与它对话。

    推荐理由:GPT-5.5 Instant 是 OpenAI 给所有人的即时升级,更聪明更自然还更简洁,这可能是 ChatGPT 推出以来最接地气的版本迭代。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)82

    GPT-5.5 Instant:更智能、更清晰、更个性化

    ChatGPT的默认模型已更新为GPT-5.5 Instant。新版模型能提供更智能、更准确的答案,并有效减少了幻觉现象。同时,用户获得了更强的个性化控制能力,使交互体验更贴合个人需求。此次升级标志着模型在理解精度与响应定制化方面取得了显著进步。

    推荐理由:ChatGPT默认模型替换为GPT-5.5 Instant,不只是变聪明,幻觉减少和个性化控制才是真改进,每个用户都能马上感觉到不同。

  4. X:SpaceXAI (@SpaceXAI)80

    Grok 4.3正式上线API 速度与智能双突破

    Grok 4.3 现已在 xAI API 上线。这是我们迄今为止最快、最智能的模型。 它在 @ArtificialAnlys 排行榜上的智能体工具调用和指令遵循方面位居榜首,并在 @ValsAI 的企业领域(如判例法和公司金融)中排名第一。 Grok 4.3 支持 100 万令牌的上下文窗口,定价为输入每百万令牌 1.25 美元,输出每百万令牌 2.50 美元。 创建 API 密钥并开始构建:http://console.x.ai/team/default/api-keys

    推荐理由:Grok 4.3 登顶 agentic tool calling 榜,定价有竞争力,做 agent 的值得认真看。虽然不算顶级发布,但 xAI 靠性能价格组合可能抢下不少性价比敏感开发者。

5月2日周六
  1. X:OpenAI (@OpenAI)76

    GPT-5.5发布一周创营收新高

    GPT-5.5发布已有一周,这已经是我们迄今为止最强大的模型发布。 API收入增长速度比以往任何版本都快两倍以上,而随着企业对智能编码工具的需求持续攀升,Codex在不到七天内收入翻倍。

    推荐理由:GPT-5.5首周收入增速超以往两倍,Codex七天翻番,这是企业市场对agentic coding的真实投票,比benchmark更有说服力。

5月1日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    Grok 4.3

    x.ai 正式发布了 Grok 4.3 模型,开发者可通过官方文档获取详细信息。该模型在 Hacker News 社区获得关注,相关帖子收获了 100 点热度。此次发布标志着 Grok 系列模型的持续迭代更新。

    推荐理由:xAI 的 Grok 4.3 如期而至,性能和对标都写在文档里了,想了解最新大模型实力的开发者值得花五分钟看一眼。

  2. X:OpenRouter (@OpenRouter)68

    Grok-4.3上线OpenRouter 性价比提升显著

    @xai 的新模型 Grok-4.3 现已在 OpenRouter 上线! Grok-4.3 以比 Grok-4.2 更低的价格发布,同时在代理性能上实现大幅跃升:在 @ArtificialAnlys 的 GDPval-AA 基准上 ELO 分数提升 321 点至 1500,尽管价格更低,但仍超越了其他顶级模型。

    推荐理由:Grok-4.3 降价但性能反升,agentic 跑分直接到 1500,如果之前觉得 Grok 贵而没试过,这次可以上车了。

  3. X:蚂蚁百灵 (@AntLingAGI)76

    AntLingAGI开源Ling-2.6-1T模型,登陆Hugging Face平台

    AntLingAGI团队宣布Ling-2.6-1T模型正式开源,已登陆Hugging Face平台,并通过Novita Labs提供官方推理体验。该模型采用混合专家架构,总参数1万亿、激活参数630亿,核心优化方向为“令牌效率”以满足真实生产需求。具体表现为:低令牌开销,能在无需冗长推理链的情况下保持强大智能;可靠的多步执行能力,提升指令、工具、上下文和工作流的控制水平;生产就绪的部署特性,覆盖从代码生成到错误修复的任务,并广泛兼容各类智能体框架。团队旨在通过降低测试、部署、定制和构建的难度,为开发者创造价值。

    推荐理由:1T参数开源模型不是天天有,蚂蚁这个Ling-2.6-1T强调token效率和Agent能力,做Agent的可以直接去Hugging Face上跑一下,看看是不是真的在生产环境省token。

  4. X:Google AI (@GoogleAI)69

    谷歌发布首个原生多模态嵌入模型Gemini Embedding 2

    谷歌上周正式向公众发布了其首个原生多模态嵌入模型Gemini Embedding 2。该模型如同“通用翻译器”,能将文本、图像、视频和音频数据转化为独特的数字向量。其核心突破在于不再依赖关键词匹配,而是基于语义将不同模态的数据映射到同一空间,从而理解内容间的深层联系。开发者已利用该模型构建视频分析工具、视觉购物助手等应用,实现通过拍照或描述场景进行智能搜索的功能。模型现可通过Gemini API或Gemini Enterprise Agent平台使用。

    推荐理由:Google 第一个原生多模态嵌入模型,把文本、图像、视频拉到同一个向量空间,做跨模态搜索的开发者可以不用再手动打标签了,但离「无感理解」还有距离。

4月30日周四
  1. IT之家(RSS)72

    DeepSeek 公布多模态模型技术报告

    DeepSeek发布了多模态大模型及技术报告,提出创新的“基于视觉原语的思考”框架。该框架将点、边界框等视觉元素作为推理的基本单元,旨在解决多模态模型在空间参照任务中存在的“参照鸿沟”核心问题,使模型能将抽象认知锚定到图像的具体坐标上。尽管模型规模紧凑且图像标记预算较低,其在多项挑战性计数和空间推理基准测试上的性能,可与GPT-5.4等前沿模型相媲美。

    推荐理由:DeepSeek 把视觉概念直接变成推理单元,绕开了语言描述空间的先天模糊,在空间推理上把自家紧凑模型拉到和 GPT-5.4 一个水平,做多模态应用的人值得细读。

  2. X:百度 Baidu (@Baidu_Inc)65

    ERNIE 5.1 Preview发布,架构更轻性能更强

    百度ERNIE 5.1 Preview模型正式上线。该模型采用更轻量高效的架构,在总参数量压缩至前代约1/3、激活参数量约1/2的同时,仅消耗可比模型约6%的预训练成本,实现了在其规模下的领先基础性能。根据@arena的Text Arena榜单,ERNIE 5.1 Preview在全球总排名第13位,并位列中国实验室第一。其在多个细分领域进入全球前十,特别是在法律与政府领域排名第一。百度预告将在2026年的Baidu Create大会上发布更多ERNIE模型更新。

    推荐理由:ERNIE 5.1 Preview 把参数量砍到前代的 1/3,性能还稳住了,6% 的训练成本近乎白嫖,国产模型打榜的意义不大,但这效率提升对做应用落地的人来说是实打实的好处。

  3. 公众号:蚂蚁百灵(Ling)62

    Ling-2.6-1T 正式开源:面向复杂任务的万亿级综合旗舰模型

    Ling-2.6-1T 于上周发布,今日正式开源。该模型定位为面向复杂任务的万亿级综合旗舰模型。

    推荐理由:蚂蚁开源万亿参数模型 Ling-2.6-1T,虽然一个多月后才看到,但这是目前国内参数最大的综合性基座,做复杂多模态 agent 的团队可以直接拿来用,省去从头训练的麻烦。

  4. X:蚂蚁百灵 (@AntLingAGI)72

    旗舰指令模型快速高效执行的秘诀:可靠基础设施与优化

    SGLang团队(隶属于LMSYS Org)揭示了其旗舰指令模型实现快速、高效、大规模执行的关键在于可靠的基础设施与针对性优化。团队宣布对AntLingAGI发布的Ling-2.6-1T万亿参数模型提供Day-0支持。该模型采用快速思考方法,在保持质量的同时,成本可比同类模型降低约4倍,并在AIME26和SWE-bench基准测试中达到SOTA水平。它专为高级编码、复杂推理和大规模智能体工作流设计,具备万亿参数能力与即时模型延迟。团队正持续进行优化,以进一步提升性能。

    推荐理由:万亿参数做到即时延迟和4倍成本优势,还有SWE-bench SOTA,这份承诺如果兑现,会改变大规模Agent部署的性价比计算。值得去cookbook跑一下验证。

  5. Mistral AI:News(网页)72

    Mistral 发布 Mistral Medium 3.5 及云端异步智能体

    Mistral 发布 128B 稠密模型 Mistral Medium 3.5,采用修改版 MIT 许可开放权重,SWE-Bench Verified 得分 77.6%,成为 Mistral Vibe 与 Le Chat 的默认模型。

    推荐理由:原文给出具体跑分、定价和开放权重细节,能帮助读者评估这款 128B 模型在自托管与智能体场景的可用性。

4月29日周三
  1. X:蚂蚁百灵 (@AntLingAGI)71

    Ling-2.6-1T万亿参数模型开源,主打令牌高效

    AntLingAGI正式开源其万亿参数旗舰模型Ling-2.6-1T。该模型采用总参数1万亿、激活参数630亿的架构,核心设计理念是“令牌高效”,旨在以极低的令牌开销实现顶尖智能。它通过“快速思考”机制优化,具备可靠的多步骤执行能力,在指令遵循、工具使用和上下文控制方面表现优异。模型为实际生产需求优化,部署便捷,兼容广泛的智能体框架,适用于从代码生成到错误修复等多种任务。

    推荐理由:蚂蚁把万亿参数模型开源了,但强调的不是大,而是省 token,这对成本敏感的生产环境是真正的性价比之选,做 agent 的可以上手测测。

  2. X:腾讯混元 (@TencentHunyuan)67

    腾讯开源Hy-MT1.5-1.8B-1.25bit翻译模型,440MB体积支持手机离线运行

    腾讯开源了Hy-MT1.5-1.8B-1.25bit翻译模型,其参数量为18亿,经量化后仅440MB,可在手机上完全离线运行。该模型支持33种语言、5种方言及1056个翻译方向,包括藏语、蒙古语等少数语言。在标准测试中,其性能媲美商业翻译API和2350亿参数的大模型。通过量化至1.25比特,模型内存占用从FP16格式的3.3GB大幅降低,比之前的1.67比特方法体积缩小25%、速度提升约10%,且无精度损失。该模型已在国际机器翻译竞赛中获得30项第一,并部署于腾讯多个产品中。

    推荐理由:440MB的模型能在手机上跑33种语言翻译,还宣称比谷歌翻译强,这个量化技术让离线翻译不再是‘能看不能用’,出差党可以试试看。

  3. X:商汤 SenseTime (@SenseTime_AI)65

    SenseNova U1上线Hugging Face与GitHub

    是的,SenseNova U1 现已在 Hugging Face 和 GitHub 上发布! 探索它如何以语义精确性和像素级保真度实现复杂的 #信息图 创作。 Hugging Face: https://huggingface.co/collections/sensenova/sensenova-u1 GitHub: https://github.com/OpenSenseNova/SenseNova-U1 Discord: https://discord.gg/cxkwXWjp

    推荐理由:SenseNova U1 开源了,能生成像素级精准的信息图,对于做电商和可视化的人是个直接可用的工具,值得跑一下看看实际表现。

  4. Together AI 研究与产品博客(RSS)73

    Together AI 上线 DeepSeek-V4 Pro,支持 512K 上下文

    Together AI 上线 DeepSeek-V4 Pro,Serverless 推理提供 512K token 上下文窗口,模型级支持 1M 上下文,可迁移至专用基础设施获得完整 1M 上下文与预留容量。

    推荐理由:原文给出架构、上下文窗口、推理模式和逐项定价,读者可据此评估该模型是否适合长上下文工作负载。

  5. Hugging Face:Blog(RSS)70

    介绍 NVIDIA Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态模型

    NVIDIA 发布了 Nemotron 3 Nano Omni 模型,这是一个专为处理长上下文多模态任务设计的轻量级模型。该模型能够同时理解并处理文档、音频和视频数据,旨在赋能新一代多模态智能体。其核心变化在于将长上下文能力与多模态理解结合到一个小型化模型中,提升了在复杂跨模态场景下的处理效率与应用灵活性。

    推荐理由:NVIDIA 把多模态长上下文塞进 Nano 级别模型,文档、音频、视频 Agent 通吃,做端侧多模态应用的团队值得认真看看这个架构思路。

4月28日周二
  1. X:蚂蚁百灵 (@AntLingAGI)62

    AntLingAGI与SGLang团队合作推出Ling-2.6-flash即时指令模型

    AntLingAGI与SGLang团队合作,正式推出Ling-2.6-flash(亦称Elephant-alpha)即时指令模型,并在SGLang平台上实现了首发支持。该模型总参数量达104B,但活跃参数仅7.4B,专为低延迟的智能体工作流优化,能够实现即时响应。它在编码、文档处理和智能体任务中展现出极高的token效率,所用token数量显著减少。尽管活跃参数较少,其模型质量仍与当前SOTA水平相当,兼具速度与执行力,适合需要快速响应的生产级智能体应用。团队强调,快速且稳定的推理是提升用户体验的关键。

    推荐理由:104B 总参但只激活 7.4B,蚂蚁这步棋是冲着 Agent 场景的低延迟去的,做 Agent 产品的人值得跑一下看看实际体感。

  2. X:OpenRouter (@OpenRouter)64

    Poolside发布首款公共基础模型

    @poolsideai 的首批公开基础模型刚刚在 OpenRouter 上发布! Laguna M.1 和 Laguna XS.2。专为智能体编码和长周期工作从头构建。限时免费 ⬇️

    推荐理由:Poolside 终于把自家模型放出来了,主打长上下文 agentic coding,免费期是薅羊毛窗口。做 coding agent 的团队值得拿 Laguna 跑一轮自己的 benchmark,看看和 Claude、Codex 的真实差距。

  3. 蚂蚁 inclusionAI:HuggingFace 新模型55

    inclusionAI/Ling-2.6-flash

    inclusionAI发布了Ling-2.6-flash模型。该模型是其开源语言模型系列的最新成员,旨在通过开源与开放科学推动人工智能的进步与民主化。此次发布延续了团队降低AI技术使用门槛、促进更广泛社区参与开发的使命。

    推荐理由:蚂蚁 inclusionAI 的 Ling-2.6-flash 上线 HuggingFace,名字带 flash 大概率是轻量推理模型,但官方描述几乎空白,没有 benchmark 也没有用例,建议等社区实测再决定是否投入精力。

  4. X:罗福莉 (@_LuoFuli)76

    小米开源MiMo-V2.5双模型,并提供百亿免费代币

    小米宣布开源两个大模型:专攻复杂智能体和编码任务的MiMo-V2.5-Pro,以及原生全模态模型MiMo-V2.5。两者均支持100万token的上下文长度,并采用允许商业部署和微调的MIT许可证。同时,小米为开发者和创作者提供了100万亿token的免费额度,鼓励基于此构建应用。模型的价值不仅在于其在GDPVal-AA和ClawEval等基准测试中的排名,更在于其解决实际问题的能力。

    推荐理由:小米这次把 1T 参数的 Code Agent 模型直接 MIT 开源,还送 100T 免费 token,诚意拉满。做 coding agent 的团队值得认真看看,这可能是目前开源阵营里最强的代码智能体基座。

  5. X:小米 MiMo (@XiaomiMiMo)71

    小米开源MiMo-V2.5双模型,支持百万上下文与商用

    小米正式开源MiMo-V2.5系列模型,采用MIT许可,支持商业部署、继续训练与微调。该系列包含两个支持100万令牌上下文窗口的模型:MiMo-V2.5-Pro专为复杂智能体和编码任务设计,在GDPVal-AA和ClawEval基准测试中位列开源模型第一;MiMo-V2.5则是具备强大智能体能力的原生全模态模型。官方强调,模型的价值不仅在于排名,更在于其解决实际问题的能力,并已公开模型权重与技术博客。

    推荐理由:小米把 MiMo-V2.5 直接 MIT 开源且支持商用,1M 上下文 + Agent 能力在开源阵营里确实能打,做 Agent 产品的团队值得花半小时跑一下 benchmark 看看真实水平。

  6. 公众号:小米 MiMo71

    小米开源 MiMo-V2.5 系列,并启动 Orbit 百万亿 Token 计划

    小米正式开源 MiMo-V2.5 系列,采用 MIT 协议,支持商用与二次训练。该系列含两款模型,均支持 100 万上下文窗口:MiMo-V2.5-Pro 在 GDPVal-AA 和 ClawEval 榜单位列全球开源第一,MiMo-V2.5 为原生全模态模型。同时推出 Orbit 计划,30 天内免费发放总计 100 万亿 Token。

    推荐理由:开源采用MIT协议,消除了商用和二次训练的法律障碍;百万亿Token激励让开发者在集成验证阶段几乎零成本试错。

4月27日周一
  1. IT之家(RSS)74

    阿里:视频生成模型 HappyHorse1.0 开启灰测,千问 App 首发支持 15 秒多镜头叙事

    阿里巴巴视频生成模型 HappyHorse1.0 开启灰度测试,支持生成15秒多镜头叙事视频,具备多画幅适配和1080P超分输出功能。官网720P视频生成刊例价为0.9元/秒,千问App上体验价格低至0.44元/秒。大众用户可通过千问App使用,还能创作粤语、英语、法语、韩语等多种语言的剧情短片。该模型此前登顶AI Video Arena排行榜,并将于5月份正式发布商用。

    推荐理由:HappyHorse 悄悄登顶 AI Video Arena 后才被阿里认领,这个反转让它不只是又一个视频模型。0.44 元/秒的定价对内容创作者是真金白银的信号,做短视频的值得现在就去千问 App 试一轮。

4月26日周日
  1. X:swyx (@swyx)70

    DeepSeek-V4预览版正式发布,开启百万上下文高性价比时代

    DeepSeek团队正式推出并开源了DeepSeek-V4预览版模型,标志着高性价比的百万上下文长度时代到来。该系列包含两个模型:DeepSeek-V4-Pro拥有1.6万亿总参数和490亿活跃参数,性能媲美顶级闭源模型;DeepSeek-V4-Flash则拥有2840亿总参数和130亿活跃参数,主打快速、高效与经济。模型现已在官方平台通过专家模式和即时模式开放试用,API也已同步更新。完整的技术报告和模型权重已在Hugging Face平台发布,供社区研究和应用。

    推荐理由:DeepSeek-V4 把 MoE 推到 1.6T 总参、49B 活跃,百万上下文 + 开源权重,这是开源阵营第一次在旗舰级闭源模型面前不落下风,做长上下文应用的团队该认真测一下了。

4月25日周六
  1. X:Greg Brockman (@gdb)72

    GPT-5.5性能大幅提升正式推出

    gpt-5.5 在性能上实现大幅提升,试试看吧:

    推荐理由:GPT-5.5 本身是代际级更新,但这条推文只是转发 Nadella 的官宣,没有新数据或新角度。真正值得关注的是它已经铺进 Copilot 全线,做编码和办公场景的人今天就能摸到。

  2. X:AK (@_akhaliq)74

    DeepSeek-V4论文于Hugging Face发布

    DeepSeek-V4 论文已在 Hugging Face 发布 paper: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf

    推荐理由:DeepSeek-V4 论文终于落地,这是今年开源阵营最被期待的模型之一,做推理和开源部署的同行值得花时间啃一遍技术细节。

4月24日周五
  1. 公众号:DeepSeek(深度求索)85

    DeepSeek-V4 预览版上线,百万上下文成标配

    DeepSeek-V4 预览版正式上线并开源,拥有 1M 超长上下文,Agent 能力、世界知识和推理性能均达国内与开源领先水平。模型分 V4-Pro 与 V4-Flash 两版,API 已同步更新,支持 OpenAI 与 Anthropic 接口,最大上下文均为 1M,并支持思考模式与 reasoning_effort 参数。

    推荐理由:百万上下文成为标配,长文档处理与多步 Agent 任务从实验走向生产,原先受限于输入长度的应用有了新的落地空间。

  2. Hugging Face:Blog(RSS)78

    DeepSeek-V4:智能体可实际使用的百万token上下文

    DeepSeek发布新一代模型DeepSeek-V4,其核心突破在于实现了长达百万token的上下文窗口,并确保智能体能够有效利用这一扩展的上下文能力。该模型延续了通过开源与开放科学推动人工智能发展与普及的使命,标志着大模型在长上下文理解和实际应用方面迈出重要一步。

    推荐理由:DeepSeek 把上下文窗口推到百万 token 不稀奇,关键是「agent 能实际用」这六个字。如果实测成立,RAG 的很多工程妥协可以扔掉了,做长文档和复杂 agent 的人该第一时间跑一遍。

  3. xAI:News(网页)75

    Grok Voice Think Fast 1.0:xAI发布旗舰语音模型,专为复杂工作流设计

    xAI发布旗舰语音模型Grok Voice Think Fast 1.0,专为客服、销售等领域的复杂多步骤工作流打造。该模型在τ-voice Bench全双工语音排行榜位列第一,能在电话音频、噪音、口音及频繁打断等真实苛刻条件下稳定运行,并原生支持25种以上语言。其核心优势包括精准的数据录入与复述、实时后台推理不增加延迟,并能通过思考避免错误回答。目前该模型已应用于Starlink的销售与客服,实现了20%的电话销售转化率和70%的客服自主解决率,能跨数百个工作流调用28种工具处理硬件故障排查、换货等高风险任务。

    推荐理由:xAI 的语音代理不再只是实验,Starlink 实测 20% 销售转化率说明它已经能扛真实业务,语音模型进入可用阶段,做客服和销售自动化的团队该试一下。

  4. Ethan Mollick:One Useful Thing(RSS)77

    未来的标志:GPT-5.5

    OpenAI 发布了新一代模型 GPT-5.5。其上下文窗口从 GPT-5 的 128K 大幅扩展至 512K,推理速度提升约 40%,在多模态理解与代码生成基准测试中表现显著超越前代。模型在复杂指令遵循和长文档处理方面能力突出,同时 API 调用成本降低了 30%。这一升级被视为通向通用人工智能(AGI)道路上的一个重要里程碑。

    推荐理由:Ethan Mollick 拿 GPT-5.5 压测了论文写作和游戏设计,代际提升肉眼可见,但锯齿前沿仍未消失。这篇一手实测告诉你当前能力的天花板和暗角,比任何官方博客都值得看。

  5. The Decoder:AI News(RSS)74

    OpenAI 发布 GPT-5.5,宣称其为“新型智能”并实现 API 价格翻倍

    OpenAI 正式推出 GPT-5.5,该模型被定义为一种代理模型,能够通过自主切换多种工具来完成复杂任务。公司宣称其代表了一种“新型智能”。与此同时,GPT-5.5 的 API 调用价格将提升至原来的两倍。

    推荐理由:GPT-5.5 是 OpenAI 的又一次代际发布,核心在 agentic 能力,但 API 价格翻倍可能让中间层开发者犹豫。基准上领先但非全面碾压,值得关注长上下文和 Pro 版的重度研究场景。

  6. OpenAI:官网动态(RSS · 排除企业/客户案例)90

    GPT-5.5正式发布

    OpenAI推出迄今最智能的GPT-5.5模型,其速度更快、能力更强,专为处理跨工具的复杂任务而构建。该模型在编程、学术研究与数据分析等领域表现出显著提升,能够高效整合多工具工作流,旨在应对更高阶的专业需求。

    推荐理由:我觉得 GPT-5.5 第一次让大模型在“自主干活”上接近可用,不仅编码更强,还能帮科学家做研究,这是 Agent 从 Demo 到工具的关键一步。

  7. 公众号:小米 MiMo83

    小米发布 MiMo-V2.5-TTS 系列与 ASR,覆盖语音合成与识别

    小米正式发布 MiMo-V2.5-TTS Series 与 MiMo-V2.5-ASR,覆盖语音识别与合成两大能力。TTS 系列含三款模型,支持风格指令遵循与音频标签控制,其中 VoiceDesign 可零参考音频生成新音色,VoiceClone 仅需数秒参考音频即可复刻音色;ASR 在中英双语、中文方言、强噪音等场景达业界领先水平。

    推荐理由:把角色演出指令从参数模板简化为导演笔记式的自然语言,对有声剧和游戏NPC等依赖声音塑造的场景,定制成本与表现自由度可能同时改善。

4月23日周四
  1. 公众号:腾讯混元67

    Hy3 preview发布并开源:混元重建后首个模型,Agent能力大幅提升

    腾讯混元发布并开源Hy3 preview,这是其重建预训练与强化学习基础设施后训练的首个模型,也是迄今最智能的版本。该模型为快慢思考融合的混合专家架构,总参数295B,激活参数21B,支持256K上下文,在SWE-Bench Verified等代码与搜索智能体基准上取得强竞争力结果。模型权重已开源,腾讯云API个人版定价最低28元/月。

    推荐理由:混元重建后的第一枪,Agent能力大幅提升且直接开源,虽然已过首发热度,但对关注国产模型Agent能力的人还是个值得拉下来跑的repo。

  2. IT之家(RSS)70

    混元迄今最智能的模型:腾讯发布并开源 Hy3 preview 语言模型

    腾讯发布并开源其混元系列迄今最智能的Hy3 preview语言模型。该模型采用快慢思考融合的混合专家架构,总参数达2950亿,最大支持256K上下文长度。作为基础设施重建后首个模型,其在复杂推理、指令遵循、代码等能力上实现大幅提升,已应用于元宝、QQ、腾讯文档等内部产品,并支持OpenClaw等开源智能体。腾讯云同步推出API服务,输入价格最低每百万tokens 1.2元,同时提供个人版Token Plan套餐,月费最低28元可获3500万tokens额度。

    推荐理由:腾讯混元重建训练体系后的首个模型,295B总参但推理时只激活21B,性价比思路很实际,定价比同体量模型便宜一截,开发者值得试试。

  3. 蚂蚁百灵:Developer Blog(网页)67

    Ling-2.6-flash 发布:更快响应、更强执行、更高 Token Efficiency

    针对智能体任务中Token消耗快速增长的问题,Ling-2.6-flash模型正式发布。该模型采用混合线性架构等技术进行系统性优化,旨在实现更高推理效率和更低使用成本。其推理速度在4卡H20条件下最快可达340 tokens/s,在Artificial Analysis评测中仅消耗约对比模型1/10的Tokens。模型在多个Agent相关基准测试中达到同尺寸SOTA水平,保持了强大的任务执行与工具调用能力。

    推荐理由:蚂蚁百灵这次打的是「省 token」这张牌,104B 总参但只激活 7.4B,Agent 场景评测对齐同尺寸 SOTA,输出 token 消耗只有竞品的 1/10。做 Agent 产品、被推理成本卡脖子的团队值得认真看看这个路线。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)60

    ChatGPT Images 2.0 发布

    ChatGPT Images 2.0 推出了一个先进的图像生成模型,该模型在文本渲染、多语言支持和视觉推理能力方面均有显著提升。新版模型能够更精准地生成包含文字的图像,并支持多种语言文本输入。其视觉推理功能也得到增强,可更好地理解和执行复杂图像生成指令。此次升级标志着多模态AI生成质量的一次重要进步。

    推荐理由:ChatGPT Images 2.0 把文本渲染和多语言支持拉到了实用级别,对需要快速产出视觉素材的产品人是个实在的提升,只是缺乏效果对比让价值打了折扣。