跳到正文
北京时间

全部动态

今日 40 条
5月29日周五
  1. X:商汤 SenseTime (@SenseTime_AI)65

    SenseNova信息图表生成模型升级:文本、布局与图表质量全面增强

    SenseNova-U1-8B-MoT-Infographic 是一个升级后的8B参数信息图表生成模型。其核心提升在于:增强了文本的准确性与可读性,减少了重复和不自然的放大;改进了布局的一致性与合理性,背景更稳定;提升了图表与示意图的渲染质量;并新增了学术内容的渲染支持。

    推荐理由:商汤这个8B信息图生成模型升级了,文本和布局都更稳,对常做数据图表和学术配图的人算个实用的小迭代,没有到改变游戏规则的程度。

5月28日周四
  1. X:小米 MiMo (@XiaomiMiMo)69

    MiMo-V2.5现已登陆OpenCode限时免费

    MiMo-V2.5现已在OpenCode上线——限时免费。🎉 [引用 @opencode]:OpenCode x MiMo V2.5 - 限时免费 1M上下文 • 推理 • 文本 • 图像

    推荐理由:MiMo-V2.5在OpenCode免费开放,1M上下文加多模态推理,小米的模型迭代不算大新闻,但趁免费白嫖一下国产模型的机会别错过。如果你正在选型,跑个分试试。

  2. X:商汤 SenseTime (@SenseTime_AI)68

    商汤发布信息图生成模型升级,增强多项核心能力

    商汤科技介绍了其升级后的信息图生成模型 SenseNova-U1-8B-MoT-Infographic。该模型参数为8B,在四个关键维度进行了优化:文本准确性与可读性增强,减少了重复和不当放大;布局的一致性与合理性提升,背景更稳定;图表与示意图的质量提高;并新增了学术内容的渲染支持。推文提供了在 Hugging Face 上的模型页面链接及能力展示页面。

    推荐理由:信息图生成赛道又出新货,商汤这次把文本渲染和布局稳定性真正做好了,做学术图表或运营配图的人可以直接去HuggingFace试用,效果肉眼可见的提升。

  3. X:Krea AI (@krea_ai)73

    Krea 2图像模型现已登陆ComfyUI

    Krea 2现已登陆Comfy! KREA的首个基础图像模型——从零训练——具备可调节的创造力、风格参考和情绪板条件控制。

    推荐理由:Krea 终于掏出自己的基础图像模型,不再只是包装别人模型。ComfyUI 原生节点让工作流玩家可以立刻上手折腾,自研模型的风格控制是个新鲜变量。

  4. Liquid AI 模型与工程博客(网页)70

    Liquid AI 发布端侧 MoE 模型 LFM2.5-8B-A1B

    Liquid AI 发布端侧 MoE 模型 LFM2.5-8B-A1B,专为消费级硬件上的快速可靠工具调用打造,Base 和 post-trained 版本已在 Hugging Face 开放。

    推荐理由:官方给出了与上一版和同类模型的对比数据,以及本地部署路径,适合评估端侧工具调用模型的选型。

5月27日周三
  1. X:通义千问 / Qwen (@Alibaba_Qwen)68

    Qwen3.7-Max代码竞技场排名第四,与Claude Opus 4.6持平

    🚀🚀 Qwen3.7-Max 刚刚在 Code Arena 上升至第 4 名,与 Claude Opus 4.6 持平,是榜单上排名最高的中国实验室!@arena 更多内容即将发布。敬请期待。🕶️

    推荐理由:Qwen3.7-Max 在 Code Arena 前端任务上排第四,跟 Claude Opus 4.6 打平,国产模型第一次在 agentic web dev 摸到第一梯队,做 Web Agent 的可以认真看看。

5月26日周二
  1. IT之家(RSS)76

    面壁智能开源 MiniCPM5-1B:在 AA-Index 上超越所有 2B 参数以下模型,能跑在手机、浏览器上

    面壁智能开源其新一代端侧大语言模型MiniCPM5-1B。该模型仅1B参数,在AA-Index榜单上超越所有2B参数以下模型,相比3个月前的Qwen3.5-2B效果更优且参数量减半。经INT4量化后权重仅0.5GB,支持在手机和浏览器上运行。其Base Model版本由面壁智能自主研发的AI训练框架ForgeTrain预训练完成,现已全面开源模型权重、训练数据集与部署方案。

    推荐理由:1B参数干翻所有2B以下模型,量化后0.5GB就能塞进手机和浏览器,这个效率把端侧模型的门槛又压低了,做移动端AI的值得跟进。

  2. IT之家(RSS)77

    谷歌 AI 框架 AlphaProof Nexus 攻克 2 道悬置 56 年数学难题

    谷歌 DeepMind 推出 AlphaProof Nexus,结合大语言模型与 Lean 形式化验证,在 353 个开放 Erdős 问题中自主解决 9 个,其中 2 个已悬而未决 56 年。该系统还在 OEIS 的 492 个开放猜想中证明 44 个,每个问题推理成本仅数百美元。

    推荐理由:AlphaProof Nexus 不是刷榜,是真解了 Erdős 难题,56 年悬而未决的那两道——这说明 AI 开始从具身数学题爬向纯数学研究了,做理论的人该认真看一眼。

5月25日周一
  1. 蚂蚁 inclusionAI:HuggingFace 新模型58

    inclusionAI 发布 SingGuard 系列模型

    inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-4b。该模型是一种策略自适应多模态 LLM 护栏,将安全策略作为运行时输入而非固定训练分类,支持对文本、图像、图文、多语言、查询侧和响应侧进行安全评估。SingGuard 采用动态推理流程,可先快速输出首 token 安全信号,再继续生成更精确的判断。在涵盖多模态安全、图像安全、文本查询安全、文本响应安全、多语言查询安全及多语言响应安全的六大类基准测试中,SingGuard 达到平均 SOTA 性能。模型支持标准 Transformers 和 vLLM 聊天消息输入,无需手动改写提示词。

    推荐理由:蚂蚁集团开源的多模态安全护栏模型,把审核策略变成了动态可配置参数,对需要灵活合规的部署团队来说比单纯调 API 更可控。普通用户看看就好,做安全的人值得试。

  2. 蚂蚁 inclusionAI:HuggingFace 新模型71

    <中文标题>SingGuard: 策略自适应多模态护栏模型族开源</中文标题>

    <中文摘要>SingGuard 是一个策略自适应的多模态护栏模型族,包含 Sing-Guard-4b 和 Sing-Guard-8b 两个版本。它将安全策略作为运行时输入而非固定分类,部署团队可自定义自然语言规则而无需重训练模型。支持文本、图像、图文、多语言以及查询端与响应端的安全评估,提供快速和快慢结合两种推理模式。在涵盖多模态安全、纯图像安全、文本查询/响应安全、多语言查询/响应安全六大类基准上取得平均 SOTA 表现。模型已开源至 HuggingFace 和 ModelScope。</中文摘要>

    推荐理由:蚂蚁的 SingGuard 把安全策略变成了运行时输入,意味着审核规则可以随时改而不必重训模型,这对做内容安全的产品人是真省事,值得跟进。

  3. 蚂蚁 inclusionAI:HuggingFace 新模型74

    inclusionAI 发布 SingGuard-8b 策略自适应多模态安全护栏模型族

    inclusionAI 发布 SingGuard-8b,一个策略自适应(policy-adaptive)的多模态 LLM 安全护栏模型族,支持文本、图像、图文、多语言、查询侧和响应侧的安全评估。SingGuard 将活跃安全策略作为运行时输入,部署团队无需重训模型即可按默认或自定义自然语言规则进行审核。模型采用动态推理流程,先快速路由输出初步安全信号,再在需要时继续生成更精确的判断。在六大基准类别上,SingGuard 取得平均 SOTA 性能,并展现出对运行时策略的强适应性。模型支持标准 Transformers 和 vLLM 聊天格式输入。

    推荐理由:蚂蚁集团开源的这个多模态安全防护模型把安全策略变成运行时参数,不用重训就能适配新规则,做内容审核的团队可以直接套用,降低定制成本。

  4. 蚂蚁 inclusionAI:HuggingFace 新模型69

    蚂蚁 inclusionAI 发布策略自适应多模态安全护栏模型 Sing-Guard-8b

    SingGuard 是蚂蚁 inclusionAI 推出的策略自适应多模态大语言模型安全护栏模型族(版本 Sing-Guard-8b),支持纯文本、纯图像、图文混合、多语言查询与回复的安全评估。其核心设计将安全策略作为运行时输入,部署团队可基于默认分类或自定义自然语言规则评估内容,无需重新训练模型。模型内置 fast-slow 动态推理流程:首 token 路由快速输出安全信号,需深度推理时继续生成更精确的最终判断。在涵盖多模态安全、纯图像安全、文本查询与回复安全、多语言查询与回复安全的六大基准测试上取得平均 SOTA 性能,并已开源至 HuggingFace 与 ModelScope。

    推荐理由:蚂蚁集团开源的多模态内容审核模型,最大亮点是运行时动态注入安全策略而不需重训,对需要灵活定制审核规则的团队是低门槛的高分工程实现。

  5. 蚂蚁 inclusionAI:HuggingFace 新模型69

    inclusionAI 发布 SingGuard 系列模型,首版为 SingGuard-2b

    inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-2b,用于文本、图像、图文、多语言及查询/回复侧的安全评估。SingGuard 将安全策略作为运行时输入而非固定训练分类,支持部署团队在不重新训练模型的情况下,依据默认或自定义自然语言规则进行内容审核。该模型在多项多模态安全基准上取得平均最优性能,支持快速首 token 路由与深度推理结合的动态推理流程,兼容 Transformers 和 vLLM 的 chat 消息输入。

    推荐理由:把安全策略写成自然语言就能即插即用,不用重新微调,这个思路对需要频繁调整合规规则的产品团队很实用。虽然只是个2B的小模型,但开箱即用的动态适配能力值得关注。

  6. 蚂蚁 inclusionAI:HuggingFace 新模型68

    inclusionAI 发布 Sing-Guard-2b:策略自适应多模态大模型安全护栏

    inclusionAI 开源了 Sing-Guard 模型家族,版本包括 Sing-Guard-2b 和 Sing-Guard-8b。该模型将安全策略作为运行时输入,支持文本、图像、图文及多语言场景的查询侧

    推荐理由:SingGuard把安全策略变成运行时输入,不用再为新规则重新训练模型,这对需要频繁调整审核标准的团队来说是个实用的发布。

  7. 蚂蚁 inclusionAI:GitHub 新仓库63

    蚂蚁 inclusionAI 开源 SingGuard 多模态安全护栏模型族

    蚂蚁集团 inclusionAI 开源了 SingGuard 多模态安全护栏模型族,包含 2B、4B 和 8B 三个版本。SingGuard 将安全策略作为运行时输入而非训练时固定分类,部署团队无需重新训练即可按默认分类或自定义自然语言规则评估内容。模型支持文本、图像、图文、多语言、查询侧和回复侧的安全审核,采用“快-慢”动态推理机制。SingGuard 在多模态安全、图像安全、文本查询安全、文本回复安全、多语言查询安全及多语言回复安全基准上达到平均 SOTA 性能。模型基于 Qwen3-VL 架构,支持通过 Transformers 和 vLLM 部署。

    推荐理由:安全护栏模型大多是死规则,SingGuard 允许运行时动态注入策略,这对需要频繁调整审核规则的内容团队是个实用突破。蚂蚁开源了全系列模型与基准,部署门槛低,可以直接上手。

  8. 蚂蚁 inclusionAI:GitHub 新仓库67

    蚂蚁 inclusionAI 开源多模态安全护栏模型 SingGuard

    SingGuard 是蚂蚁 inclusionAI 开源的多模态安全护栏模型族,提供 2B、4B、8B 三个参数版本。它将安全策略作为运行时输入,支持文本、图像、图文、多语言及查询/回复侧的安全评估,无需重新训练即可适配不同规则。采用快慢动态推理机制,在低延迟场景下输出紧凑判断,对模糊或高风险内容进行策略引导的推理。在多模态安全、图像安全、文本查询与回复安全、多语言查询与回复安全等基准上达到 SOTA 平均性能。模型已上架 HuggingFace 和 ModelScope。

    推荐理由:蚂蚁 inclusionAI 把安全护栏做成了“运行时可配置”的模型,换审核规则不用重训,对需要快速适配法规的团队是个真需求。不过生态刚起步,暂时还是小众工具。

  9. X:Elon Musk (@elonmusk, xAI)71

    Grok V9-Medium模型完成训练即将发布

    Grok基础模型V9-Medium(1.5T)已完成训练。评估结果良好。补充训练中加入了大量Cursor数据,后续还会有更多。 微调正在进行中,强化学习将在几天后开始。预计2到3周内公开发布。 这将比当前服务所有Grok生产流量的0.5T v8-small模型有重大改进,尤其在复杂编码任务上。

    推荐理由:Grok 参数翻到 1.5T,还专门喂了 Cursor 代码数据,这波升级明显奔着 coding 去的。如果 evals 不注水,两周后的 coding 排行榜可能变天。

  10. IT之家(RSS)72

    面壁智能联合清华等开源中国首个基于华为昇腾训练的 1.58-bit 端侧大模型 BitCPM-CANN

    面壁智能联合清华大学、OpenBMB 开源社区发布并开源 BitCPM-CANN,这是中国首个完全基于华为昇腾实现端到端训练的三值(1.58-bit)大模型,含 0.5B、1B、3B、8B 四个尺寸。

    推荐理由:谁说国产算力只能跑小模型?面壁这个1.58-bit模型在昇腾上原生训练,直接把8B塞进旗舰手机,开源全套训练底座,做端侧的该看一眼。

5月24日周日
  1. X:阶跃星辰 StepFun (@StepFun_ai)76

    StepAudio实时语音发布,能听懂你的语气与言外之意

    StepAudio 2.5 Realtime 是一款实时语音交互模型。其核心优势在于能感知用户的副语言特征,如语气、节奏、停顿甚至轻叹,从而理解话语背后的真实意图。该模型支持通过 API 高度定制角色人格与说话风格,内置超过10,000种可组合的预置角色,并提供5种开箱即用的预设角色供体验。同时,模型经过RLHF优化,能在复杂的角色扮演压力测试中稳定保持设定的人设。支持中英文双语交互。

    推荐理由:StepFun 这个语音模型把副语言感知做进了实时 API,产品人想搞点情感化语音交互的可以试试,预设角色能省不少调 prompt 的功夫。

5月23日周六
  1. Hugging Face:Blog(RSS)63

    NVIDIA 发布 Nemotron-Labs Diffusion 系列模型,支持三种生成模式

    NVIDIA 发布 Nemotron-Labs Diffusion 系列,含 3B、8B、14B 文本模型和 8B 视觉-语言模型(VLM),均采用商用友好的 NVIDIA Nemotron Open Model License 或 NVIDIA Source Code License。模型支持自回归、扩散(逐块并行生成后逐步精炼)和自推测(扩散草拟候选 token 再自回归验证)三种模式。8B 模型平均准确率比 Qwen3 8B 提升 1.2%,扩散模式每次前向传递的 token 数(TPF)达自回归的 2.6 倍,自推测达 6–6.4 倍。模型在 1.3T tokens 上预训练、45B tokens 上微调,代码与模型已发布于 HuggingFace 和 GitHub,推理将获 SGLang 支持。

    推荐理由:自推测模式让文本生成速度飙到AR模型的4倍,而且输出质量无损。NVIDIA这次开源的不仅是个新模型,更是一套能直接用在现有流程里的加速方案。

5月22日周五
  1. X:Rohan Paul (@rohanpaul_ai)75

    首个基于华为昇腾910B NPU全栈训练的1.58比特开源大模型BitCPM-CANN发布

    ModelBest、清华大学与OpenBMB社区联合发布了BitCPM-CANN,这是全球首个完全基于华为昇腾910B NPU训练的开源1.58比特三元大模型。其核心创新在于采用仅含三种权重状态的极低比特量化技术,使模型内存占用相比BF16降低约6倍,可高效部署于手机、电脑、车载设备等边缘端。更关键的是,整个训练全栈(从量化算子到框架)均在昇腾上原生构建与验证,而非简单移植。该模型家族(0.5B-8B)在多项基准测试上保持了全精度模型95-97%的性能,为资源受限环境下部署和复现大模型提供了可落地的解决方案。

    推荐理由:首个开源的1.58-bit三元LLM,直接在昇腾芯片上原生训练,内存压缩到BF16的六分之一,8B模型就能跑在手机上,做端侧部署的可以立刻上手试试了。

  2. IT之家(RSS)70

    网易有道“子曰4”多模态模型、语音合成模型全量开源

    网易有道宣布将其“子曰”大模型4.0的多模态模型与语音合成模型面向全球全量开源。其中,多模态模型(27B参数)专注于教育场景,在处理高难度视觉数理问题上达到行业顶尖水平,纯文本中文数理难题准确率为81.4%。该模型通过思维链优化,将输出长度压缩43.2%,有效降低了推理成本。同时开源的语音合成模型支持跨语种音色与情感迁移克隆,3秒内即可完成零样本复制,准确度超97%,并支持包括中、英、日、韩在内的14种语言。

    推荐理由:有道把垂直教育的多模态模型全量开源,27B参数在视觉数理上做到SOTA,还把思维链压缩了43%,推理成本实打实下降,做教育应用的可以拿来做二次开发;TTS的跨语种情感克隆也实用,3秒克隆14种语言。

  3. 公众号:龙猫LongCat(美团)88

    LongCat-Video-Avatar 1.5 正式开源

    美团正式开源 LongCat-Video-Avatar 1.5,在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现全面跃升。该模型采用 DMD 蒸馏将生成步骤压缩至 8 步,推理效率提升约 15 倍,生成 10 秒视频仅需约 1 分钟;Wav2Vec2 升级为 Whisper-large,并引入 GRPO 逐帧偏好对齐优化手部稳定性。

    推荐理由:开源数字人模型首次在多人场景区分、长视频稳定性和推理效率上同时达到商业产品水平,评测透明度高。

  4. 公众号:龙猫LongCat(美团)78

    美团开源 LongCat-Video-Avatar 1.5:数字人视频生成效率提升 15 倍

    美团正式开源 LongCat-Video-Avatar 1.5 数字人视频模型。该版本在唇形同步、物理合理性及长视频稳定性上实现跃升,支持真人、动漫等多类主体及多人互动场景。技术层面,采用 Whisper-large 提取音频特征,引入 GRPO 进行人类偏好对齐以优化手部与动作连续性;推理端通过 DMD 蒸馏将生成步数从 50 压缩至 8,结合共享基础模型加 LoRA 适配器方案,使推理效率提升约 15 倍(10 秒视频仅需约 1 分钟)。评测显示其在自然度与稳定性方面优于部分闭源商业模型。

    推荐理由:头部大厂开源的高性能数字人模型,显著降低商用门槛。其“15 倍提速”与“多场景泛化”能力为开发者提供了极具竞争力的基座,适合关注 AI 视频生成落地与成本优化的读者。

  5. IT之家(RSS)73

    智谱GLM-5.1高速版发布:刷新全球大模型API速度纪录

    5月22日,智谱向部分企业客户推出了旗舰大模型GLM-5.1的高速版API“GLM-5.1-highspeed”。该版本输出速度达400 tokens/s,刷新了全球大模型API速度上限。关键突破在于,它首次在国产大模型中实现了旗舰级能力与低延迟的结合,打破了“高速模型即轻量模型”的传统。该版本由智谱GLM团队与TileRT团队合作,通过系统级优化确保了速度的生产级稳定性,适用于AI编程、实时语音交互等场景。

    推荐理由:智谱把旗舰模型拉到 400 tokens/s,还保持全尺寸能力,不是那种为快阉割的小模型。做实时交互、AI 编程的可以认真看看,延迟敏感场景的选型参数要重写了。

  6. 公众号:智谱(GLM)64

    GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度

    智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。

    推荐理由:在旗舰模型上实现400 tokens/s,打破了高速必为轻量模型的惯例,对编码智能体等实时交互场景提供了不牺牲能力的低延迟方案。

  7. 公众号:智谱(GLM)63

    智谱推出GLM-5.1高速版

    智谱发布GLM-5.1高速版,推理速度达400 tokens/s,在顶尖模型中生成速度最快。

    推荐理由:智谱把GLM-5.1做到了400 tokens/s,虽然发布已半个月,但这是国产模型在推理速度上的新标杆,做实时应用的可以看看。

  8. X:OpenRouter (@OpenRouter)78

    阿里通义千问Qwen3.7-Max上线OpenRouter

    阿里巴巴通义千问团队的全新Qwen3.7-Max现已登陆OpenRouter。 作为Qwen3.7系列的旗舰模型,专为以智能体为核心的工作场景打造:编程、办公与生产力任务,以及长周期自主执行。在编程和智能体基准测试中较Qwen3.6有显著提升,并支持显式提示缓存以处理重复上下文。

    推荐理由:阿里旗舰迭代,重点转向 agent 和长程任务,这次 benchmark 跳跃不是挤牙膏,做 coding agent 的可以认真试试。

  9. 美团 LongCat:HuggingFace 新模型73

    LongCat-Video-Avatar-1.5:升级版音频驱动数字人视频生成框架

    美团LongCat团队发布了LongCat-Video-Avatar-1.5,一个专注于音频驱动数字人视频生成的开源框架。其核心升级在于采用Whisper-Large音频编码器,显著优化了唇部动态的流畅度与自然度。该版本实现了精准的唇形同步、全身时序稳定性以及长视频中的身份一致性,并能泛化应用于动漫、动物及多人交互等复杂场景。通过基于DMD2的步蒸馏技术,模型仅需8步即可高效推理。团队还构建了一个涵盖多场景、多语言的人工评估基准,通过大规模主观评分与专家分析,验证了其在多项关键维度上的优异性能。

    推荐理由:美团把数字人模型升级到1.5版,换了Whisper做音频编码,唇形同步比之前自然不少,而且开源了训练代码,做电商直播和虚拟博主的朋友可以直接拿过来跟商业方案掰手腕。

5月21日周四
  1. X:通义千问 / Qwen (@Alibaba_Qwen)82

    Qwen3.7-Max:面向Agent时代的旗舰模型

    Qwen3.7-Max是Qwen系列面向Agent时代推出的最新旗舰模型,旨在为能完成实际任务的智能体提供强大基础。其核心能力包括:可作为端到端编码智能体,处理前端原型与多文件重构;作为可靠的办公助手,通过MCP集成与多智能体编排协同工作;并支持超长时间(超过35小时)的自主运行,执行复杂任务链。该模型兼容Claude Code、OpenClaw等主流开发框架,现已上线阿里云模型工作室与Qwen Studio提供服务。

    推荐理由:Qwen 3.7-Max 的亮点不在榜上分数,而是它瞄准 Agent 场景的连贯执行能力,35 小时不间断跑 kernel 优化,对需要长线任务的开发者是直接可用的探索方向。

  2. X:腾讯混元 (@TencentHunyuan)74

    腾讯开源Hy-MT2多语言翻译模型

    腾讯正式开源Hy-MT2多语言翻译模型,支持33种语言间的无缝互译。其7B与30B-A3B版本在开源模型中达到最先进的翻译性能,超越了许多参数规模大数十倍的模型。更具突破性的是,1.8B轻量级版本性能超越微软等主流商业API,并凭借腾讯AngelSlim 1.25-bit极量化技术,仅需440MB存储空间,即可在主流手机芯片上本地运行,推理速度较前代提升1.5倍,显著降低了高质量AI翻译的部署门槛。

    推荐理由:虽然翻译领域不算最热,腾讯这个1.8B开源模型用1.25位量化直接跑在手机上,效果还超微软商业API,做本地化翻译工具的人值得关注。

  3. X:Google DeepMind (@GoogleDeepMind)84

    Gemini 3.5 Flash 正式发布

    Gemini 3.5 Flash 已正式发布。

    推荐理由:Google 在 Gemini 3.5 上继续扩展 Flash 线,这种轻量模型对成本和延迟敏感场景很关键,如果你在等一个便宜的 Gemini API,该看了。

  4. X:Gemini (@GeminiApp)74

    Gemini 3.5 Flash快速整理混乱输入

    Gemini 3.5 Flash能快速提供整理好的结果,无论输入多么混乱。 看看Gemini如何将与客户的聊天和文本,转化为您小企业可用的文档。

    推荐理由:Gemini 3.5 Flash 的核心不是刷榜,而是解决现实中‘信息像一堆垃圾’的问题,这种从杂乱输入直接生成文档的能力,对小企业和自由职业者比 SOTA 更有用。

5月20日周三
  1. IT之家(RSS)71

    Stability AI 推出音频模型 Stability Audio 3.0,可生成最长 6 分钟专业级歌曲

    Stability AI 推出 Stability Audio 3.0 音频生成模型家族,包含四款不同规格模型,参数从45900万到27亿。小型模型专注设备端运行,可本地生成两分钟以内的音频;中型和大型模型支持创作超过6分20秒的完整音乐,

    推荐理由:Stability Audio 3.0 把AI音乐从几十秒的demo拉到了六分钟的完整歌曲,而且中小模型直接开源,任何一个能跑模型的设备都能玩,音乐创作的门槛继续被踩低。

  2. X:商汤 SenseTime (@SenseTime_AI)68

    SenseNova U1:同时思考文本与图像的AI

    将你的想法转化为激发故事的视觉画面 🧨 [引用 @Adamaestr0_]:大多数AI工具可以写作或生成图像。 但这个能同时做这两件事。 向你介绍 SenseNova U1。 一个能同时思考文本和图像的AI。 这改变了一切 🧵

    推荐理由:商汤发了 SenseNova U1,主打文本和图像同时生成的「全模态」,但宣传语太简略,没给任何性能数据或技术细节,暂时看不出是真突破还是常规迭代,先标记关注。

  3. 公众号:通义实验室(千问)62

    Qwen3.7-Max 重新定义 AI Agent 基座

    通义实验室推出 Qwen3.7-Max,定位为重新定义 AI 智能体基座的模型,侧重提升智能体的基础能力与架构。

    推荐理由:Qwen3.7-Max 是通义系列对 Agent 基座的一次关键升级,发布时间虽已过两周,但做 Agent 的开发者仍不能忽略,选型必看。

  4. Qwen:Blog Retrieval(API)79

    Qwen3.7-Max:面向智能体时代的最新专有模型

    通义千问发布 Qwen3.7-Max,专为智能体时代设计。它具备从原型到复杂多文件工程的编码智能体能力,通过 MCP 和多智能体编排实现办公自动化,能自主执行超 1000 步工具调用(如 35 小时全自主内核优化)。兼容 Claude Code、OpenClaw、Qwen Code 等多框架。在多项基准测试中超越 Opus-4.6 Max 等模型:Terminal Bench 2.0 (69.7)、SWE-Verified (80.4)、GPQA Diamond (92.4)、HLE (41.4) 等。现已通过阿里云 Model Studio 提供 API 调用。

    推荐理由:Qwen3.7-Max 把 agent 能力拉到了新高度,35 小时自主内核优化证明长程执行有真实生产力,做 coding agent 的团队该认真测一下。

  5. Hacker News 热门(buzzing.cc 中文翻译)80

    Gemini Omni

    Google DeepMind 于 2026 年 5 月 19 日发布了新一代多模态大模型 Gemini Omni。该模型整合了文本、图像、音频与视频的理解与生成能力,旨在实现更自然的人机交互。在同期 Hacker News 讨论中获得 112 点赞,显示出技术社区对多模态融合趋势的持续关注。这标志着大模型从单模态向全模态感知与响应能力的进一步演进。

    推荐理由:Gemini Omni 把视频编辑变成自然语言对话,多轮编辑和物理理解让它从玩具变成创作工具,做视频的值得一试。

  6. Google Blog:AI(RSS)83

    Gemini 3.5:前沿智能与行动能力相结合

    Google 在 I/O 大会上正式发布了最新的 Gemini 3.5 模型系列。该系列模型将前沿的人工智能能力与执行操作的功能相结合,旨在提供更强的综合性能。作为 Google 最新推出的模型,它代表了其在大模型技术上的最新进展。

    推荐理由:Google 在 I/O 上甩出 Gemini 3.5,这次不只拼多模态,更强调‘行动’,是所有做 Agent 的团队必须对标的新基座。

  7. Google Blog:AI(RSS)89

    I/O 2026: 欢迎来到自主的 Gemini 时代

    Google 在 I/O 2026 大会上宣布 Gemini 进入自主代理时代,新功能使其能够自动执行复杂任务,显著提升用户工作效率。大会展示了 Gemini 如何通过代理操作简化工作流程,实现自动化处理,例如自动管理邮件、安排日程或生成报告,帮助用户从重复性工作中解放出来,专注于创造性任务。这一更新基于先进机器学习模型,强调准确性与效率,标志着 AI 助手向更智能、更自主的方向发展。

    推荐理由:谷歌 I/O 大会上 Sundar Pichai 亲自宣布 agentic Gemini 时代到来,这是把 Gemini 从对话助手升级成真正能自主执行任务的 agent,所有做 AI 应用的接下来都得重新看一遍技术选型。