跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 221–240 条 · 共 437 条
6月5日周五
  1. Hugging Face:Blog(RSS)78

    Nemotron 3.5 Content Safety:面向全球企业AI的可定制多模态安全

    Nemotron 3.5 Content Safety基于Gemma 3 4B IT,提供128K上下文窗口,支持用户提示、可选图像与助手响应的统一多模态安全评估。新增自定义策略执行,允许企业用自然语言定义专属安全规则;THINK模式可输出可审计的逐步推理痕迹。显式训练覆盖12种语言,并借助基座模型零样本泛化至约140种语言。输出提供低延迟二分类、带分类标签、THINK推理痕迹三种模式。安全分类遵循Aegis 2.0框架(13核心类别+10细分类别)。同步发布多模态、多语言安全数据集,可在8GB+ VRAM GPU上实时部署。

    推荐理由:Nemotron 3.5 把内容安全从「单模态英文」拉到「多语言多模态可定制」,自定义策略和推理 trace 让企业能审计决策,做安全平台的值得细看。

  2. Google AI Developers70

    Google AI for Developers 宣布推出开放权重的实时音乐模型 Magenta RealTime 2 (MRT2)。该模型可通过 MIDI 键盘、实时文本提示甚至手势进行演奏。MRT2 在 MacBook 上原生运行,延迟低于 200ms,提供开放权重、开源推理引擎以及配套应用和插件套件。

    引用Google Magenta Project@GoogleMagenta

    介绍 Magenta RealTime 2 (MRT2):你可以像演奏乐器一样演奏的实时音乐模型。 MRT2 提供 MIDI 和提示控制,并可在 MacBook 上原生运行,延迟低于 200ms。 开放权重。开源推理引擎。一整套应用和插件。 在下方听听它能做什么,并亲自试一试 🧵

    推荐理由:Magenta RealTime 2 把音乐生成从「后期制作」拉到了「实时演奏」,开放权重且延迟低于 200ms,音乐创作者值得立刻上手试试。

6月4日周四
  1. SiliconFlow72

    neolab 推出 Nex-N2-Pro,基于 Qwen3.5-397B-A17B,总参数 397B 的 MoE 推理模型,支持 262K 上下文与多模态(VLM),性能达到 GPT-5.5 和 Claude Opus 4.7 级别。模型可自动调节推理深度,减少 30-50% 思考 token 且无性能折损,在 Terminal Bench 2.1、GDPVal、SWE-Verified 上取得 SOTA。擅长智能体编码、深度搜索和工具使用,兼容 Claude Code、Cursor 等工具。硅基流动已提供 T+0 支持,前两周免费使用。

    推荐理由:后训练模型能直追 GPT-5.5 和 Claude 4.7,免费两周,对做 agent 和 deep search 的人来说是难得的低成本试错机会。

  2. SenseTime69

    商汤 SenseTime 推出 SenseNova U1 开源多模态模型,实现原生理解与生成文本和图像,可一键将提示词转化为专业信息图。该模型被开发者 @gurru_tech 评价为“非常令人印象深刻”。项目已开源,提供 SenseNova Studio 在线试用,并公开 HuggingFace 模型集合、GitHub 源码仓库及 Discord 社区入口。

    推荐理由:商汤这回把图文统一模型开源了,SenseNova U1的infographic功能比市面上大多数文生图工具更懂文字和布局,做内容的朋友可以上手试试。

  3. StepFun77

    阶跃星辰的 Step 3.7 Flash 已上架 Fireworks AI。该模型为 198B 稀疏 MoE 多模态大模型(VLM),含 196B 语言骨干和 1.8B 视觉编码器,从设计之初优化推理效率,采用硬件友好架构与 MTP 辅助解码,速度达 400 tokens/s。具备原生多模态理解与行动、可靠工具使用、增强搜索能力,面向真实智能体工作负载,采用 Apache 2.0 开源许可。

    引用Fireworks AI@FireworksAI_HQ

    许多研究实验室只在事后才考虑推理效率。Step 3.7 Flash 是一个 198B 稀疏 MoE VLM,由 @StepFun_ai 从一开始就为推理而设计。196B 语言主干,搭配 1.8B 视觉编码器。 为真实世界的智能体工作负载而构建,运行速度最高可达 400 tok/sec。原生多模态理解与行动、可靠的工具使用,以及增强的网页与视觉搜索。 Apache 2.0。立即试用 → https://fireworks.ai/models/fireworks/step-3p7-flash-nvfp4

    推荐理由:198B稀疏MoE加MTP解码把速度推到400 tok/s,还开源Apache 2.0,这规格做agent的大脑正合适,做实时应用的可以试试手。

  4. HuggingFace Daily Papers(社区热门论文)74

    MapAgent:面向城市级车道级地图生成的工业级智能体框架

    MapAgent是一种工业级智能体架构,用于生成符合规范的车道级地图。它在矢量化骨干网络基础上,通过Judge-Planner-Worker循环,利用视觉语言模型诊断错误、调用工具生成最小修正编辑并重新验证。系统仅在骨干网络置信度低的瓦片区域选择性触发,保持高吞吐量。MapAgent已集成至百度地图,支撑全国360多个城市的车道级地图生成,整体生产自动化率超95%。

    推荐理由:百度地图团队把Agent验证循环接入车道级地图生成,360+城市落地且自动化率超95%,复杂路口和长尾场景提升明显,做自动驾驶和在线地图的可以直接看结论。

  5. Elon Musk71

    xAI 与 Cloudflare 合作,将 Grok 的 LLM、音频、图像和视频模型接入 Cloudflare AI Gateway,用户可直接通过 Cloudflare 计费,无需额外认证或 API 密钥。Elon Musk 发推称 "Grok on Cloudflare"。

    引用Cloudflare Developers@CloudflareDev

    我们正与 @xai 合作,将 Grok 引入 @Cloudflare AI Gateway。 • Grok LLM、音频、图像和视频模型现已通过 AI Gateway 提供 • 直接通过 Cloudflare 计费 • 无需额外的认证、环境变量、API 密钥 𝚎𝚗𝚟.𝙰𝙸.𝚛𝚞𝚗("𝚡𝚊𝚒/𝚐𝚛𝚘𝚔-𝚒𝚖𝚊𝚐𝚒𝚗𝚎-𝚟𝚒𝚍𝚎𝚘-𝟷.𝟻-𝚙𝚛𝚎𝚟𝚒𝚎𝚠")

    推荐理由:开发者现在可以在Cloudflare上零配置调用Grok全家桶了,从LLM到视频生成,对已经用Cloudflare生态的人来说,这比单独接入xAI API省事太多。

  6. xAI:News(网页)75

    xAI 发布 Grok Imagine 1.5 预览版(图像转视频模型)

    xAI 通过 API 发布了图像转视频模型 `grok-imagine-video-1.5-preview`(Grok Imagine 1.5 预览版)。该模型能将单张静态图片转为流畅的电影感视频,用户提供起始帧和描述运动的提示词后,模型可生成包含相机移动、氛围和物理效果的动画,并保持对源图像的忠实。支持生成 720p 片段,可使用自然语言指令控制镜头、节奏和音效,并支持逐帧拼接成长场景。模型目前通过 xAI API 提供预览使用。

    推荐理由:xAI的新视频模型从单张图像生成电影级短片,支持自然语言控制运镜和氛围,对视频创作者和开发者是个值得一试的工具。

  7. Hacker News 热门(buzzing.cc 中文翻译)78

    Gemma 4 12B:一种统一的、无需编码器的多模态模型

    Gemma 4 12B 是 Google 发布的一款统一架构、无需独立视觉编码器的多模态大语言模型(LLM)。该模型直接处理图像与文本输入,无需传统视觉编码器,简化了多模态推理流程。基于 12B 参数规模,Gemma 4 12B 面向开发者工具生态开放。目前其具体 benchmark 分数、上下文窗口、价格及开源/API 可用性等细节尚未披露。

    推荐理由:我觉得Gemma 4 12B最大的变化不是参数大小,而是第一次在开源模型里把多模态直接交给LLM主干处理,没有单独的视觉编码器,这意味着本地多模态应用的延迟和内存占用都会大幅下降,对于在笔记本上做Agent的开发者,这是一个必试的版本。

  8. Google Developers Blog(RSS)78

    Gemma 4 12B:开发者指南

    Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

    推荐理由:Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

6月3日周三
  1. SenseTime73

    商汤(SenseTime)开源SenseNova U1模型,宣称实现“看、思考、创作”一体——从一张普通运动鞋图片直接生成营销视觉效果。该模型代表了架构上的范式转变。用户可通过SenseNova Studio、HuggingFace和GitHub尝试使用。

    推荐理由:商汤把理解、推理、创作塞进一个模型,而且直接开源,做视觉营销的可以不用再拼凑工具链了。

  2. HuggingFace Daily Papers(社区热门论文)70

    世界模型与语言模型:论具体推理与抽象推理的互补性

    本研究探讨了世界模型与多模态大语言模型在预测未来状态时的互补性。世界模型可生成具体的视觉未来轨迹,但可能视觉合理却任务错误;多模态大语言模型则擅长抽象推理。为此,研究提出了“受控的具体推理”框架,并构建了VRQABench和OpenWorldQA两个基准。同时,提出了Privileged-Future On-Policy Self-Distillation(PF-OPSD)方法,该方法在训练时利用真实未来视频作为特权上下文评估推理轨迹,但部署时无需真实未来。实验结果显示,PF-OPSD在两个基准上分别比基线高出10.6%和10.9%,并提升了对噪声或冲突轨迹的鲁棒性。

    推荐理由:世界模型靠视觉预测,语言模型靠抽象推理,这篇把两者真正拧在一起了。用未来视频做自我蒸馏提升 10%,还给全开源,做 agent 决策的可以认真看看‘什么时候不信自己的眼睛’是怎么训出来的。

  3. MiniMax (official)80

    MiniMax-M3 在 @ValsAI 排名中位列第六 新的开源权重 SOTA 🚀

    引用Vals AI@ValsAI

    MiniMax 刚刚发布了 MiniMax-M3,这是他们的首个多模态模型。它是 Vals Index 和 Vals Multimodal Index 上新的开放权重 SOTA,总体排名第 #6。

    推荐理由:MiniMax 闷声干大事,第一个多模态模型就拿下 open-weight SOTA 和总榜第 6,做多模态应用的可以蹲一下权重。

  4. Google DeepMind:Blog(RSS)80

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。

    推荐理由:统一无编码器架构让 12B 模型在消费级笔记本上跑出接近 26B 的多模态 Agent 体验,开源 + Apache 2.0,本地部署门槛又压低了。

6月2日周二
  1. Together AI 研究与产品博客(RSS)64

    Together AI 解析如何高效 Serving MiniMax M3,实现 1M 上下文与多模态推理优化

    Together AI 宣布成为 MiniMax M3 的首选云合作伙伴,并将在 M3 以开放权重发布后为开发者提供托管端点。

    推荐理由:作为 MiniMax M3 的首选云合作方,作者拆解了自家推理团队的稀疏注意力内核、分页注意力集成与网关级多模态预处理等优化手法,含可借鉴的工程细节。

  2. MiniMax (official)81

    M3 on Cloudflare AI Gateway, day one ⚡ 前沿编码能力,1M 上下文,原生多模态,现在一次 fetch 即可调用。 是时候构建些东西了。 🦞

    引用Cloudflare Developers@CloudflareDev

    来自 @MiniMax_AI 的 M3 现已在 Cloudflare AI Gateway 上线: - 首个推动 SOTA 编码前沿的开放模型 - 1M 上下文与原生多模态理解 - 首周内,上下文 ≤ 512K 的请求享受 50% 折扣 今天就通过 AI Gateway 试用吧! https://developers.cloudflare.com/ai/models/minimax/m3/

    推荐理由:MiniMax的M3把开源编码模型拉到新高度,1M上下文加原生多模态是惊喜,上线首周5折,值得跑一下看是不是真能干翻闭源。