跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 361–380 条 · 共 437 条
5月1日周五
  1. Google AI69

    谷歌上周正式向公众发布了其首个原生多模态嵌入模型Gemini Embedding 2。该模型如同“通用翻译器”,能将文本、图像、视频和音频数据转化为独特的数字向量。其核心突破在于不再依赖关键词匹配,而是基于语义将不同模态的数据映射到同一空间,从而理解内容间的深层联系。开发者已利用该模型构建视频分析工具、视觉购物助手等应用,实现通过拍照或描述场景进行智能搜索的功能。模型现可通过Gemini API或Gemini Enterprise Agent平台使用。

    推荐理由:Google 第一个原生多模态嵌入模型,把文本、图像、视频拉到同一个向量空间,做跨模态搜索的开发者可以不用再手动打标签了,但离「无感理解」还有距离。

4月30日周四
  1. IT之家(RSS)72

    DeepSeek 公布多模态模型技术报告

    DeepSeek发布了多模态大模型及技术报告,提出创新的“基于视觉原语的思考”框架。该框架将点、边界框等视觉元素作为推理的基本单元,旨在解决多模态模型在空间参照任务中存在的“参照鸿沟”核心问题,使模型能将抽象认知锚定到图像的具体坐标上。尽管模型规模紧凑且图像标记预算较低,其在多项挑战性计数和空间推理基准测试上的性能,可与GPT-5.4等前沿模型相媲美。

    推荐理由:DeepSeek 把视觉概念直接变成推理单元,绕开了语言描述空间的先天模糊,在空间推理上把自家紧凑模型拉到和 GPT-5.4 一个水平,做多模态应用的人值得细读。

  2. Tomer Tunguz 博客(VC 分析)57

    AI推理市场的专业化分化

    AI推理市场正快速分化,各模态如文本、图像、视频和音频发展出独立推理技术栈。自ChatGPT发布后,NVIDIA数据中心收入三年内增长17倍,凸显市场爆发。分化根本原因在于工作负载差异:图像视频生成需高计算力,长上下文消耗更多内存,边缘设备则受功耗限制。市场按延迟分为实时、近实时和批量三层;按模态分为文本、图像视频音频;按部署分为云端和边缘。Hugging Face上已有超9万个图像生成模型,整个AI推理市场规模预计约1000亿美元,这种专业化趋势正为各细分领域创造领导者机会。

    推荐理由:Tomer 把推理市场跟数据库市场做类比,碎片化的逻辑讲得很透,做 AI 基础设施的朋友能直接用来梳理自己的赛道,普通人知道这么回事就行。

4月29日周三
  1. SenseTime65

    是的,SenseNova U1 现已在 Hugging Face 和 GitHub 上发布! 探索它如何以语义精确性和像素级保真度实现复杂的 #信息图 创作。 Hugging Face: https://huggingface.co/collections/sensenova/sensenova-u1 GitHub: https://github.com/OpenSenseNova/SenseNova-U1 Discord: https://discord.gg/cxkwXWjp

    引用AK@_akhaliq

    SenseNova U1 已在 Hugging Face 上线 https://huggingface.co/collections/sensenova/sensenova-u1

    推荐理由:SenseNova U1 开源了,能生成像素级精准的信息图,对于做电商和可视化的人是个直接可用的工具,值得跑一下看看实际表现。

  2. OpenRouter66

    NVIDIA Nemotron™ 3 Nano Omni 已在 OpenRouter 上线。 这是一个用于智能体工作流的开源 30B-A3B 多模态模型:文本、图像、视频和音频输入 → 文本输出,拥有 256k 上下文窗口和高效的 MoE 架构,适用于计算机使用、文档和音视频推理。

    推荐理由:Nemotron 3 Nano Omni 是 NVIDIA 在开源多模态模型上的新动作,30B 参数 MoE 架构、256k 上下文、四模态输入,做 Agent 工作流的开发者值得试一下,尤其文档和音视频推理场景。

  3. Hugging Face:Blog(RSS)70

    介绍 NVIDIA Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态模型

    NVIDIA 发布了 Nemotron 3 Nano Omni 模型,这是一个专为处理长上下文多模态任务设计的轻量级模型。该模型能够同时理解并处理文档、音频和视频数据,旨在赋能新一代多模态智能体。其核心变化在于将长上下文能力与多模态理解结合到一个小型化模型中,提升了在复杂跨模态场景下的处理效率与应用灵活性。

    推荐理由:NVIDIA 把多模态长上下文塞进 Nano 级别模型,文档、音频、视频 Agent 通吃,做端侧多模态应用的团队值得认真看看这个架构思路。

4月27日周一
  1. IT之家(RSS)74

    阿里:视频生成模型 HappyHorse1.0 开启灰测,千问 App 首发支持 15 秒多镜头叙事

    阿里巴巴视频生成模型 HappyHorse1.0 开启灰度测试,支持生成15秒多镜头叙事视频,具备多画幅适配和1080P超分输出功能。官网720P视频生成刊例价为0.9元/秒,千问App上体验价格低至0.44元/秒。大众用户可通过千问App使用,还能创作粤语、英语、法语、韩语等多种语言的剧情短片。该模型此前登顶AI Video Arena排行榜,并将于5月份正式发布商用。

    推荐理由:HappyHorse 悄悄登顶 AI Video Arena 后才被阿里认领,这个反转让它不只是又一个视频模型。0.44 元/秒的定价对内容创作者是真金白银的信号,做短视频的值得现在就去千问 App 试一轮。

4月24日周五
  1. Ethan Mollick:One Useful Thing(RSS)77

    未来的标志:GPT-5.5

    OpenAI 发布了新一代模型 GPT-5.5。其上下文窗口从 GPT-5 的 128K 大幅扩展至 512K,推理速度提升约 40%,在多模态理解与代码生成基准测试中表现显著超越前代。模型在复杂指令遵循和长文档处理方面能力突出,同时 API 调用成本降低了 30%。这一升级被视为通向通用人工智能(AGI)道路上的一个重要里程碑。

    推荐理由:Ethan Mollick 拿 GPT-5.5 压测了论文写作和游戏设计,代际提升肉眼可见,但锯齿前沿仍未消失。这篇一手实测告诉你当前能力的天花板和暗角,比任何官方博客都值得看。

4月23日周四
  1. HuggingFace Daily Papers(社区热门论文)79

    图像生成器是通用视觉学习者

    研究表明,图像生成训练能像大语言模型预训练一样,让模型学习到强大、通用的视觉表征。通过将视觉任务的输出参数化为RGB图像,研究团队将感知任务重构为图像生成任务。基于Nano Banana Pro指令微调构建的通用模型Vision Banana,在涉及2D和3D理解的一系列任务上取得了最先进的结果,在分割任务上媲美Segment Anything Model 3,在度量深度估计上超越Depth Anything系列。这些成果通过轻量级指令微调实现,且未损害基础模型的图像生成能力。图像生成预训练正成为一种通用的视觉学习范式,可能成为构建兼顾生成与理解的基础视觉模型的核心路径。

    推荐理由:Kaiming He团队证明图像生成器是通用视觉学习者,只用少量指令微调就让Nano Banana Pro在分割和深度估计上超过专用SOTA,且没忘生成本领。CV研究者不读这篇,可能错过一个范式转变。

  2. 公众号:小米 MiMo79

    Xiaomi MiMo-V2.5 系列大模型开启公测

    Xiaomi MiMo-V2.5 系列正式公测,包含 MiMo-V2.5、V2.5-Pro、TTS 与 ASR 等模型。其中 V2.5-Pro 在通用智能体、复杂软件工程等维度对标 Claude Opus 4.6、GPT-5.4,曾用 4.3 小时、672 次工具调用完成北大编译原理课程项目并获满分。

    推荐理由:在自主完成编译器构建和视频编辑器开发的长程任务演示中,展示了结构化的逐层搭建和自我修正能力,其效率对比数据有助于判断复杂Agent任务的成本边界。

  3. 字节 Seed:Research Feed(网页内嵌数据)61

    字节 Seed 发布 Seed3D 2.0,几何与 PBR 材质生成达 SOTA

    字节 Seed 正式发布 3D 生成大模型 Seed3D 2.0,在几何生成、纹理材质生成两项核心指标对比中均取得 SOTA 结果。模型采用 Coarse-to-Fine 两阶段 DiT 提升几何精度,统一 PBR 生成架构并引入 MoE 与 VLM 先验,还支持部件级生成、关节化建模与场景组合,输出可兼容 Isaac Sim 等仿真引擎;技术报告已公开,API 已上线火山引擎。

    推荐理由:官方博客给出两阶段 DiT、统一 PBR 等架构细节与人类盲评结果,读者可了解 3D 生成走向生产可用的具体路径。

4月17日周五
  1. Anthropic:Newsroom(网页)75

    Anthropic Labs 推出 Claude Design

    Anthropic Labs 推出 Claude Design,由 Claude Opus 4.7 驱动的视觉设计工具,面向 Claude Pro、Max、Team 及 Enterprise 订阅者开放研究预览。用户可通过对话快速创建设计原型、幻灯片及营销物料,支持自动应用企业设计系统、多格式导入导出,并能与 Claude Code 无缝衔接。据 Brilliant 反馈,复杂页面设计从 20 余条提示缩减至 2 条,设计到生产周期从数周缩短至单次对话。

    推荐理由:Anthropic 把 Claude 变成了设计协作工具,从草图到代码的链路打通,对非设计师做原型是个实用入口,但能否撼动 Figma 还早。

  2. 蚂蚁 inclusionAI:GitHub 新仓库56

    inclusionAI发布LLaDA2.0-Uni模型

    LLaDA2.0-Uni是一个统一的多模态模型,具备对世界的理解与生成能力。该模型通过整合视觉、语言等多模态信息,实现了跨模态的语义理解和内容生成。其架构支持从图像理解到文本生成、跨模态检索等复杂任务,标志着多模态人工智能向更通用、统一的方向演进。

    推荐理由:蚂蚁 inclusionAI 推出 LLaDA2.0-Uni,主打理解与生成统一架构,但距发布已过两周且信息极少,建议等官方技术报告出来再决定是否跟进。

  3. HuggingFace Daily Papers(社区热门论文)81

    Qwen3.5-Omni技术报告

    阿里通义千问团队发布Qwen3.5-Omni,模型拥有数百亿参数和256k上下文,基于超1亿小时音视频数据训练,在215项基准测试中达SOTA水平,关键音频任务超越Gemini-3.1 Pro。采用混合注意力MoE架构,支持10小时音频与400秒720P视频理解。提出ARIA技术优化流式语音合成稳定性,支持10种语言。模型具备Audio-Visual Vibe Coding能力,可直接基于音视频指令生成代码。

    推荐理由:Qwen3.5-Omni把语音、视频、文本全模态做到一个模型里,且在215项音频任务上超越Gemini 3.1 Pro,这是国内团队在全模态模型上的里程碑,做交互产品的值得关注。

4月16日周四
  1. HuggingFace Daily Papers(社区热门论文)71

    Seedance 2.0:推进面向复杂世界的视频生成

    Seedance 2.0于2026年2月初在国内发布,作为原生多模态音视频生成模型,采用统一高效架构支持文本、图像、音频、视频四种输入。可生成4-15秒、480p/720p音视频,开放平台支持3视频+9图像+3音频的多模态参考,并提供Fast加速版本。相比前代全面提升基础生成与多模态性能,专家评估显示其已达行业领先水平。

    推荐理由:Seedance 2.0 把音视频联合生成真正推到了可用级别,支持多片段、多图片、多音频参考输入,对做视频的创作者是直接的生产力提升。

  2. Hugging Face:Blog(RSS)69

    使用 Sentence Transformers 训练与微调多模态嵌入及重排序模型

    Sentence Transformers 发布了用于训练和微调多模态嵌入与重排序模型的功能。新版本支持将文本、图像等不同模态的数据映射到统一的向量空间,并优化了跨模态检索的精度。关键改进包括对嵌入模型和重排序器进行联合或分阶段训练,显著提升了如图文检索等任务的性能指标。此次更新旨在通过开源工具推动多模态人工智能技术的普及与发展。

    推荐理由:这是训练多模态嵌入模型的全套指南,附带 VDR 微调实验和代码。如果你需要把文本和图像检索对齐到自己的业务数据上,这篇能省掉大量试错时间。

  3. Google Blog:AI(RSS)70

    Gemini 3.1 Flash TTS:下一代表现力AI语音技术

    Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

    推荐理由:Google 把 TTS 的控制权交给了文本指令,音频标签这个设计让语音应用从'选择预设'变成'现场导演',对多模态应用是个实在的增强。

4月15日周三
  1. HuggingFace Daily Papers(社区热门论文)75

    生成式细化网络 GRN:面向视觉合成的新一代范式

    研究团队提出生成式细化网络(GRN),通过分层二值量化(HBQ)突破自回归模型的离散化瓶颈,结合全局细化机制与熵引导采样策略,实现类似人类绘画的渐进式修正与复杂度自适应生成。该模型在ImageNet基准上创下图像重建0.56 rFID与类别条件生成1.81 gFID的新纪录,并成功扩展至文本到图像及视频生成任务。相关模型与代码已全面开源。

    推荐理由:GRN 提出了一种全新的视觉合成范式,用近无损分层二进制量化解决了 AR 模型的离散瓶颈,并且自适应步数生成效率很高,关键还把代码和模型都开源了,做图像和视频生成的很值得动手试一下。

  2. 字节 Seed:Research Papers(网页内嵌数据)66

    字节 Seed 发布 Seedance 2.0 音视频联合生成模型

    字节 Seed 发布原生多模态音视频生成模型 Seedance 2.0,2026 年 2 月初在中国正式上线,采用统一架构支持文本、图像、音频、视频四种输入模态。

    推荐理由:官方技术报告梳理了 Seedance 2.0 的统一架构、多模态输入上限与分辨率规格,读者可对照前代看能力变化。