跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 261–280 条 · 共 437 条
5月29日周五
  1. SenseTime65

    SenseNova-U1-8B-MoT-Infographic 是一个升级后的8B参数信息图表生成模型。其核心提升在于:增强了文本的准确性与可读性,减少了重复和不自然的放大;改进了布局的一致性与合理性,背景更稳定;提升了图表与示意图的渲染质量;并新增了学术内容的渲染支持。

    推荐理由:商汤这个8B信息图生成模型升级了,文本和布局都更稳,对常做数据图表和学术配图的人算个实用的小迭代,没有到改变游戏规则的程度。

  2. LMSYS:Blog(Chatbot Arena 团队)61

    LMSYS与Intel合作通过异构CPU+GPU EPD架构提升视觉语言模型服务性能

    LMSYS团队(Intel与SGLang)通过Dynamo和SGLang框架,为视觉语言模型(VLM)启用了异构编码-预填充-解耦(EPD)架构。该方案将视觉编码任务从GPU卸载至CPU(如Intel Xeon 6747P),与GPU协同工作。在Qwen3-VL-8B-Instruct模型的测试中,采用4 CPU + 1 GPU作为编码器、4 GPU作为预填充解码器(能力比R=12)的配置,在ISL/OSL 128/256、1080p 8张图像的负载下,实现了P99 TTFT和请求吞吐量约1.2倍至1.3倍的提升,并将P99 TPOT降低了约1.3倍至30倍。

    推荐理由:做VLM服务部署的可以认真看一下,用CPU头节点做异构EPD分离,几乎零成本换来了TTFT和TPOT的显著提升,有完整脚本和benchmark,能直接上手试。

5月28日周四
  1. Xiaomi MiMo69

    MiMo-V2.5现已在OpenCode上线——限时免费。🎉 [引用 @opencode]:OpenCode x MiMo V2.5 - 限时免费 1M上下文 • 推理 • 文本 • 图像

    引用OpenCode@opencode

    OpenCode x MiMo V2.5 - 限时免费 1M 上下文 • 推理 • 文本 • 图像

    推荐理由:MiMo-V2.5在OpenCode免费开放,1M上下文加多模态推理,小米的模型迭代不算大新闻,但趁免费白嫖一下国产模型的机会别错过。如果你正在选型,跑个分试试。

  2. HuggingFace Daily Papers(社区热门论文)70

    QUACK:多模态社交推理智能体通信知识的质询、理解与审计

    QUACK 是一个开源评估框架,用于审计多模态社交推理智能体的语言基础性。它从游戏结果、行为轨迹和陈述一致性三个层面评估智能体。其核心的陈述验证管道能从日志中重建轨迹并逐条核查陈述,自动标记空间幻觉、无依据指控等问题。实验评估了三个前沿视觉语言模型,结果显示即使最强的智能体,其15.1%的可验证空间主张也存在幻觉,且超过半数的指控缺乏证据支持。该项目的完整组件已在 GitHub 开源。

    推荐理由:多模态社交 agent 的幻觉问题被严重低估了,QUACK 这套审计框架直接把 20% 的空间谎言和过半的无据指控摊在桌面上,做 agent 安全的必须跟进。

5月27日周三
  1. Runway:News(网页)73

    Runway 推出 Model Context Protocol 服务器

    Runway 正式推出 Runway MCP 服务器,允许任何兼容 MCP 的 AI 智能体(如 Claude、ChatGPT、Cursor)在对话界面中直接生成图像与视频,无需切换工作流。该服务器接入了 Runway 最新的多款 SOTA 模型,包括 Gen-4.5、Seedance 2.0、GPT Image 2、Kling 3.0 及 Nano Banana Pro。其应用场景涵盖为产品制作营销视频、批量生成网站视觉素材、创作角色广告以及在应用开发中集成视觉内容。用户设置简便,通过 runwayml.com/mcp 添加服务器并登录现有 Runway 账户即可使用,无需单独申请 API 密钥。

    推荐理由:Runway 把 Gen-4.5 和 Seedance 2.0 等模型接入了 MCP,以后做产品图、营销视频不用切窗口,这个集成对依赖视觉内容的 Agent 工作流是个 real upgrade。

  2. HuggingFace Daily Papers(社区热门论文)72

    Gemini Embedding 2:来自Gemini的原生多模态嵌入模型

    Google DeepMind推出Gemini Embedding 2,这是一款原生多模态嵌入模型,支持在统一表示空间中嵌入视频、音频、图像和文本。该模型利用Gemini的多模态能力,通过大规模对比学习实现SOTA性能。在关键基准上表现优异:MSCOCO取得62.9 R@1,Vatex取得68.8 NDCG@10,MTEB multilingual达到69.9,MTEB Code达到84.0,超越了专用模型。其统一能力使其适用于RAG、推荐与搜索等下游任务,并在天文学、生物科学、艺术和烹饪等专业领域展现出强大的零样本性能。

    推荐理由:Google 把多模态嵌入统一到一个模型里了,文本、代码、跨模态检索全面刷榜,做 RAG 和搜索的该认真看看了。

  3. HuggingFace Daily Papers(社区热门论文)70

    MRT:用于大规模分层图像生成与编辑的掩码区域Transformer

    MRT是一个20B参数的掩码区域扩散模型,专为多层透明图像生成与编辑设计。它在超过1000万个多语言设计样本上训练,统一了文本到图层、图像到图层和图层到图层三项任务。模型通过选择性token掩码实现灵活的图层生成与编辑,并引入溢出感知画布图层以处理边界不一致问题,支持半透明背景合成。此外,应用扩散蒸馏实现了8步实时生成。实验表明,MRT在所有任务上显著优于先前先进方法与商业系统。用户研究显示,其图像到图层质量优于同期Qwen-Image-Layered模型,推理速度快10-100倍,GPU内存消耗降低50-90%。

    推荐理由:首次把分层图像生成统一到 20B 遮罩扩散框架,溢出画布层的设计挺巧,让图层可以超出边界编辑,蒸馏后能实时跑,做设计工具的团队该仔细读读。

5月26日周二
  1. SenseTime77

    商汤开源了SenseNova-U1(8B dense + A3B MoE)的完整训练代码库。这是一个统一的框架,支持文本到图像、图像编辑、交错生成、文本与视觉理解等多种多模态任务的训练。其设计注重实用性与大规模训练,采用混合并行、流式可恢复数据管道、环境变量配置、解耦模块化设计,并支持从1×8 GPU扩展到多节点集群的规模。代码库以Apache-2.0协议开源。

    推荐理由:商汤把 SenseNova-U1 的训练代码全量开源,支持多模态任务和 MoE,还给了完整的并行策略,做多模态训练的可以直接 fork 过去用,Apache-2.0 很友好。

  2. Runway:News(网页)68

    Project Luxo:跨越AI媒体的恐怖谷

    Runway通过Project Luxo研究发现,AI生成视频已跨越“恐怖谷”。他们向创意生态从业者展示了《The Rogue》等AI短片及广告样片,评估显示观众开始关注故事本身,而非技术瑕疵。所有作品均由单人团队制作,耗时从3周到4小时不等。Runway认为,这标志着AI媒体成熟——当技术足够好以至于“隐形”,观众沉浸于故事时,便实现了这一跨越。

    推荐理由:Runway 用短片和一次百万播放广告测试宣称 AI 视频已越过恐怖谷,观众开始投入故事而非找瑕疵。这对内容生产的心理门槛是一次重塑,但一次推广式的成功不等于行业已稳定跨过。

  3. HuggingFace Daily Papers(社区热门论文)70

    WBench:面向交互式世界模型评估的多轮基准

    WBench 是一个用于系统评估交互式世界模型的多轮基准。它提出了一个五维评估框架,涵盖视频质量、场景设定遵循度、交互指令遵循度、一致性与物理符合性。该基准包含 289 个测试案例与 1,058 轮交互,覆盖了多样化的场景、风格、主体及第一/第三人称视角。评估使用 22 个结合专业视觉模型与大型多模态模型的自动子指标,所有指标均经过人工校验。对 20 个 SOTA 模型的评测发现,目前尚无模型在所有维度上表现均优。

    推荐理由:视频世界模型的评估终于有了统一尺度,WBench 从画面质量到物理一致性覆盖五个维度,289 个测试用例把 20 个模型拉平一看,没有谁全面领先,做这方向的值得拿来跑一遍。

  4. Elon Musk67

    xAI发布了面向非技术背景的SuperGrok和X Premium+用户的Grok Build入门视频教程。教程提供了分步指南,核心内容包括:通过一条命令快速安装Grok Build;利用其创建真实的网站;使用内置的Grok Imagine工具自动生成图像与视频;以及在不同文件夹中同时运行多个项目。整个过程无需任何编程经验,并且Grok可以协助执行命令。

    引用Dan@Daniel_Farinax

    初学者视频:如何安装和使用 Grok Build(专为非技术背景的 SuperGrok 和 X Premium+ 用户制作) 朋友们问了我太多问题,所以我做了这个简单的分步指南。 你将清楚地看到如何: • 用一条命令在几秒内安装 Grok Build • 创建真正的网站 • 使用 Grok Imagine 自动生成图片和视频 • 在不同文件夹中同时运行多个项目 Grok 甚至会替你运行命令。无需任何编程经验。 观看完整演示 👇

    推荐理由:Elon 亲自转发的教程把 Grok Build 门槛压到了零编码,直接面向普通用户,是目前最友好的官方入门信号。

5月25日周一
  1. 蚂蚁 inclusionAI:HuggingFace 新模型58

    inclusionAI 发布 SingGuard 系列模型

    inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-4b。该模型是一种策略自适应多模态 LLM 护栏,将安全策略作为运行时输入而非固定训练分类,支持对文本、图像、图文、多语言、查询侧和响应侧进行安全评估。SingGuard 采用动态推理流程,可先快速输出首 token 安全信号,再继续生成更精确的判断。在涵盖多模态安全、图像安全、文本查询安全、文本响应安全、多语言查询安全及多语言响应安全的六大类基准测试中,SingGuard 达到平均 SOTA 性能。模型支持标准 Transformers 和 vLLM 聊天消息输入,无需手动改写提示词。

    推荐理由:蚂蚁集团开源的多模态安全护栏模型,把审核策略变成了动态可配置参数,对需要灵活合规的部署团队来说比单纯调 API 更可控。普通用户看看就好,做安全的人值得试。

  2. 蚂蚁 inclusionAI:HuggingFace 新模型71

    <中文标题>SingGuard: 策略自适应多模态护栏模型族开源</中文标题>

    <中文摘要>SingGuard 是一个策略自适应的多模态护栏模型族,包含 Sing-Guard-4b 和 Sing-Guard-8b 两个版本。它将安全策略作为运行时输入而非固定分类,部署团队可自定义自然语言规则而无需重训练模型。支持文本、图像、图文、多语言以及查询端与响应端的安全评估,提供快速和快慢结合两种推理模式。在涵盖多模态安全、纯图像安全、文本查询/响应安全、多语言查询/响应安全六大类基准上取得平均 SOTA 表现。模型已开源至 HuggingFace 和 ModelScope。</中文摘要>

    推荐理由:蚂蚁的 SingGuard 把安全策略变成了运行时输入,意味着审核规则可以随时改而不必重训模型,这对做内容安全的产品人是真省事,值得跟进。

  3. 蚂蚁 inclusionAI:HuggingFace 新模型74

    inclusionAI 发布 SingGuard-8b 策略自适应多模态安全护栏模型族

    inclusionAI 发布 SingGuard-8b,一个策略自适应(policy-adaptive)的多模态 LLM 安全护栏模型族,支持文本、图像、图文、多语言、查询侧和响应侧的安全评估。SingGuard 将活跃安全策略作为运行时输入,部署团队无需重训模型即可按默认或自定义自然语言规则进行审核。模型采用动态推理流程,先快速路由输出初步安全信号,再在需要时继续生成更精确的判断。在六大基准类别上,SingGuard 取得平均 SOTA 性能,并展现出对运行时策略的强适应性。模型支持标准 Transformers 和 vLLM 聊天格式输入。

    推荐理由:蚂蚁集团开源的这个多模态安全防护模型把安全策略变成运行时参数,不用重训就能适配新规则,做内容审核的团队可以直接套用,降低定制成本。

  4. 蚂蚁 inclusionAI:HuggingFace 新模型69

    蚂蚁 inclusionAI 发布策略自适应多模态安全护栏模型 Sing-Guard-8b

    SingGuard 是蚂蚁 inclusionAI 推出的策略自适应多模态大语言模型安全护栏模型族(版本 Sing-Guard-8b),支持纯文本、纯图像、图文混合、多语言查询与回复的安全评估。其核心设计将安全策略作为运行时输入,部署团队可基于默认分类或自定义自然语言规则评估内容,无需重新训练模型。模型内置 fast-slow 动态推理流程:首 token 路由快速输出安全信号,需深度推理时继续生成更精确的最终判断。在涵盖多模态安全、纯图像安全、文本查询与回复安全、多语言查询与回复安全的六大基准测试上取得平均 SOTA 性能,并已开源至 HuggingFace 与 ModelScope。

    推荐理由:蚂蚁集团开源的多模态内容审核模型,最大亮点是运行时动态注入安全策略而不需重训,对需要灵活定制审核规则的团队是低门槛的高分工程实现。

  5. 蚂蚁 inclusionAI:HuggingFace 新模型69

    inclusionAI 发布 SingGuard 系列模型,首版为 SingGuard-2b

    inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-2b,用于文本、图像、图文、多语言及查询/回复侧的安全评估。SingGuard 将安全策略作为运行时输入而非固定训练分类,支持部署团队在不重新训练模型的情况下,依据默认或自定义自然语言规则进行内容审核。该模型在多项多模态安全基准上取得平均最优性能,支持快速首 token 路由与深度推理结合的动态推理流程,兼容 Transformers 和 vLLM 的 chat 消息输入。

    推荐理由:把安全策略写成自然语言就能即插即用,不用重新微调,这个思路对需要频繁调整合规规则的产品团队很实用。虽然只是个2B的小模型,但开箱即用的动态适配能力值得关注。

  6. 蚂蚁 inclusionAI:HuggingFace 新模型68

    inclusionAI 发布 Sing-Guard-2b:策略自适应多模态大模型安全护栏

    inclusionAI 开源了 Sing-Guard 模型家族,版本包括 Sing-Guard-2b 和 Sing-Guard-8b。该模型将安全策略作为运行时输入,支持文本、图像、图文及多语言场景的查询侧

    推荐理由:SingGuard把安全策略变成运行时输入,不用再为新规则重新训练模型,这对需要频繁调整审核标准的团队来说是个实用的发布。

  7. 蚂蚁 inclusionAI:GitHub 新仓库67

    蚂蚁 inclusionAI 开源多模态安全护栏模型 SingGuard

    SingGuard 是蚂蚁 inclusionAI 开源的多模态安全护栏模型族,提供 2B、4B、8B 三个参数版本。它将安全策略作为运行时输入,支持文本、图像、图文、多语言及查询/回复侧的安全评估,无需重新训练即可适配不同规则。采用快慢动态推理机制,在低延迟场景下输出紧凑判断,对模糊或高风险内容进行策略引导的推理。在多模态安全、图像安全、文本查询与回复安全、多语言查询与回复安全等基准上达到 SOTA 平均性能。模型已上架 HuggingFace 和 ModelScope。

    推荐理由:蚂蚁 inclusionAI 把安全护栏做成了“运行时可配置”的模型,换审核规则不用重训,对需要快速适配法规的团队是个真需求。不过生态刚起步,暂时还是小众工具。

5月23日周六
  1. Hugging Face:Blog(RSS)63

    NVIDIA 发布 Nemotron-Labs Diffusion 系列模型,支持三种生成模式

    NVIDIA 发布 Nemotron-Labs Diffusion 系列,含 3B、8B、14B 文本模型和 8B 视觉-语言模型(VLM),均采用商用友好的 NVIDIA Nemotron Open Model License 或 NVIDIA Source Code License。模型支持自回归、扩散(逐块并行生成后逐步精炼)和自推测(扩散草拟候选 token 再自回归验证)三种模式。8B 模型平均准确率比 Qwen3 8B 提升 1.2%,扩散模式每次前向传递的 token 数(TPF)达自回归的 2.6 倍,自推测达 6–6.4 倍。模型在 1.3T tokens 上预训练、45B tokens 上微调,代码与模型已发布于 HuggingFace 和 GitHub,推理将获 SGLang 支持。

    推荐理由:自推测模式让文本生成速度飙到AR模型的4倍,而且输出质量无损。NVIDIA这次开源的不仅是个新模型,更是一套能直接用在现有流程里的加速方案。