跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–120 条 · 共 437 条
7月17日周五
  1. 公众号:通义实验室(千问)76

    Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

    通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。

    推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。

  2. HuggingFace Daily Papers(社区热门论文)73

    ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

    最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。

    推荐理由:前沿多模态模型在需要反复观察的任务上几乎全部翻车,最高分模型只做对 10%,人类 96%,说明现在的大模型不是真在看,而是在猜。做视觉的人应该认真看这篇。

  3. HuggingFace Daily Papers(社区热门论文)81

    RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%

    淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在“猜你喜欢”信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。

    推荐理由:淘宝首页推荐搬上大模型做推理引擎,记忆+混合模态+潜在推理三件套,带来 +1.28% IPV 同时节省 52.4% 算力,推荐系统真的开始重写成本公式了。

  4. HuggingFace Daily Papers(社区热门论文)73

    NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型

    NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。

    推荐理由:NVIDIA 这次把音频和视觉在长视频上的联合推理做成了全开源模型,AV-Skills 数据集和 TAVIT 推理框架是亮点,做视频理解的开发者可以直接拉下来用。

  5. IT之家(RSS)79

    Kimi 最强模型 K3 发布,Frontend Code Arena 跑分登顶

    月之暗面推出迄今最强模型 Kimi K3,拥有 2.8 万亿参数和 100 万 Tokens 上下文窗口。该模型在 Frontend Code Arena 中以 1679 分超越 Claude Fable 5 位居第一,在 7 个前端领域中的 6 个排名 #1。API 定价为每 100 万 Tokens 输入 2 元(缓存命中)或 20 元(缓存未命中),输出 100 元。

    推荐理由:Kimi K3 的 2.8T 参数和 100 万上下文不是数字游戏,前端跑分实打实地压过 Claude Fable 5,七个子领域拿六个第一,这对做前端和长文档处理的人是个明确信号,可以下场试了。

  6. Moonshot AI:Kimi Blog70

    Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

    Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。

    推荐理由:这是一个把视觉感知拆成原子能力的基准,所有模型不及格,而且猜测多于感知的发现很扎心,做多模态的团队应该拿来测一下自家模型。

  7. Moonshot AI:Kimi Blog81

    Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口

    月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。

    推荐理由:首个开源 3T 级模型,架构上有 KDA 和 AttnRes 创新,在超长程编码和知识工作上比肩闭源。权重两周后放出,所有做 agent 的都该盯紧。

7月16日周四
  1. 公众号:昆仑万维(天工)66

    天工短剧工作台推出“Agent智能分镜+无限画布”双轨创作模式,告别AI短剧“随机抽卡”

    天工短剧工作台(SkyProduction)推出“Agent智能分镜+无限画布”双轨创作模式,将导演思维拆解为六个可干预环节,通过站位图锁定和多视细节图生成解决角色漂移、变脸问题。该工作台支持720°全景图、3D导演台、多账号分级管理及数据中心,并原生支持英文短剧全流程处理。其三部精品短剧上线DramaWave仅7天,均实现百万美元级营收。

    推荐理由:天工短剧工作台把导演思维拆解成可干预的站位、光影和调度环节,降低了从单镜头到连续叙事的落差,适合需要稳定产出精品短剧的团队。

  2. Thinking Machines70

    今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵

    推荐理由:多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。

7月15日周三
  1. IT之家(RSS)82

    国行 Apple 智能完成备案,阿里千问将集成至苹果 AI 能力

    苹果技术开发(上海)有限公司的“Apple 智能”大模型已于 2026 年 7 月 8 日完成备案,适用场景为苹果手机。阿里千问将作为 AI 能力集成至 Apple 智能,为 iOS、iPadOS、macOS 和 visionOS 的中国用户提供文本与图像理解、内容生成等功能,用户无需在应用间切换即可直接体验。

    推荐理由:苹果AI备案落地,国行iPhone用户终于等到,但集成的不是自研而是阿里千问,对苹果AI生态和国内AI格局都算一个交代。

  2. 公众号:通义实验室(千问)73

    阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

    阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。

    推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。

  3. Together AI 研究与产品博客(RSS)76

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 提供 Day 0 推理服务

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 于发布当日在其 Serverless 平台提供访问,支持 1M 上下文窗口和 OpenAI 兼容 API。

    推荐理由:原文来自提供推理服务的合作方,给出了 Inkling 的架构细节、参数规格和初步评测,读者可据此了解新模型的技术取向与可用入口。

  4. vLLM 官方博客(RSS)74

    vLLM 实现 TML Inkling Day-0 支持并完成推理性能优化

    vLLM 宣布对 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling 提供 Day-0 支持,覆盖 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本,支持文本、图像、音频输入和最长 1M token 上下文。

    推荐理由:原文给出 Day-0 支持的具体性能数字、架构优化细节和精度对比,读者可以评估该模型在自己的推理工作流中的可用性。

  5. Hacker News 热门(buzzing.cc 中文翻译)76

    Bonsai 27B:首款可在手机上运行的27B级多模态模型

    Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。

    推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。

  6. Google Developers Blog(RSS)58

    Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来

    在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。

    推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日周二
  1. HuggingFace Daily Papers(社区热门论文)76

    小米发布Xiaomi-Robotics-U0:380亿参数多模态自回归模型统一具身合成

    小米推出Xiaomi-Robotics-U0,一个380亿参数的多模态自回归模型,用于统一具身合成。该模型将具身生成视为基础图像与视频生成的延伸,联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。它是首个支持跨多种机器人形态的高质量多视角场景生成模型,并引入结构化可控具身迁移。该模型在单步与序列生成任务上达到SOTA,在具身场景生成与迁移的人类评估中超越GPT-Image-2.0,在World Arena具身视频生成排名第一,并将pi_0.5在真实世界操控任务上的分布外成功率从36.9%提升至63.2%。代码与检查点已开源。

    推荐理由:小米这个 38B 的统一具身生成模型,把图像、编辑、场景生成等全塞进一个框架,并在真实机器人操作任务上把 pi_0.5 的成功率从 36.9% 拉到 63.2%,做具身智能的值得认真看。

  2. IT之家(RSS)72

    高德发布通用世界模型工坊 ABot-WorldStudio,已开放测试

    阿里巴巴旗下高德发布通用世界模型工坊 ABot-WorldStudio,并开放测试。该产品将交互式视频生成与 3DGS 场景生成统一,用户输入文字或图片即可生成可实时交互、可分享的 AI 世界。工坊内置“时空任意门”,穿越后可跃迁至另一完整 3D 世界。官方实测单次连续推理稳定运行超1小时,无崩溃、无质量衰减。底层模型 ABot-World0 与 ABot-3DWorld0 均可在单张 5090 上本地部署,已全面开源。

    推荐理由:把世界模型从一分钟短片推进到小时级稳定探索,还支持本地一张消费级显卡跑,这对做具身智能和边界探索的团队是个值得上手的信号。

  3. SenseTime74

    商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

    推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

  4. HuggingFace Daily Papers(社区热门论文)74

    Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元

    Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。

    推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。