跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 41–60 条 · 共 437 条
8月12日周三
  1. IT之家(RSS)71

    LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI

    LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。

    推荐理由:生成速度比同类快数倍,且开放权重允许微调,对需要高频出片或自定义视觉风格的应用,其自托管成本可能低于调用闭源API。

  2. Google Blog:AI(RSS)69

    AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

    Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。

    推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。

  3. Liquid AI 模型与工程博客(网页)67

    Liquid AI 发布 LFM2.5-VL-3B 边缘端视觉语言模型

    Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,屏幕理解 ScreenSpot-v2 平均 80.7,ToolSandbox 从 26.4 升至 59.5,RefCOCO 从 57.1 升至 87.9。

    推荐理由:官方给出与更大模型对比的基准数据和端侧、GPU 实测速度,读者可据此评估它在边缘部署场景的适用性。

8月11日周二
  1. MarkTechPost(RSS)72

    用 ComfyUI API 实现 MiniMax-H3 多模态视频与音频生成流水线

    本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。

    推荐理由:用 Python 编程替代 ComfyUI 图形界面,在 Colab 上搭建 MiniMax-H3 视频生成管道,并自动适配不同 GPU 显存方案,教程提供的全流程代码可直接复用。

8月10日周一
  1. Qwen71

    👀 看见只是开始。 借助 Qwen-MM-Plugins,让你的智能体原生支持多模态——读取图片、视频和文档,编辑视频,处理 3D/CAD,以及更多。 从多模态模型 → 多模态智能体。🚀 观看实际效果:https://github.com/QwenLM/Qwen-MM-Plugins

    推荐理由:让智能体直接获得视觉、文档和 3D 感知能力,把原本需要单独集成的工作流变成一组可调用的插件,原型开发速度可能因此加快。

  2. MarkTechPost(RSS)75

    NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

    NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。

    推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。

8月8日周六
  1. IT之家(RSS)76

    苹果 Mac 简体中文支持文档更新,“Apple 智能”阿里千问扩展现身

    苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。

    推荐理由:苹果智能在中国大陆的落地路径终于清晰,支持文档揭示了写作工具和Siri集成千问的具体方式,Mac用户将能在系统级直接使用大模型能力。

8月7日周五
  1. Runway75

    Seedance 2.5 现已登陆 Runway。每次生成最多可引用 50 个角色参考,构建充满角色的完整世界;可创作最长 30 秒、带完整音效与对白的片段,再按你的故事需求随意剪辑与延展。 点击下方链接立即开始。

    推荐理由:支持最多50个角色引用和30秒带对话的片段,从单镜头生成迈向构建完整场景,更适合需要连贯叙事的视频创意。

8月6日周四
  1. NVIDIA Blog(RSS)71

    NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

    NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

    推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。

  2. OpenBMB65

    面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。

    推荐理由:将摄像头面部信号、语音对话和LoRA角色塑形组合进一个可玩演示,为交互式AI角色提供了比常见聊天机器人更丰富的多模态模板。

8月5日周三
  1. MarkTechPost(RSS)79

    NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

    NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

    推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。

  2. HuggingFace Daily Papers(社区热门论文)74

    Video-DeepResearch:迈向下一代多模态深度研究智能体

    Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。

    推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。

  3. 字节 Seed:Research Feed(网页内嵌数据)78

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

    字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

    推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。

  4. Qwen68

    阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

    引用Qwen Cloud@qwen_cloud

    🔔 Qwen-Image-3.0 现已在 Qwen Cloud 上线! 在 Arena. ai 的文生图竞技场 @arena 中,位列中国模型第 1 名、主流模型第 2 名,现在只需一次 API 调用即可使用。 - 支持高达 4.5k token 的提示词:一次生成报纸、故事板、菜单、试卷 - 文字清晰度低至 10px,细节近乎照片级 - 支持 12 种语言、100+ 种艺术风格,逼真的 UI 模拟 - 生成 + 编辑集于一个模型 💰价格: Qwen-Image-3.0 Pro — 最适合复杂布局、精准文字渲染和商业级视觉,每张图起价 $0.04。 Qwen-Image-3.0 Standard — 适合批量、日常图像生成,每张图起价仅 $0.03。 Qwen-Image-3.0-Pro 与 Standard。从提示词到可直接投产的图像。 👉 在 Qwen Cloud 上试用并获取你的 API key:https://www.qwencloud.com/models/qwen-image-3.0-pro?utm_content=g_20000001188 - 主流模型 = 日均 MaaS API 调用量超过 10 万的模型系列 #QwenCloud #Qwen

    推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。

  5. OpenRouter66

    @bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。 一个统一的视频、音频、图像和动作预测多模态模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练。

    推荐理由:联合训练的统一架构下,视频生成与图像、音频共享基础能力,跨模态创作的结果可能更连贯,改变了单独优化各模态的传统思路。

  6. SenseTime67

    商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。

    推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。

  7. LlamaIndex:产品、工程与评测66

    LlamaIndex:文档 OCR 不会被前沿模型商品化,LlamaParse Agentic 以 84.9% 领先

    LlamaIndex 发文反驳文档 OCR 正被前沿模型商品化的观点,称帕累托前沿仍远高于最新前沿模型。其开源的 ParseBench(约 2,000 个人工核验的企业页面、167,000+ 条测试规则)显示,GPT-4o 到 GPT-5.5 三代模型解析准确率提升约 24 分但每页成本约翻四倍,最新最贵模型仍比专用前沿低 20 分。

    推荐理由:文章用 ParseBench 数据论证文档 OCR 不会被前沿模型商品化,并给出路由、蒸馏、文本层复用等可迁移的工程方法。