跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 381–400 条 · 共 437 条
4月14日周二
  1. Google DeepMind:Blog(RSS)68

    Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务

    Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。

    推荐理由:Gemini Robotics-ER 1.6 在机器人推理上迈了一大步,仪器读取和多视角成功检测是真需求,尤其是波士顿动力集成后,做具身智能的团队值得第一时间测试。

4月13日周一
  1. HuggingFace Daily Papers(社区热门论文)77

    RationalRewards:推理奖励在训练与测试时扩展视觉生成

    研究团队发布8B参数奖励模型RationalRewards,基于PARROT框架从偏好数据恢复高质量推理依据,实现打分前生成多维度显式批评。该模型仅用同类基线1/10到1/20训练数据即达开源SOTA水平,性能比肩Gemini-2.5-Pro。其结构化推理奖励不仅为强化学习提供细粒度训练信号,更在测试时通过生成-批评-优化循环无需参数更新即可改进输出,在多个基准上匹敌甚至超越传统RL微调效果。

    推荐理由:这篇论文把视觉生成的奖励模型从黑盒标量变成了带推理的结构化批评,而且发现测试时的生成-批评-改进循环能匹敌昂贵的RL微调,做图像生成和编辑的人应该认真读一下。

  2. HuggingFace Daily Papers(社区热门论文)75

    Audio Flamingo Next:面向语音、声音与音乐的下一代开源音频-语言模型

    Audio Flamingo 系列发布下一代模型 AF-Next,支持长达 30 分钟的复杂音频输入,并引入 Temporal Audio Chain-of-Thought 技术,将中间推理步骤显式对应到时间戳。该模型基于超过 100 万小时的新增数据进行课程式训练,在 20 个音频理解与推理基准测试中显著超越同规模开源模型,部分指标超过更大规模的闭源模型。团队同步开源了 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner 三个变体。

    推荐理由:NVIDIA 开源的这个音频大模型在 20 多个基准上大幅超越前代,长音频理解尤其凶猛,做语音、音乐和声音应用的值得把论文翻一遍。

4月9日周四
  1. Hugging Face:Blog(RSS)81

    基于 Sentence Transformers 的多模态嵌入与重排序模型

    Sentence Transformers 开源社区发布了支持多模态的嵌入与重排序模型。新模型能够同时处理文本和图像输入,生成统一的语义向量表示,并可通过交叉编码器实现细粒度相关性重排序。该版本显著扩展了原框架的纯文本能力,支持图像-文本检索、跨模态匹配等场景,所有代码与预训练模型均已开源,延续了其推动AI民主化的目标。

    推荐理由:Sentence Transformers v5.4 把多模态嵌入和重排变成统一 API,跨模态 RAG 从试验品变成开箱即用,做多模态搜索的开发者可以直接上手复制。

4月3日周五
  1. Artificial Analysis

    Google DeepMind推出Gemma 4系列四款多模态开源模型,支持文本、图像及视频输入。31B(密集架构)与26B A4B(MoE架构)拥有256k上下文窗口,可在单张H100运行;另两款较小模型支持128k上下文。GPQA Diamond测试中,Gemma 4 31B(Reasoning)获85.7%,仅次于Qwen3.5 27B,但输出token仅约1.2M,效率更优;26B A4B(Reasoning)得分79.2%,超越gpt-oss-120B。

    推荐理由:Google发布多模态开源模型Gemma 4,单卡H100可跑且科学推理能力突出

4月2日周四
  1. Hugging Face:Blog(RSS)88

    Welcome Gemma 4: 设备端的 Frontier 多模态智能

    Google 正式发布了 Gemma 4,这是一款前沿的多模态人工智能模型,其核心特点是能够在设备端本地运行。该模型通过开源方式发布,旨在推动人工智能技术的进步与民主化。Gemma 4 的“在设备端”能力意味着数据处理可在本地完成,无需持续连接云端,这有望提升响应速度、增强隐私保护并实现离线使用。此举是 Google 通过开源和开放科学来普及人工智能的持续努力的一部分。

    推荐理由:前沿多模态模型开源,设备端可运行,降低AI部署门槛。

3月31日周二
  1. Hugging Face:Blog(RSS)70

    Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能

    IBM Granite团队发布了Granite 4.0 3B Vision模型,这是一个专为企业文档处理设计的紧凑型多模态大语言模型。该模型参数为30亿,具备视觉理解能力,能够同时处理文本和图像信息,特别针对报告、表格、图表等企业文档进行优化。其紧凑尺寸旨在降低部署和运行成本,使企业能够在资源受限的环境中高效实现文档智能分析、信息提取和知识管理。模型已在Hugging Face平台发布。

    推荐理由:IBM 推出轻量级多模态模型,企业文档场景可直接落地部署

3月30日周一
3月29日周日
  1. Gary Marcus:The Road to AI We Can Trust(RSS)

    当前前沿模型视觉理解的幻象

    当前前沿多模态大模型在标准胸部X光问答基准测试中,无需访问任何图像即可获得顶级排名。这一反常现象暴露出模型视觉理解能力的严重缺陷,表明其性能可能依赖数据偏见或文本线索而非真实的图像解析能力。研究揭示了现有视觉语言模型评估体系的深层漏洞,指出所谓"视觉理解"可能只是缺乏真实感知能力的幻觉。

    推荐理由:揭示多模态基准测试漏洞,医学AI应用需警惕数据泄露风险

3月26日周四
3月25日周三
  1. Google Research:Blog(网页)

    Vibe Coding XR:基于 XR Blocks 与 Gemini 加速 AI + XR 原型开发

    Google XR 团队推出 Vibe Coding XR 工作流,结合 Gemini Canvas 与开源框架 XR Blocks,利用长上下文推理能力将自然语言提示在 60 秒内转化为可交互、支持物理效果的 WebXR 应用。该方案基于 WebXR、three.js 和 LiteRT.js 构建,支持手势交互与深度感知,可在桌面模拟环境或 Android XR 头显中实时预览。已展示的应用包括几何可视化数学辅导和交互式物理实验室,用户可通过捏合等手势操作 3D 对象,快速验证空间交互设计。

    推荐理由:Google推出Vibe Coding XR,用自然语言快速生成可交互的Android XR空间应用。

3月24日周二
  1. Google Developers Blog(RSS)71

    跳跃即玩:利用Gemini与MediaPipe进行开发

    该工作流通过Gemini Canvas,借助高级提示词快速原型化MediaPipe Pose Landmarker等体感游戏机制。开发者可在Google AI Studio中优化原型,采用低延迟的“轻量”模型和稳定的追踪点(如肩部关节点)以确保游戏响应灵敏。最后,流程利用Gemini Code Assist将实验性代码重构为模块化、可用于生产的应用程序,使其能够支持多种多模态输入,从而显著简化了体感控制游戏的开发过程。

    推荐理由:开发者可快速上手AI游戏开发,优化性能并部署生产应用。

3月20日周五
  1. Artificial Analysis

    Mistral发布开源权重模型Mistral Small 4,采用119B参数MoE架构(每token激活6.5B参数),支持可切换的推理/非推理模式及图像输入。推理模式在Artificial Analysis Intelligence Index获27分,超越Mistral Large 3,但低于gpt-oss-120B等竞品。模型token效率优于同类,幻觉率更低(AA-Omniscience -30分),支持256K上下文窗口,采用Apache 2.0许可证。

    推荐理由:Mistral 开源 Small 4,支持混合推理与多模态,Agent 任务表现大幅提升

3月19日周四
  1. Demis Hassabis

    Google 发布 vibe design 平台 Stitch,支持自然语言描述直接生成高保真界面和交互原型,可通过语音实时调整布局。目前仅面向 18 岁以上用户,在 Gemini 支持的英语国家开放。

    引用Google Labs@GoogleLabs

    隆重推出全新的 @stitchbygoogle,这是 Google 的 vibe 设计平台,可将自然语言无缝转化为高保真设计,一气呵成。 🎨用更智能的设计代理进行创作:描述一个新的商业概念或应用愿景,看它在 AI 原生画布上逐渐成形。 ⚡️ 快速迭代:将屏幕拼接成交互式原型,并用可移植的设计系统管理你的品牌。 🎤 用语音协作:使用免手操作的语音交互实时更新布局并探索新的变体。 立即试用(仅限 18 岁以上。目前仅提供英文版本,且仅在支持 Gemini 的国家/地区可用。)→ http://stitch.withgoogle.com

    推荐理由:Google推出AI设计工具Stitch,自然语言生成界面并支持语音协作,顺应Vibe Design趋势

  2. Qwen:Blog Retrieval(API)

    Qwen3.5-Max-Preview 现已上线 Arena

    Qwen3.5-Max-Preview 已登陆 LMSYS Chatbot Arena。Qwen Studio 提供聊天机器人、图像与视频理解、图像生成、文档处理、网页搜索、工具调用及 artifacts 等全栈功能。

    推荐理由:阿里 Qwen3.5-Max 预览版上线 Arena,支持多模态理解与工具调用

3月17日周二
  1. Hugging Face:Blog(RSS)83

    Holotron-12B - 高吞吐计算机使用智能体

    H公司发布了多模态计算机使用模型Holotron-12B。该模型基于NVIDIA开源的Nemotron-Nano-12B-VL模型,使用专有数据混合进行训练,专注于在交互环境中高效感知、决策和行动。其采用混合状态空间模型与注意力机制架构,在单张H100 GPU上实现了比前代Holo2-8B高2倍以上的吞吐量,在100并发基准测试中达到每秒8900个token。在WebVoyager基准测试中,性能从基线的35.1%提升至80.5%,在定位和导航基准上也显著提升。模型已通过NVIDIA开放模型许可在Hugging Face发布。

    推荐理由:高效推理的计算机使用代理模型,适合生产部署,开发者可直接试用。

3月16日周一
  1. Mistral AI:News(网页)72

    Mistral 发布 Mistral Small 4:统一推理、多模态与编码能力并开源

    Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可开源。

    推荐理由:原文给出完整的架构参数、推理档位设置和与 GPT-OSS 120B 的输出长度对比,读者可以据此评估部署成本和适用场景。

3月13日周五
  1. Claude Platform:开发者版本说明(RSS)69

    Claude Opus 4.6 和 Sonnet 4.6 的 1M token 上下文窗口正式可用

    Claude Opus 4.6 和 Sonnet 4.6 的 1M token 上下文窗口现已正式可用,按标准定价计费,超过 200k token 的请求无需 beta header 即可自动生效。同时,所有支持模型的专用 1M 速率限制已移除,改用标准账户限制;使用 1M 上下文窗口时,每请求的媒体上限从 100 提升至 600 张图片或 PDF 页面。

    推荐理由:Claude 的百万 token 上下文终于从 beta 转正,200k token 以上请求不再需要 beta 头,媒体文件限制一口气提到 600 页,做长文档处理的开发者可以直接切生产。

3月12日周四