跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 421–437 条 · 共 437 条
10月24日周五
  1. 美团 LongCat:HuggingFace 新模型

    美团开源全模态模型LongCat-Flash-Omni

    美团开源全模态模型LongCat-Flash-Omni,采用5600亿参数MoE架构(激活270亿),支持128K上下文与实时音视频交互。模型基于快捷连接MoE与零计算专家,配备轻量级编解码器及分块特征交错机制,通过课程式渐进训练提升效率。在OmniBench、WorldSense等基准测试中超越Qwen3-Omni与Gemini-2.5-Pro,在文档理解、语音识别及GUI控制等任务中达到领先水平。

    推荐理由:美团开源 560B 参数多模态模型,27B 激活即可实现实时音视频交互

  2. Google DeepMind:Blog(RSS)

    Gemini 2.5 Computer Use 模型发布

    Gemini 2.5 Computer Use 模型基于 Gemini 2.5 Pro 构建,专门用于驱动能与用户界面交互的 agent,现已通过 API 以预览版形式提供。

    推荐理由:Google 发布 Gemini 2.5 Computer Use 模型,支持 Agent 自主操作图形界面

10月21日周二
  1. Together AI 研究与产品博客(RSS)66

    Together AI 上线 40 多个图像与视频生成模型,新增视频生成 API

    Together AI 宣布扩展模型库,通过 Runware 合作集成 20 多个视频模型(含 OpenAI Sora 2、Google Veo 3、Minimax Hailuo、Kling v2.1)和 15 个以上图像模型(含 Google Imagen 4.0 Ultra、Nano Banana、Qwen Image),共 40 多个。

    推荐理由:Together AI 官方给出了 40 多个图像与视频模型的名称、时长和逐模型定价,开发者可据此评估能否用一个平台替代多家供应商。

10月15日周三
  1. Anthropic:Transformer Circuits(可解释性研究)83

    Circuits 更新 — 2025年10月

    Anthropic可解释性团队分享了多项研究进展。研究发现,从Haiku 3.5到Sonnet 4.5等模型中存在跨模态视觉特征,能够识别ASCII艺术和SVG代码中编码的语义概念,如眼睛、嘴巴、狗、猫等。这些特征依赖于视觉描绘的上下文环境,例如,SVG圆形元素只有在位于激活“面部”特征的更大结构中时才会激活“眼睛”特征。在生成过程中对部分特征进行引导,可以对应修改文本艺术的语义,例如将ASCII表情从皱眉转为微笑,或为SVG面部添加皱纹。研究还发现模型存在类似“人脸幻想”的倾向,会将形状解释为动物绘图的组成部分。这些特征对人类手绘的SVG同样有效。

    推荐理由:为AI可解释性研究提供新实验方法,启发跨模态模型设计。

10月1日周三
8月15日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/UI-Venus

    UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。

    推荐理由:蚂蚁这个纯截图驱动的 UI Agent 在当时算是早期探索,代码开源可直接用,做 GUI 自动化的值得看看底层怎么实现元素定位和导航。

8月11日周一
  1. Saining Xie

    这不只是建模问题。也是基准测试问题。

    引用Tairan He@TairanHe99

    我简直不敢相信 GPT-5 会犯这种错误,直到 @ziqiao_ma 向我指出来。 强烈推荐这篇关于多模态 LLM 以视觉为中心评估的论文(https://arxiv.org/abs/2406.16860),作者是 @sainingxie——现在想象一下把同样的严谨性应用到 VLA 上。

    推荐理由:当前多模态模型靠语言捷径'作弊',真实场景落地将暴露致命隐患

7月25日周五
  1. 上海人工智能实验室 InternLM:原创项目67

    上海AI实验室开源 Intern-S2-Preview-397B 与 Intern-S2-Preview-35B 科学多模态模型

    上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。

    推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。

7月23日周三
  1. Modal 官方工程博客(RSS)69

    Modal 实测:用开源 ASR 模型将批量语音转写提速 100 倍、成本降 100 倍

    Modal 工程团队在平台上部署 NVIDIA parakeet-tdt-0.6b-v2 与 canary-1b-flash 开源 ASR 模型,对约一周(7×24 小时)ESB 基准音频做批量转写,结果比所测专有 API 快 112 倍或便宜 200 倍,且错误率略低,实现了一分钟内以 1 美元转写一周音频。

    推荐理由:原文给出可复现的批量转录优化方法与端到端实测数据,读者可以据此在自己的语音转写服务中权衡成本与吞吐。

6月5日周四
  1. Answer.AI 官方研发博客(RSS)78

    Answer.AI 发布 ReadBench:揭示视觉语言模型在长文本图像阅读上的显著性能衰减

    Answer.AI 推出新基准 ReadBench,专门评估视觉语言模型(VLM)从图像中提取和推理文本信息的能力。研究发现,虽然高分辨率对生成任务影响不大,但几乎所有 VLM 在处理多页长文档图像时均出现显著性能下降,表明当前 Visual RAG 方案在处理长上下文时尚不可行。相比之下,GPT-4o 在短上下文和多页场景中表现相对较好,整体性能衰减较小。该基准已开源,涵盖 MMLU、GPQA 等数据集的图像化版本。

    推荐理由:针对热门的多模态检索增强生成(Visual RAG)场景提供了关键实证数据,揭示了 VLM 在长文档阅读上的实际瓶颈,为开发者选择模型和优化管道提供重要参考。

6月3日周二
  1. Suno:Blog(网页)76

    更高水平的创意控制 · Suno团队

    Suno发布了新的创作工具,旨在将创意控制权完全交还给艺术家。新功能包括支持上传最长8分钟的音频、具备行业首创编辑工具(如歌词替换、段落修改和重混)的升级版歌曲编辑器,以及可调节创作风格的“创意滑块”。创作完成后,用户可利用前沿技术将轨道分离为12条独立音轨(如人声、鼓、贝斯)进行预览和下载,便于在数字音频工作站(DAW)中进行后续编辑。

    推荐理由:Suno 这次不是加几个 style,而是给了波形编辑和 12 轨分离,把 AI 音乐从生成器变成了制作工具,音乐创作者可以进来真正干活了。

5月20日周二
4月14日周一
  1. MiniMax:Blog(网页)

    MiniMax MCP Server

    MiniMax 发布 MCP Server,集成文本转语音、语音克隆、文生图、文生视频等多模态能力。支持 Claude Desktop、Cursor、Windsurf 等主流 MCP 客户端,通过统一工作流实现文本到音视频的一站式生成,面向创作者和开发者免费开放。

    推荐理由:MiniMax MCP Server 上线,支持语音克隆、文生图/视频并兼容 Claude Desktop 等主流客户端

12月13日周五
11月4日周一
  1. xAI:News(网页)

    Grok API 公测版发布

    xAI 启动 Grok API 公测,发布新模型 grok-beta,支持 128k 上下文、函数调用及系统提示,视觉版本下周上线。开发者每月可获 $25 免费额度至年底,已购预付额度可叠加。API 兼容 OpenAI 与 Anthropic 格式,修改 base_url 即可迁移。

    推荐理由:xAI开放Grok API公测,每月送$25额度且兼容OpenAI接口,开发者可立即体验

5月14日周二
  1. Sam Altman:Blog(RSS)

    GPT-4o

    OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。

    推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略

4月12日周五
  1. xAI:News(网页)

    Grok-1.5 Vision 预览版

    xAI 发布 Grok-1.5 Vision 预览版,新增视觉理解能力,可处理图像、图表及文档内容,支持跨模态推理与视觉问答,现面向早期测试者开放试用。

    推荐理由:xAI发布Grok-1.5 Vision预览版,具备多模态视觉理解能力