跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 341–360 条 · 共 437 条
5月8日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)86

    通过 API 中的新模型推进语音智能

    OpenAI API 推出了新的实时语音模型,能够进行推理、翻译和语音转录。这些模型显著提升了语音交互的自然度与智能水平,支持实时处理与多语言转换。新功能旨在为开发者提供更强大的工具,以构建更流畅、更智能的语音应用体验。

    推荐理由:语音模型不再只是‘听写’,开始能推理和翻译了,OpenAI这次API更新的几个新模型把语音智能推向更实用的阶段,做语音产品的值得赶紧试试。

  2. Z.ai73

    GLM-5V-Turbo 技术报告:迈向原生多模态智能体基础模型 本报告总结了GLM-5V-Turbo在模型设计、多模态训练、强化学习、工具链扩展以及与智能体框架集成等方面的主要改进。这些进展使其在多模态编码、视觉工具使用和基于框架的智能体任务中表现出色。 http://arxiv.org/abs/2604.26752

    推荐理由:智谱把多模态、RL和Agent工具链捆成一体,这篇报告对做多模态Agent的人有直接参考价值,不只刷榜还有工程细节。

5月7日周四
  1. HuggingFace Daily Papers(社区热门论文)75

    OpenSearch-VL:前沿多模态搜索智能体的开源方案

    研究团队推出完全开源的OpenSearch-VL方案,用于训练前沿多模态深度搜索智能体。该方案包含三大核心:通过维基百科路径采样、模糊实体重写和视觉定位构建的高质量训练数据集(包括用于微调的SearchVL-SFT-36k和用于强化学习的SearchVL-RL-8k);统一文本搜索、图像搜索、OCR及图像处理工具的多样化环境;以及能处理级联工具失败的多轮致命错误感知GRPO训练算法。基于此训练的智能体在七个基准测试中平均提升超过10分,在多项任务上达到与专有商业模型相当的水平。所有数据、代码和模型均将开源。

    推荐理由:把多模态搜索 agent 的完整训练配方开源了,数据、环境、算法全都有,七个基准平均涨 10 点,直接对标商业模型,做深度搜索的同学可以无脑跟。

  2. xAI:News(网页)79

    Grok Imagine API 推出“Quality Mode”图像生成与编辑功能

    xAI正式向企业开发者和团队推出Grok Imagine API的“Quality Mode”图像生成与编辑功能。该模式在真实性、文本渲染和创意控制上实现显著提升,能生成细节精细、纹理准确、场景逼真的图像,并具备清晰的多语言文本生成能力。在独立排行榜中,该API已位列顶级模型之列。定价为输入提示每次0.01美元,输出图像根据分辨率(1K或2K)每张费用在0.05至0.07美元之间。此功能适用于产品可视化、营销素材快速生成、用户内容风格创作等多种商业场景。

    推荐理由:Grok Imagine 的 Quality Mode 在写实度和文字渲染上提升很明显,对需要高频生成产品图和 UGC 内容的品牌团队是个实在的更新,API 直接能用,单张才几分钱。

  3. Apple Machine Learning Research(RSS)73

    从位置认知到功能理解:为多模态大语言模型设立空间功能智能基准

    现有基准如VSI-Bench主要评估基础几何感知能力,但未能触及具身智能所需的高阶认知。为此,研究团队推出了空间功能智能基准SFI-Bench,该基准包含超过1700个问题,数据来源于多样化的第一人称室内扫描视频。SFI-Bench旨在系统评估多模态大模型从物体位置感知到功能意图理解的高级空间推理能力,标志着对智能体空间认知的评估从几何层面迈向功能层面。

    推荐理由:Apple 自己搞的 SFI-Bench 把评估从几何定位推进到功能理解,这个方向很对,做具身智能和空间推理的团队该跟一下。

  4. Google Gemini67

    通过个人智能与Nano Banana 2的协同工作,您现在可以将兴趣转化为Gemini中的图像。 请勿错过我们在Discord上的下一次社区活动,届时将有最新版本团队的现场演示和问答环节。 👉加入我们的Discord观看直播:http://discord.gg/gemini 📅 今天太平洋时间中午12:00

    推荐理由:Nano Banana 2 把 Gemini 的图像生成从写 prompt 变成了识别你的兴趣,不用费力描述也能出图,对普通用户可能是真痛点,看直播看看实际效果。

5月6日周三
  1. IT之家(RSS)71

    豆包大模型家族首款全模态理解模型:字节跳动 Doubao-Seed-2.0-lite 升级

    字节跳动火山引擎发布豆包大模型家族首款全模态理解模型 Doubao-Seed-2.0-lite 升级版。该模型原生统一支持视频、图像、音频和文本理解,并能进行跨模态联合推理,在物理、医疗等学科推理及细粒度感知上表现超越此前Pro版本。音频方面支持19种语种转写及多语种互译,多项基准测试优于Gemini-3.1-Pro。同时,其Agent、Coding与GUI能力升级,能更稳定处理长任务、胜任深度开发,并实现界面理解与操作执行的闭环。新版本已在火山方舟上线,旨在为企业提供高性价比的全模态任务部署方案。

    推荐理由:豆包Seed 2.0 lite把视频、音频、图片、文字原生塞进一个模型,还顺手强化了Agent和GUI操作,对需要全模态处理的企业来说,这可能是目前性价比最高的选择。

  2. IT之家(RSS)70

    苹果 iOS 27 将允许用户选择第三方 AI 模型,支持谷歌与 Anthropic 等

    据报道,苹果计划在秋季发布的iOS 27等系统中,推出名为“Extensions”的新功能,允许用户自行选择已通过App Store集成的第三方AI模型(如谷歌、Anthropic的模型),来驱动设备上的文本生成、图像编辑等AI功能。此举将打破此前ChatGPT作为唯一第三方选项的独占地位。同时,Siri将支持更换不同音色以区分内外模型,并迎来独立App及更深度的系统整合。苹果将在App Store设立专区展示兼容应用,并对第三方模型生成的内容免责。

    推荐理由:苹果放开 AI 模型底层的选择权,让谷歌和 Anthropic 进入原先 OpenAI 独占的地盘,这比发一个新模型更有生态意义——手机 OS 正在变成 AI 的分发渠道。

  3. Google AI Developers68

    Gemini API 文件搜索工具近日扩展三项功能更新,旨在帮助开发者更轻松地构建高精度多模态检索增强生成系统。更新包括:多模态支持,通过Gemini Embedding 2模型实现对图像和文本的同步推理;自定义元数据过滤,允许为文件添加键值标签以结构化非结构化数据,从而提升搜索速度;精确引用功能,能够捕获并返回每条索引信息的精确来源,如页码。开发者可通过Google AI Studio的示例应用体验这些功能,与图像和文档库交互,提问并追溯答案来源。

    推荐理由:如果你在用 Gemini 搭 RAG 系统,这三项更新能直接改善搜索精度和可解释性,多模态搜索终于把图片和文档打通了,值得马上试试。

  4. Sam Altman69

    5.5 instant 今日登陆 ChatGPT! 在我看来这是一个相当大的升级,我真的很喜欢使用它。 [引用 @ericmitchellai]:Excited that we're updating the default model in ChatGPT today! 5.5 instant 在智能、图像感知和事实准确性方面都有显著提升。 它还更新了写作风格,使其更平实、更直接。 你的愿望清单上有什么?

    引用Eric@ericmitchellai

    很高兴地宣布,我们今天正在更新 ChatGPT 的默认模型! 5.5 instant 在智力水平、图像感知和事实准确性方面有了大幅提升。 同时,写作风格也进行了更新,变得更加简洁直接。 你的愿望清单上还有哪些内容?

    推荐理由:ChatGPT 默认模型悄悄换上了 5.5 instant,图像感知和事实性提升明显,写作风格也更直接,每天用它的人今天会感觉到差异,不是小修小补。

5月5日周二
  1. HuggingFace Daily Papers(社区热门论文)75

    MolmoAct2:面向真实世界部署的动作推理模型

    MolmoAct2 是一个为实际部署设计的全开放动作推理模型,在五个方面取得进展。其核心是专为空间与具身推理训练的 VLM 骨干 MolmoER,基于 330 万样本语料库训练。团队发布了三个新数据集,包括迄今最大开放双手数据集 MolmoAct2-BimanualYAM(720 小时遥操作轨迹),并开源了动作分词器 OpenFAST。模型采用层间 KV 缓存条件化架构,嫁接连续动作专家,还引入自适应深度推理变体 MolmoThink,以极低延迟保持几何基础。在广泛实证研究中,MolmoAct2 在 7 个仿真与真实世界基准上超越 Pi-05 等基线,MolmoER 在 13 个具身推理基准上超过 GPT-5 和 Gemini Robotics ER-1.5。模型权重、训练代码与数据均已公开。

    推荐理由:开源具身动作推理模型首次全面超越 GPT-5 和 Gemini Robotics,还附赠最大的双手操作数据集和全套训练代码,做机器人的同学本周必读。

  2. HuggingFace Daily Papers(社区热门论文)73

    RLDX-1技术报告

    为提升视觉-语言-动作模型在复杂现实任务中的功能覆盖,研究团队推出通用机器人策略RLDX-1。该模型基于多流动作变换器架构,整合运动感知、记忆决策与物理传感等异构模态,并辅以合成罕见场景数据、仿人操作学习流程及实时推理优化等系统设计。在仿真与真实测试中,RLDX-1全面超越前沿模型π_{0.5}和GR00T N1.6,尤其在ALLEX人形机器人任务上取得86.8%的成功率,显著高于对照模型的约40%,标志着其在接触密集型动态灵巧操作领域取得关键进展。

    推荐理由:在 ALLEX 人形任务上把成功率从 40% 拉到 86.8%,RLDX-1 证明了多模态流架构对灵巧操作的价值,做机器人的同学可以重点关注一下。

  3. Replit ⠕70

    你可以在 Replit 中构建完整的商业计划书演示文稿,无需触碰任何幻灯片。 只需描述你想要的内容,在聊天中迭代修改,可视化编辑,然后导出为 PPTX、Google Slides 或 PDF(或发布实时链接)。 以下是具体操作方式👇

    推荐理由:Replit把做pitch deck变成聊天式操作,输描述、实时改、一键导出,比传统PPT工具快不少,但真正的故事还是得你自己想清楚。

  4. Runway69

    实时视频智能体已到来。 今天,我们将分享如何构建Runway Characters,让你能将一张图片转化为一个完全富有表现力、可对话的视频智能体,以每秒24帧的高清画质流畅播放。端到端延迟仅需1.75秒。 了解更多信息请见下文。

    推荐理由:Runway 把 AI 视频从生成拉入实时对话时代,1.75 秒的延迟让视频代理第一次有了「对话感」,做交互设计的同学可以认真看一眼。

5月2日周六
  1. 凡人小北77

    吴恩达(Andrew Ng)推出新课程《人人皆可的 AI 提示技巧》,旨在帮助不同水平的用户成为 AI 高级使用者。课程教授适用于 ChatGPT、Gemini、Claude 等工具的通用提示技巧,核心内容包括:利用深度研究模式生成复杂问题的详尽报告;为 AI 提供远超常人认知的丰富文档与图像上下文;在重要决策时让 AI 进行长时间深度思考;以及使用 AI 生成图像、分析数据、构建简单游戏和网站。课程还将剖析大模型的工作原理,帮助学员判断何时可信赖 AI 的答案。

    引用Andrew Ng@AndrewYNg

    2026年我们给AI写提示词的方式,与2022年ChatGPT刚问世时已大不相同。 我正在教授一门新课程《人人适用的AI提示词》(AI Prompting for Everyone),帮助你成为AI高效用户——无论你目前的水平如何。 课程涵盖适用于ChatGPT、Gemini、Claude及其他AI工具的技能。如何运用深度研究模式,针对复杂问题生成研究充分的报告。如何为AI提供恰当的上下文,包括大多数人不知道可以提供的更多文档和图片。何时该让AI花几分钟深入思考重要决策,比如买什么车、学什么专业、接受哪份工作。以及如何用AI生成图像、分析数据,并搭建简单的小游戏和网站。 我还会讲解这些模型底层运作的直觉,让你知道何时该信任一个答案、何时不该。 课程中,你会看到飞鼠、一个创造力测试、我的一些老家庭照片,还有烟花。 欢迎加入:http://deeplearning.ai/courses/ai-prompting-for-everyone

    推荐理由:吴恩达亲自下场教提示工程,从深度研究到让AI替你决策,覆盖了你没想到的那些用法,免费课程值得花两小时走一遍。

  2. Tomer Tunguz 博客(VC 分析)57

    本周的积极信号:AI在医疗、教育、农业与科研领域的突破性进展

    近期多项进展展现了AI的巨大积极影响。医疗领域,Mayo Clinic的AI能通过常规CT提前最多三年检测胰腺癌,强生利用AI将新药线索生成时间减半。教育方面,哈佛研究显示AI导师使学生学习效果翻倍,泰国培训16万名教师惠及330万学生。农业上,AI能以约88%准确率预测害虫爆发。科研中,AI快速筛查NASA数据,新发现超一万颗系外行星候选。此外,香港推出AI洪水预报系统,Atlassian和Twilio等公司也因AI驱动业绩增长并上调预期。这些案例平衡了AI风险,凸显其创新潜力。

    推荐理由:Tomer 收集了最近两周 AI 在医学、教育、农业的硬核落地案例,对反 AI 恐慌是一剂清醒剂,SaaS 公司的营收也说明行业在回暖。

5月1日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    Grok 4.3

    x.ai 正式发布了 Grok 4.3 模型,开发者可通过官方文档获取详细信息。该模型在 Hacker News 社区获得关注,相关帖子收获了 100 点热度。此次发布标志着 Grok 系列模型的持续迭代更新。

    推荐理由:xAI 的 Grok 4.3 如期而至,性能和对标都写在文档里了,想了解最新大模型实力的开发者值得花五分钟看一眼。

  2. Luma60

    为你的网站寻找外观。同时探索每个方向。 定义目标,设定美学风格,然后让Luma Agents构建每个元素。英雄区域。文案。视觉效果。布局。所有内容都经过结构化设计,从首次滚动开始就旨在实现转化。 立即构建 → http://lumalabs.ai/app

    推荐理由:Luma 从视频生成跨到建站,用 Agent 一次性生成整站,描述即站点,对想快速验证品牌页面的创业者是个有趣的新工具。

  3. Google Developers Blog(RSS)62

    基于Gemini Embedding 2构建:智能多模态RAG及其他应用

    Google正式发布Gemini Embedding 2统一嵌入模型,该模型能将文本、图像、视频、音频和文档映射到同一语义空间。开发者可通过单请求处理交织多模态输入,显著提升智能RAG、视觉搜索等内容审核任务的性能。模型支持超100种语言,并提供任务特定前缀和马特廖什卡降维等特性,为构建复杂AI智能体提供高效精准的基础。

    推荐理由:开发者做多模态RAG的苦日子结束了,Gemini Embedding 2把文本、图片、视频塞进同一个语义空间,还自带Matryoshka降维,直接省掉一堆胶水代码。