跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 321–340 条 · 共 437 条
5月15日周五
  1. 蚂蚁 inclusionAI:HuggingFace 新模型56

    蚂蚁集团提出 ARGenSeg-8B:基于自回归图像生成模型的图像分割框架

    蚂蚁集团推出 ARGenSeg-8B,一种将多模态理解与像素级感知统一的自回归图像生成分割框架。它利用多模态大语言模型(MLLM)输出视觉 token,并通过通用 VQ-VAE 解码为分割掩码,使分割完全依赖 MLLM 的像素级理解。采用 next-scale-prediction 策略并行生成视觉 token,降低推理延迟。在多个分割数据集上超越此前最优方法,推理速度显著提升。论文已被 NeurIPS 2025 接收,模型已发布在 HuggingFace。

    推荐理由:蚂蚁提出用自回归生成做分割,把理解和像素级感知统一到一个框架里,多个数据集SOTA且速度更快,做CV的值得看看。

  2. SenseTime70

    主推文赞扬了创新者在前沿领域的探索。引用的推文具体指出,SenseNova-U1在空间智能能力上取得进展,其关键基准测试表现超越了Qwen3.5等强劲基线。同时,团队开源了目前最大的空间问答数据集SenseNova-SI-8M,并邀请业界在CVPR会议进行线下交流。

    引用Zhongang Cai@caizhongang

    很高兴为 SenseNova-U1 的空间智能能力做出了贡献,在 VSI-Bench 等关键基准上超越了 Qwen3.5 等强劲基线。 我们也很激动地开源了 SenseNova-SI-8M,这是目前最大的空间问答数据集。 今年六月 CVPR 见,很乐意当面交流! SenseNova-SI-8M: https://huggingface.co/datasets/sensenova/SenseNova-SI-8M

    推荐理由:商汤的 SenseNova-U1 在空间智能基准上压过 Qwen3.5,还顺手开源了目前最大的空间 QA 数据集 SenseNova-SI-8M,搞具身智能和多模态的可以直接抱走数据。

  3. HuggingFace Daily Papers(社区热门论文)73

    PAGER:弥合点精确几何图形界面控制中的语义-执行鸿沟

    研究针对需要点级精度的几何图形界面控制任务,揭示了现有视觉-语言模型存在的语义-执行鸿沟:通用模型动作类型准确率高但任务成功率极低。为此,我们构建了包含4,906个问题、超过22.4万次像素级动作的PAGE Bench基准,并提出了拓扑感知智能体PAGER。该智能体通过依赖结构规划与像素级执行分解任务,结合像素接地监督调优与精度对齐强化学习,将任务成功率提升至最强通用基线的4.1倍,步骤成功率从GUI专用智能体的不足9%提高到62%以上,实现了点精确GUI控制的新突破。

    推荐理由:GUI agent一直绕着精确点击走,这篇直接硬碰硬,把成功率从6%拉到62%,做CAD自动化或工业软件的团队可以重点关注。

5月14日周四
  1. CMU:Machine Learning Blog63

    教视觉-语言模型说“电影语言”

    研究团队与百余名专业创作者历时一年,构建了一个视频描述生成流程,其核心在于扩展精细化的人类-AI协同监督,而非单纯扩大模型规模。该研究(入选CVPR 2026亮点论文)指出,当前主流视频生成模型在理解和生成具有电影感的专业运镜(如希区柯克式滑动变焦、精确的焦点转移或荷兰角镜头)时存在明显不足,常产出通用或焦点错误的画面。这项工作揭示了一条通过提升监督质量来增强模型“电影语言”表达能力的新路径。

    推荐理由:这篇CVPR 2026 Highlight的博客版很有意思,它用100多个专业电影人来标注视频,教VLM学会推拉摇移的镜头语言,不是又多一个数据集,而是提醒我们:高质量的人工标注可能比堆模型更重要。

  2. Together AI 研究与产品博客(RSS)65

    Together AI 开源视频翻译工具 Violin,集成 Whisper、DeepSeek V4 Pro 与 Sonic 3

    Together AI 发布全开源视频翻译工具 Violin,代码以 MIT 许可证开放在 github.com/shang-zhu/violin。流程分三步,用 Together 的 Whisper V3 做多语言转写,DeepSeek V4 Pro 做翻译,Together 托管的 Cartesia Sonic 3 合成多种母语语音,且不支持声音克隆。

    推荐理由:原文完整给出了 ASR、LLM 翻译、TTS 三段流水线所用模型和 MIT 开源仓库入口,读者可以照着部署或改造成自己的翻译流程。

  3. Runway:News(网页)76

    Introducing Runway Agent

    Runway正式发布Runway Agent,这是一个能够通过单次对话将创意想法转化为完整、可发布视频的智能创作伙伴。用户只需用自然语言描述需求,Agent便能根据上下文和目标,自主完成概念提案、故事节奏设计、视觉方向规划,并最终生成包含多场景、旁白、对话和音乐的成片。它旨在为品牌团队、营销人员、创意机构和电影制作人快速生产各类视频内容,如品牌宣传、社交媒体素材和短片,将传统需要数天或数周的审核制作周期压缩至几分钟。该产品现已上线,新免费计划用户可获得1500积分用于制作首个视频。

    推荐理由:Runway Agent 把视频生产从“一个团队干一周”变成“一个人聊十分钟”,品牌和内容团队的视频成本结构可能就此改写。

5月13日周三
  1. SenseTime72

    SenseNova-U1 技术报告详尽披露了构建前沿原生多模态模型的方法,核心包括原生多模态统一建模、无损视觉接口、联合自回归与像素空间流匹配训练、以及原生混合专家骨干网络。报告提供了六阶段训练方案、强化学习后训练与蒸馏的完整实践指南。其开源版本 SenseNova-U1-A3B-MoT 基于混合专家架构,仅激活30亿参数,实现了高效快速的性能。相关资源已全面开放,涵盖技术报告、模型权重、代码和演示平台。

    推荐理由:商汤把原生多模态模型的训练细节全公开了,无视觉编码器、原生MoE架构,还开源了38B-A3B权重,做多模态模型的可以直接照着技术报告复现。

  2. Demis Hassabis81

    团队正在用AI重新构想鼠标指针,成果非常酷!在@GoogleAIStudio尝试原型版本,体验相当神奇。 [引用 @GoogleDeepMind]:我们正用AI重新构想这个存在50年的界面——鼠标指针。🖱️ 这些实验演示展示了人们如何通过动作、语音和自然简写,在屏幕上直观操控Gemini完成任务🧵

    引用Google DeepMind@GoogleDeepMind

    我们正在用 AI 重新构想一个已有 50 年历史的界面——鼠标指针。🖱️ 这些实验性演示展示了人们如何通过动作、语音和自然简写,在屏幕上直观地指挥 Gemini 完成任务 🧵

    推荐理由:用了50年的鼠标指针第一次被AI改造,这个原型让你在屏幕上随手画圈、说话、打缩写就能控制Gemini,产品经理和设计师都该去玩一下。

  3. OpenRouter69

    Perceptron Mk1已在OpenRouter上线,由@perceptroninc开发。 前沿视频与具身推理的视觉语言模型。以动态帧率(最高2 FPS)分析视频,具备32k多模态上下文,采用混合推理和结构化空间基元(点、框、多边形、片段)作为首要输出。

    推荐理由:将视频理解提升到结构化空间输出,动态帧率分析让模型能真正「看懂」动作,做具身智能的开发者可以关注。

5月12日周二
  1. HuggingFace Daily Papers(社区热门论文)70

    WorldReasonBench:面向未来世界状态预测的视频生成器人类对齐压力测试

    研究团队发布WorldReasonBench基准,旨在直接评估视频生成模型作为“世界模拟器”的推理能力。该基准包含436个测试案例,涵盖物理、社会、逻辑和信息四大维度及22个子类,要求模型根据初始状态与动作生成状态演化一致的未来视频。评估采用人类对齐的双部分方法:过程感知推理验证通过结构化问答检测时序与因果错误;多维质量评估则对推理质量、时序一致性和视觉美学进行评分。测试发现,当前先进模型在视觉合理性与世界推理能力间存在显著差距,生成的视频可能看似逼真却违反动态、因果或信息守恒规律。相关资源已开源。

    推荐理由:视频生成越来越像真的,但逻辑和因果一塌糊涂,这个基准把问题量化了,想做世界模拟器的团队可以拿来测测自己的模型到底懂不懂世界。

  2. HuggingFace Daily Papers(社区热门论文)76

    Qwen-Image-2.0技术报告

    Qwen-Image-2.0是一个统一高保真生成与精确编辑的全能图像生成基础模型。它采用Qwen3-VL作为条件编码器,结合多模态扩散变换器进行联合建模,并通过大规模数据整理与多阶段训练实现强化。该模型支持长达1K令牌的指令输入,能生成幻灯片、海报等富文本内容,显著提升多语言文本渲染与排版质量。在生成方面,它增强了细节、纹理真实感与光照一致性,并更可靠遵循复杂指令。人工评估表明,其在生成和编辑任务上均大幅超越前代模型。

    推荐理由:这是 Qwen-Image 系列第一次把多模态理解和生成真正拧到同一框架里,长文本渲染和多语言排版提升肉眼可见,做海报和幻灯片的可以重点关注。

  3. SiliconFlow74

    信息的结构与呈现方式本身正成为AI智能层的关键。当前,让大语言模型以HTML格式输出,能提供比默认Markdown更丰富的视觉布局与交互性,是值得尝试的技巧。长远来看,人类虽偏好用音频输入,但视觉(图像/动画/视频)才是更理想的AI输出形式,因为大脑约三分之一皮层专司视觉处理。AI输出形态将沿“原始文本→Markdown→HTML→交互式神经视频/模拟”的路径演进,最终可能由扩散神经网络直接生成交互视频。同时,输入方式也需融合音频、文本、视频及手势等多模态交互。在人机输入输出深度融合方面,仍有巨大发展空间。

    引用Andrej Karpathy@karpathy

    顺便说一句,这真的非常有效:在你的查询末尾让你的 LLM“将你的回答结构化为 HTML”,然后在浏览器中查看生成的文件。我也曾成功让 LLM 把输出呈现为幻灯片等形式。 更一般地说,在我看来,音频是人类偏好的 AI 输入,而视觉(图像/动画/视频)则是他们偏好的输出。我们大脑中大约三分之一是一个专用于视觉的大规模并行处理器,它是信息进入大脑的十车道超级高速公路。随着 AI 的进步,我认为我们会看到一个利用这一点的演进过程: 1) 原始文本(阅读起来困难/费力) 2) markdown(粗体、斜体、标题、表格,稍微更护眼一些)<-- 当前默认 3) HTML(仍然带有底层代码的过程式形式,但在图形、布局甚至交互性上灵活得多)<-- 尚处早期,但正在形成新的良好默认 ...4,5,6,... n) 交互式神经视频/模拟 在我看来,这种外推(尽管相关技术目前还不存在)最终会走向某种由扩散神经网络直接生成的交互式视频。关于如何将精确/过程式的“软件 1.0”产物(例如交互式模拟)与神经产物(扩散网格)编织在一起,还有许多未解问题,但总体方向类似于最近爆火的 https://x.com/zan2434/status/2046982383430496444 在输入端也有必要的、尚待完成的改进。音频、文本或视频单独都不够,例如,我觉得需要指向和比划屏幕上的东西,就像你与一个实际坐在你身旁、和你共用电脑屏幕的人会做的所有事情一样。 TLDR 人类与 AI 之间的输入/输出心智融合正在进行中,还有很多工作要做,也有重大进展有待取得,远在我们一路跳到类似 neuralink 的脑机接口之类的东西之前。就当前阶段值得探索的东西而言,小贴士:试试要求 HTML。

    推荐理由:Karpathy 给的路线图从文本到 HTML 再到神经视频,其中第一步的‘让 LLM 输出 HTML’你今晚就能用上。未来交互形态的思考,值得产品经理细读。

5月11日周一
  1. Thinking Machines Lab:官方博客(RSS)59

    Thinking Machines Lab发布Interaction Models研究预览

    Thinking Machines Lab发布interaction models研究预览。该模型从零训练,原生处理音频、视频和文本,采用多流微回合设计实现实时响应,无需外部脚手架。研究预览展示了全新的交互能力,并在智能性与响应性上取得综合SOTA表现。

    推荐理由:Thinking Machines 把实时交互训进了模型本身,不再是外挂脚手架,微轮次架构和 benchmark 数据很硬,做语音/视频助手的可以认真看看,虽然还是研究预览,但方向值得盯着。

5月9日周六
  1. Elon Musk71

    Tesla通过分析真实车队碰撞数据,结合视觉系统与传感器,实现了安全系统的突破。传统碰撞传感器需要时间确认,降低阈值可能导致误触发。而视觉系统能提前“看到”即将发生的碰撞,与传感器协同,使约束控制器能更早、更准确地启动安全气囊和安全带预紧器。通过仿真重放碰撞并测量人体模型受力,团队发现提前部署能优化保护时机。这一改进使预测伤害严重程度整体显著下移,并通过OTA更新实现,是前所未有的安全提升。

    引用Wes@wmorrill3

    这些点中的每一个都是车队中真实发生的碰撞。真实世界的速度、碰撞和人员。而不仅仅是法规测试用例。 正是这些数据的丰富性才促成了这一结果。通过仿真,我们可以回放碰撞,并测量人体模型上所受的力。 然后遍历约束装置的展开时间,发现更早展开能为气囊提供最佳充气时间,并在乘员移出位置之前完成安全带预紧。 但碰撞加速度计需要时间才能确定。降低这一时间阈值会带来误触发的风险。 使用视觉让车辆有信心缩短这一时间。摄像头看到即将发生的碰撞,并与传感器一起告诉约束控制器降低滤波并更早采取行动。 预测伤害严重程度中的 Y 轴偏移,是基于以更快的检测阈值重新运行碰撞仿真后,人体模型中的传感器得出的。 如此全面地降低伤害严重程度是闻所未闻的,更不用说通过空中升级来实现这一点了。 我为分析团队的工作和奉献感到无比自豪。他们超越职责,提出“我们拥有道路上最安全的汽车,但能否让它更安全?”然后与视觉团队合作,构建实现这一目标所需的预测。经过仿真和物理碰撞测试的严格验证。如今已部署并改善着人们的生活。 我循环观看这段视频,想象着每一个点,一个人。

    推荐理由:below_threshold:T2 推文门槛 75,当前 finalScore=71

  2. Apple Machine Learning Research(RSS)66

    Velox:学习4D几何与外观的表示

    Velox提出一个学习4D对象潜在表示的框架,该表示具备描述性、压缩性与易获取性。它仅需非结构化动态点云作为输入,通过编码器将时空彩色点云压缩为动态形状标记,并利用两个互补解码器进行监督:4D表面解码器建模随时间变化的表面分布以捕捉几何信息,高斯解码器则负责外观重建。该方法在保持高保真度的同时提升了下游任务的效率。

    推荐理由:苹果把动态点云的几何和外观塞进一个可压缩的latent space,思路干净但领域垂直,做3D视觉和AR的可以跟一下,其他人不用急着读。

5月8日周五
  1. HuggingFace Daily Papers(社区热门论文)70

    多模态领域泛化真的进步了吗?一项全面的基准研究

    针对多模态领域泛化评估标准不统一的问题,研究团队推出了首个统一基准MMDG-Bench。该基准涵盖动作识别、故障诊断和情感分析三大任务的六个数据集,系统评估了六种模态组合和九种方法在多种场景下的性能。基于大规模实验得出关键结论:现有专用方法相比基线提升有限;无单一方法能持续领先;当前性能与理论上限差距显著;三模态融合未稳定优于双模态;所有方法在数据损坏和模态缺失时性能均大幅下降,部分还损害了模型可信度。

    推荐理由:7 千多次训练揭示的多模态领域泛化真相:近年专门方法相比简单 ERM 几乎原地踏步,并且所有方法在损坏或缺失模态下直接跪。做这个方向的该醒醒了。

  2. IT之家(RSS)70

    苹果首款 AI 可穿戴设备:内置摄像头的 AirPods 已进入 DVT 阶段,预计最快 9 月搭载新 Siri 亮相

    据报道,苹果内置摄像头的AirPods已进入设计验证测试(DVT)阶段,最快有望于今年9月作为其首款AI可穿戴设备发布。该产品左右耳机配备低分辨率摄像头,用于捕捉环境视觉信息,以支持升级版Siri实现视觉问答等功能。其整体外观类似AirPods Pro 3,但耳机柄因容纳摄像头而加长。产品原计划2026年发布,因Siri升级延迟而推迟,此次升级得益于与谷歌Gemini的技术合作。苹果还在探索其导航提醒等用途,并为缓解隐私担忧内置了数据上传指示灯。

    推荐理由:苹果把摄像头塞进 AirPods 做 Siri 的眼睛,这比智能眼镜更务实,但隐私指示灯能有多显眼是个疑问,做 AI 硬件的该看看苹果怎么绕开 Meta 的坑。

  3. Apple Machine Learning Research(RSS)69

    用于学习语义丰富视觉表征的文本条件JEPA

    研究人员提出文本条件联合嵌入预测架构(TC-JEPA),通过引入图像描述文本作为条件信息来降低掩码特征预测中的视觉不确定性。该方法采用细粒度文本调节器,对输入文本标记计算稀疏交叉注意力,从而调制预测的图像补丁特征。与基于掩码特征预测的I-JEPA相比,TC-JEPA能够学习到语义更丰富的视觉表征,解决了原有方法因视觉不确定性导致的语义学习不足问题。

    推荐理由:Apple 这篇 TC-JEPA 把文本融入自监督视觉预训练,用稀疏交叉注意力减少预测不确定性,对多模态表征学习是个不错的思路补充,做视觉模型的值得一看。

  4. OpenRouter68

    Gemini 3.1 Flash Lite 来自 @GoogleDeepMind,现已在 OpenRouter 正式发布。 多模态(文本/图像/视频/音频/PDF → 文本),100万上下文,可选的思考层级,输入每百万次$0.25,输出每百万次$1.50。 还可配合我们新的 service_tier 参数使用,以权衡成本与延迟!

    推荐理由:OpenRouter 把 Gemini 3.1 Flash Lite 的多模态 1M 上下文压到 $0.25/M token,这个定价让 Flash 系列不再是试验品,轻量级应用可以认真考虑它了。