跳到正文
北京时间

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

437条精选相关主题图像生成AI 视频语音与音频

最新精选

第 241–260 条 · 共 437 条
6月2日周二
  1. 公众号:通义实验室(千问)64

    Qwen3.7-Plus 多模态智能体模型发布

    Qwen3.7-Plus 深度融合视觉与语言,实现“看、想、写、做、验”端到端闭环,在 12 项核心基准测试中表现提升。实测中,基于该模型的智能体连续运行超 11 小时,自动完成英语学习 APP 开发,生成代码超 10000 行、触发调用超 1000 次;复刻 macOS Stocks 应用并通过 10 项功能验证。支持图像/视频转 SVG、视觉驱动网页设计及浏览器自动化。已在阿里云百炼上线,提供 OpenAI 兼容 API 与 Anthropic 协议。

    推荐理由:Qwen3.7-Plus 把视觉智能体推到了‘能看、能想、能动手’的端到端闭环,从写代码到操作浏览器一条龙,做自动化 Agent 的团队可以直接拿来用。

  2. Qwen:Blog Retrieval(API)81

    Qwen3.7-Plus:多模态智能体模型发布

    阿里云通义千问推出 Qwen3.7-Plus,基于 Qwen3.7 文本骨干,增强视觉语言能力,保留编码、工具使用和生产工作流的智能体能力。它支持感知现实场景、读取并操作 GUI、从视觉参考编写代码、端到端导航手机应用、基于网络知识回答视觉问题,融合 GUI 与 CLI 交互,跨 Claude Code、OpenClaw、Qwen Code 等框架泛化。在 Terminal Bench 2.0-Terminus 得分 70.3,SWE-Verified 77.7,QwenWorldBench 62.1,GPQA Diamond 90.3,MMLU-Pro 88.5。通过阿里云 Model Studio API 提供。

    推荐理由:Qwen3.7-Plus 把视觉感知、GUI 操作和编码能力整合进同一个 agent 模型,在 ScreenSpot 和浏览器操作上的提升很实在,做自动化的开发者值得上手试试。

  3. Hacker News 热门(buzzing.cc 中文翻译)75

    英伟达 Cosmos 3

    英伟达发布了 Cosmos 3,这是一个用于物理 AI 推理的世界和行动模型。该信息来源于英伟达开发者博客,发布日期为 2026 年 6 月 1 日。

    推荐理由:Cosmos 3 把物理推理、世界生成和行动生成塞进一个开源模型,从机器人到自动驾驶都能用,英伟达这次是真的想定义物理 AI 的训练范式。

6月1日周一
  1. MiniMax:Blog(网页)83

    MiniMax M3:前沿编码、100万token上下文与原生多模态一体模型

    MiniMax M3 是一个开源前沿模型,具备先进的编码与AI智能体能力。它支持100万token的超长上下文窗口,并采用名为MSA(MiniMax Sparse Attention)的新型稀疏注意力架构。该架构使模型在100万token上下文下的每token计算成本降至前代的1/20,预填充速度提升9倍以上,解码速度提升15倍以上。在SWE-Bench Pro编码基准上,MiniMax M3得分59.0%,超越GPT-5.5和Gemini 3.1 Pro,性能接近Opus 4.7。该模型可通过MiniMax Code、Token Plan和API服务使用。

    推荐理由:MiniMax M3 把开源模型的编码能力推到了 GPT-5.5 和 Opus 4.7 这条线上,还附带 1M 上下文和原生多模态,这是开源社区真正能打的前沿选项,做 Agent 的值得立刻跑一下。

  2. IT之家(RSS)71

    上海:支持多模态智能体开发与应用,有序推进智能驾驶在共享出行、物流运输等多场景应用

    上海市人民政府办公厅印发《上海市服务业发展“十五五”规划》,提出发展AI软件技术及服务产业集群。规划支持多模态智能体开发与应用,推动智能客服等工具规模化;有序推进智能驾驶在共享出行、物流运输等多场景应用;做强算运存协同布局的智算云网络,推广模型即服务(MaaS);并支持开发面向家庭、养老、文旅等场景的具身智能整机产品,加速机器人向通用智能与精细化服务跃升。

    推荐理由:这份上海“十五五”规划相当于一份AI落地指南,多模态智能体、无人驾驶物流、具身智能都点到了,虽非重磅突破,但给在沪AI公司画出了清晰的增长路线。

  3. 公众号:MiniMax(稀宇科技)78

    MiniMax M3 发布:前沿 Coding、1M 上下文与原生多模态集于一身

    MiniMax 发布 M3 模型,采用全新稀疏注意力架构 MSA,支持 1M 上下文窗口,并原生支持图片、视频输入及电脑桌面操作,是国内首个齐备这些要素的开源模型。

    推荐理由:M3在复现论文和CUDA优化中的长程自主迭代,将模型评估从单轮得分推进到真实协作场景,为衡量Agent Coding能力提供了更具参考价值的维度。

5月31日周日
  1. StepFun80

    阶跃星辰发布了Step 3.7 Flash,这是一款198B参数的视觉模型,旨在DGX Spark等桌面设备上运行。用户实测表明,128GB统一内存是运行门槛,模型占用约104GB。部署无需官方专用llama.cpp分支,主线版本即可。在上下文长度上存在权衡:启用视觉功能时,基于q8 KV cache的64K为上限;若要使用最高256K上下文,则需禁用视觉并切换至q4 KV cache,此时模型与缓存共占约114GB内存。该模型是推理模型,思考过程可能消耗大量max_tokens,需注意设置。

    引用Sudo su@sudoingX

    我现在正在一台 dgx spark 上运行 stepfun 新的 step 3.7 flash。 198b 的视觉模型,跑在一台就摆在桌上的机器上。以下是如何帮你省下大约 3 小时抓耳挠腮的加载时间,因为我已经替你抓过了。 官方 README 告诉你需要 stepfun 自己的 llama.cpp fork。你不需要,主线 ggml-org 就能跑得好好的,视觉功能什么的都行,64k。别花一个小时去构建一个 fork,结果发现不用它模型也能加载。 下面这个才是真正会吃掉你一整晚的:模型占了你约 121gb 统一内存池中的 104gb,而 spark 没有 swap。请求的上下文太大,它不会干净地崩溃,而是会静默地颠簸,内核把模型页换出、再从磁盘反复读回,循环往复,而你只能盯着“loading”发呆。 判断的信号是 read_bytes。如果它涨过 104gb 的模型大小还继续涨,同时进程内存钉在 99% 且日志毫无进展,那就是卡死了。杀掉它,它不会自己恢复。 在 q8 kv cache 上加载视觉投影器时,64k 就是 128gb 机器上的上限,超过它就会在 clip loader 里颠簸,模型加上 KV 加上视觉缓冲区全都在争抢你剩下的那约 17gb。 想要完整的 256k 上下文?去掉视觉,换成 q4 kv cache,这样就能装下,121gb 里用 114gb。这就是他们 README 没有明说的取舍:大上下文是真的,只不过得用 q4 cache,而且仅限文本。 而且它是个推理模型。问它点东西,如果你得到空白回复,不是你把它弄坏了,是你把 max_tokens 设得太低,它把整个预算都花在思考上了。答案就在 reasoning_content 里。给它留点空间。 这就是那 3 小时。确切可用的参数和权重在回复里。

    推荐理由:把 198B 的视觉模型塞进一台桌面盒子,还跑通了,这本身就是个小里程碑。更关键的是,这篇实战直接帮你绕开了三个大坑,省下的三小时够你喝杯咖啡慢慢试了。

  2. HuggingFace Daily Papers(社区热门论文)70

    ChartArena:跨语言、场景与格式的图表解析基准测试

    ChartArena 是一个旨在系统评估图表解析模型的双语基准测试。它覆盖了八种图表家族(包括数字图表与流程图等结构),并针对数字渲染、打印照片和手绘照片三种场景进行评估。数据集采用人机协作标注流程,并设计了格式无关的评估协议,将不同模型输出映射到标准化语义空间进行评分。对26个多模态大语言模型的评估显示,前沿闭源模型如Gemini 3.1 Pro领先,开源系统正快速追赶;文档解析模型在数字图表上表现尚可,但在图表结构上明显不足;专业解析器仍局限于特定图表类型。雷达图和手绘场景对所有模型都尤其具有挑战性。

    推荐理由:ChartArena 把图表评测从柱状图/折线图拉到了流程图和手绘照片,终于能测出 MLLM 在真实文档场景下的真实水平,做文档解析的团队该认真看一下。

  3. HuggingFace Daily Papers(社区热门论文)70

    定位何处:基础模型能否通过主动探索达到目标视角

    研究提出目标视角复现任务(TVR)与模拟基准TVRBench,评估基础模型在3D环境中主动调整视角以匹配目标图像的能力。当前最优开源与闭源模型成功率仅7.8%和12.0%,瓶颈在于处理多轮视觉历史及需要平移而非旋转时的性能下降。通过构建统一的后训练框架,视觉动作SFT将9B开源模型成功率提升至50.8%,多轮GRPO进一步达到51.4%,为训练主动感知与行动的模型提供了基准。代码与模型已开源。

    推荐理由:主动探索视角是具身智能的关键短板,这篇论文用一个新基准把问题量化了——目前最强的模型也只能对上12%的目标。他们同时放出了训练框架和代码,做空间智能的可以直接拿来跑。

5月30日周六
  1. The Verge:AI(RSS)73

    AI 骗子正在创建虚假的黑人形象来销售 Shein 劣质商品

    有卖家利用 AI 生成虚假的黑人形象,在 TikTok、Facebook 和 Instagram 上扮演手工制品创作者进行销售。例如一个名为 Aliyah 的 AI 生成形象,以带泪诉说的方式售卖所谓手工皮带扣,但该形象及其产品均为虚构。此类 AI 虚拟网红被用于推广通过代发货模式销售的批量生产品。

    推荐理由:AI生成的虚拟黑人卖家在TikTok上哭着卖假货,The Verge这篇调查把AI黑产里最脏的那面扒给你看,做社交电商的尤其该点开读。

  2. OpenRouter72

    现在你可以直接在ComfyUI工作流中使用你的OpenRouter模型了! [引用 @ComfyUI]:ComfyUI刚刚添加了@OpenRouter支持。 你不再局限于单一的大语言模型,现在可以直接在Comfy中访问20多个模型。 更多灵活性,更少摩擦,同样的工作流。 工作流链接在下方👇

    引用ComfyUI@ComfyUI

    ComfyUI 刚刚添加了对 @OpenRouter 的支持。 不再被锁定在单一 LLM 中,你现在可以直接在 Comfy 内访问 20 多个模型。 更灵活,更少阻力,同样的工作流。 下方是工作流的链接👇

    推荐理由:ComfyUI 首次直接集成 LLM 路由服务,等于给图像管线加了个「外挂大脑」,做自动化工作流的人可以直接在节点里调用 20+ 模型,省掉一堆 API tinker 环节。

  3. Greg Brockman76

    OpenAI 实时翻译功能——使用70多种输入语言说话,翻译成13种输出语言: gpt-realtime-translate 接收任意语言的语音输入,并输出目标语言的语音。 大语言模型很棒,但特定用例需要专用模型。 我们正在智能眼镜上运行此功能。

    引用cayden 凯登@caydengineer

    OpenAI 刚刚发布了一种全新的模型 gpt-realtime-translate 接收任意语言的语音音频,并输出你目标语言的语音 LLM 很棒,但针对特定用例你需要专门的模型 我们正在我们的智能眼镜上运行这个

    推荐理由:OpenAI悄悄推出一个专门做实时语音翻译的模型,不是通用LLM,而是专用模型。这标志着AI交互从文字转向语音的第一步,做翻译硬件或AR眼镜的团队要睡不着了。

  4. Google Blog:AI(RSS)74

    Gemini Omni 与 Gemini 3.5 的 11 个实战展示

    Google 在 2026 年 Google I/O 大会上发布了新一代多模态模型 Gemini Omni 与 Gemini 3.5,并同步提供了 11 个视频,集中演示了这两款模型在实际场景中的能力。

    推荐理由:Google 官方放出的这组视频演示,直接展示了 Gemini Omni 和 3.5 的实际表现,比参数和 benchmark 更直观,做多模态应用的可以逐帧研究。

5月29日周五
  1. Qwen:Blog Retrieval(API)66

    Qwen-VLA:从理解世界到付诸行动

    通义千问推出通用视觉-语言-动作模型Qwen-VLA,基于Qwen多模态骨干,将视觉感知、语言理解与空间推理扩展至连续动作生成和轨迹预测。训练分四阶段:文本到动作预训练(T2A)、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。在LIBERO上达97.9%,Simpler-WidowX达73.7%,RoboTwin-Easy/Hard达86.1%/87.2%,匹配或超越专精模型。数据涵盖超10,000小时公共机器人轨迹、1,000+小时内部真实轨迹及800万+合成仿真轨迹。

    推荐理由:Qwen-VLA 把机器人操作、导航和跨实体控制统一进一个模型,在多个基准上打平甚至超越专用模型,这是通用具身智能的一个重要信号,但离实际可用还有距离。

  2. 公众号:通义实验室(千问)64

    通义实验室发布教程:在 Android 手机部署 MCP 感知服务器

    通义实验室发布教程,演示如何在 Android 手机上部署 MCP 感知服务器,使手机具备本地视觉与听觉分析能力。核心基于端侧 MNN 推理引擎和 Qwen3-VL 2B 模型(约 1.3GB),摄像头与麦克风采集的音视频在本地实时转化为结构化 JSON,再通过 MCP Tool 供 Claude Code 等云端 Agent 远程调用。整个过程不上传原始数据,仅传输语义提取结果。项目已开源,实测可识别红绿灯状态等场景。

    推荐理由:如果你做Agent总觉得AI对物理世界是瞎子,这篇教程就是解药。把Qwen3-VL塞进手机当本地眼睛,不传原始视频只给结构化文字,隐私友好又能被Claude直接调用。

  3. IT之家(RSS)74

    小米开源可控视频音效生成模型 ControlFoley,让声音“按你想要的来”

    小米大模型应用团队发布开源可控视频音效生成模型 ControlFoley,旨在解决创作中的可控性难题。该模型统一支持文本引导视频配音、文本控制视频配音和参考音频控制视频配音三类任务。ControlFoley 在 VGGSound-Test 等多个 benchmark 上取得开源 SOTA 表现,其代码、模型权重和在线 Demo 均已开放。

    推荐理由:小米开源的 ControlFoley 把视频音效生成从“看画面配声音”推进到“按意图来”,开源 SOTA 且直接提供 Skill,做视频创作的可以上手试试。

  4. HuggingFace Daily Papers(社区热门论文)70

    Qwen-VLA:统一跨任务、环境与机器人形态的视觉-语言-动作建模

    Qwen-VLA是一个统一的具身基础模型,将Qwen的视觉-语言建模从感知、理解与推理扩展至连续动作和轨迹生成。它通过基于DiT的动作解码器实现,使用包含机器人操作轨迹、人类第一人称示范、仿真及导航数据等在内的大规模数据进行联合预训练。为支持多种平台,引入了感知载体感知的提示条件机制,并将操作、导航与轨迹预测统一到一个框架中。实验显示,Qwen-VLA-Instruct在多个基准上表现优异,例如在LIBERO达到97.9%,在真实世界ALOHA实验中平均分布外成功率为76.9%。

    推荐理由:Qwen-VLA 让一个模型同时搞定操作、导航和轨迹,在具身智能统一化上迈出了关键一步。虽然还停在实验室阶段,但 97.9% LIBERO 和真实世界泛化结果证明这条路走得通,做机器人的值得认真读。

  5. HuggingFace Daily Papers(社区热门论文)75

    WorldMemArena:通过行动-世界交互循环评估多模态智能体记忆

    针对现有基准无法精确诊断多模态智能体记忆在动态环境中的具体失败阶段,研究提出了“行动-世界交互循环”记忆模型,并构建了WorldMemArena基准。该基准包含400个多会话多模态任务,涵盖“终身进化”和“智能体执行”两类场景,支持对记忆写入、维护、检索和使用的阶段级评估。研究首次对长上下文、RAG等手工设计系统与基于框架的记忆智能体进行直接比较,发现记忆写入与存储质量的提升不直接带来性能改善,且多模态记忆在利用视觉证据及跨领域稳定性上仍存在挑战。

    推荐理由:首个能定位多模态 Agent 记忆“写、维、取、用”哪一步出问题的基准,头对头比较长上下文、RAG 和自管理记忆,结论是写得好未必用得上,做 Agent 的值得认真看。

  6. 公众号:阶跃星辰(Step)61

    阶跃发布 Step 3.7 Flash,面向生产级 Agent 的高效率 Flash 模型

    阶跃星辰发布并开源 Step 3.7 Flash,采用稀疏 MoE 架构(总参数 196B+1.8B,激活 11B),最高生成速度 400 Tokens/s。围绕原生多模态理解与执行、联网与视觉搜索增强、高可靠工具调用与编排、Agent 生态兼容优化四大能力优化。在 Toolathlon 达 49.5%,ClawEval-1.1 达 67.1%,GDPval 达 45.8%,τ²-bench Telecom 通过率超 98%。兼容 Claude Code、KiloCode 等主流架构及 MCP/Skills 协议,支持云端与本地部署,已在 Kilo Code 等生态中完成接入验证。

    推荐理由:Step 3.7 Flash 用激活仅 11B 的 MoE 架构把 Agent 工作流稳定性做透了,兼容主流框架还开源,对需要低延迟、高可靠性的生产环境 Agent 是真正可用的选择。