跳到正文
北京时间
原文
SenseTime· @SenseTime_AI · X·· 2026-07-14精选AI 评分74
AI 导读

商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

推荐理由

商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

正文 · 原文

𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮-𝗩𝗶𝘀𝗶𝗼𝗻-7𝗕-𝗠𝗼𝗧, 𝗳𝘂𝗹𝗹𝘆 𝗼𝗽𝗲𝗻-𝘀𝗼𝘂𝗿𝗰𝗲𝗱: 𝗼𝗻𝗲 𝗺𝗼𝗱𝗲𝗹, 𝗲𝘃𝗲𝗿𝘆 𝗺𝗮𝗷𝗼𝗿 𝘃𝗶𝘀𝗶𝗼𝗻 𝘁𝗮𝘀𝗸 𝗯𝗲𝗹𝗼𝘄:
🔹𝗗𝗲𝘁𝗲𝗰𝘁𝗶𝗼𝗻/𝗢𝗖𝗥/𝗚𝗨𝗜
🔹𝗗𝗲𝗽𝘁𝗵 & 𝗻𝗼𝗿𝗺𝗮𝗹
🔹𝗦𝗲𝗴𝗺𝗲𝗻𝘁𝗮𝘁𝗶𝗼𝗻
🔹𝗠𝘂𝗹𝘁𝗶-𝘃𝗶𝗲𝘄

It can also define new vision-task variants through natural language — recombining visual capabilities across traditional task boundaries.

Open-sourced: model weights + the SenseNova-Vision Corpus (50M-example subset, plus full toolkit to reproduce the remaining public-source data) for research & development

🤗 HF: https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT
🔧GitHub: https://github.com/OpenSenseNova/SenseNova-Vision
💻 Try the demo: https://huggingface.co/spaces/sensenova/SenseNova-Vision
📋Technical Report: https://arxiv.org/abs/2607.06560
👾Discord: http://discord.gg/BuTXPHmQub

来源:SenseTime · x.com