SenseTime· @SenseTime_AI · X·· 2026-07-14精选AI 评分74
AI 导读
商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。
推荐理由
商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。
正文 · AI 翻译
SenseNova-Vision-7B-MoT,现已完全开源:一个模型,覆盖以下所有主要视觉任务:
🔹检测 / OCR / GUI
🔹深度与法线
🔹分割
🔹多视图
它还能通过自然语言定义全新的视觉任务变体——跨越传统任务边界,重新组合视觉能力。
开源内容包括:模型权重 + SenseNova-Vision 语料库(含 5000 万样本子集,以及用于复现其余公开来源数据的完整工具包),供研究与开发使用。
🤗 HF:https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT
🔧GitHub:https://github.com/OpenSenseNova/SenseNova-Vision
💻 试用演示:https://huggingface.co/spaces/sensenova/SenseNova-Vision
📋技术报告:https://arxiv.org/abs/2607.06560
👾Discord:http://discord.gg/BuTXPHmQub
来源:SenseTime · x.com