Ultralytics YOLO26:统一实时端到端视觉模型
Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models
Ultralytics YOLO26 采用双头设计实现原生无 NMS 的端到端推理,彻底移除 DFL,获得更轻检测头与无约束回归范围。训练结合混合 Muon-SGD 优化器 MuSGD、转向推理头的 Progressive Loss 及保证小物体正样本的 STAL 标签分配。支持检测、实例分割、姿态估计、定向检测和分类,提供 5 种尺度(n/s/m/l/x)及开放词汇扩展 YOLOE-26。全部尺度在 COCO 上达 40.9–57.5 mAP,T4 TensorRT 延迟 1.7–11.8 ms;YOLOE-26x 在 LVIS minival 文本提示下达 40.6 AP。代码已开源。
这次YOLO26把NMS和DFL都拿掉了,还把大模型训练的Muon优化器改成MuSGD,在COCO上的速度精度平衡比上一代强不少,做实时检测的应该拿来跑一跑。
实时视觉任务要求模型具备准确性、高效性,并且能够在不同硬件上简便部署。YOLO系列模型正是因此得到了广泛应用,然而大多数YOLO检测器在推理时仍依赖非极大值抑制,由于分布聚焦损失而携带沉重的检测头,需要较长的训练周期,并且可能使最小的物体无法获得正标签分配。我们提出了Ultralytics YOLO26,这是一个统一的实时视觉模型系列,通过协调的架构和训练改进解决了这些局限。YOLO26采用双头设计,实现了原生无NMS的端到端推理,并完全移除了DFL,从而得到一个更轻量、回归范围不受约束的检测头。其训练流程结合了MuSGD(一种从大语言模型训练中改进而来的混合Muon-SGD优化器)、渐进式损失(将监督信号向推理时的检测头转移)以及STAL(一种保证小物体获得正标签覆盖的标签分配策略)。除检测外,YOLO26还为实例分割、姿态估计和旋转目标检测引入了特定任务的检测头和损失设计,在各项任务和不同尺度上均带来了一致的性能提升。该系列涵盖五种尺度(n/s/m/l/x),并在单一流程中支持检测、实例分割、姿态估计、分类和旋转目标检测,同时提供开放词汇扩展版本YOLOE-26,可实现无需文本、视觉和提示词的推理。在所有尺度上,YOLO26在COCO数据集上实现了40.9-57.5 mAP,T4 TensorRT延迟为1.7-11.8毫秒,相比之前的实时检测器推进了精度-延迟的帕累托前沿;而YOLOE-26x在文本提示下的LVIS minival数据集上达到了40.6 AP。代码和模型可在 https://github.com/ultralytics/ultralytics 获取。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org