YOLO Vision 2026:
在 Ultralytics 路线图上

Ultralytics YOLO-VLM

轻量级 YOLO 前端为更深层的 LLM 层提供输入,从而实现高效的视觉语言流水线,这已在 Ultralytics 路线图上公布。立即基于 YOLO26 进行构建,并在发布时准备好将视觉与语言连接起来。

深受全球领先组织信赖

DuolingoShellSiemensRenaultPhilipsNEURA RoboticsMercado LibreTata SteelFlock SafetyIntelDefense Intelligence AgencyDHL
DuolingoShellSiemensRenaultPhilipsNEURA RoboticsMercado LibreTata SteelFlock SafetyIntelDefense Intelligence AgencyDHL
DuolingoShellSiemensRenaultPhilipsNEURA RoboticsMercado LibreTata SteelFlock SafetyIntelDefense Intelligence AgencyDHL

我们模型的影响力

借助我们尖端的视觉 AI 模型,简化各行业的流程。由 Ultralytics 提供支持的速度、准确性与易用性。

GitHubGitHub 星标
下载量
Ultralytics YOLO 每日使用量
开源贡献者

Ultralytics YOLO 模型的演进

了解 Ultralytics YOLO 如何从实用的 YOLOv5 工作流演进到边缘就绪的 YOLO26 推理。

通过快速、实用的 PyTorch 工作流,让实时目标检测变得触手可及。

在检测、分割、分类、姿态估计和 OBB 任务中扩展了统一的工作流。

在保持熟悉的 Ultralytics 工作流的同时,提高了准确性、速度和效率。

引入了端到端推理以及针对高效边缘部署优化的架构。

部署到任意位置

导出至 20 种格式,并在边缘端、云端和移动端进行部署。

探索行业解决方案

了解团队如何在生产环境中应用 Ultralytics 计算机视觉。

常见问题解答

  • YOLO-VLM 是 Ultralytics 官方Ultralytics 路线图上公布的一款即将推出的 Ultralytics 模型,它是一个轻量级 YOLO 前端,为更深层的 LLM 层提供输入,从而实现高效的视觉-语言管道——即连接到语言模型的快速视觉感知。

  • 大多数视觉-语言模型体积庞大,在视频上持续运行的成本很高。一般来说,分工协作——即由快速的视觉前端为更深层的语言层提供输入——既能保持实时的感知能力,又能将语言计算留给真正能体现价值的地方。Ultralytics 路线图为 YOLO-VLM 描述的就是这种管道形态。

  • 通常,视觉语言流水线支持自然语言场景描述、视觉问答、视频上的开放词汇搜索,以及能够解释发生了什么而不仅仅是发出警报的通知。YOLO-VLM 已公布的角色正是此类流水线的高效前端。

  • Ultralytics 在官方 roadmap 上公布了发布时间,该 roadmap 是了解产品发布计划的权威来源。请关注该 roadmap 以及 Ultralytics on GitHub 以获取发布通知。

  • Ultralytics YOLO26开始构建实时感知层:检测、分割、姿态估计和跟踪。今天基于 Ultralytics 工作流程构建的管道已做好准备,以便在 YOLO-VLM 发布时添加语言层。现在即可在Ultralytics 平台上进行训练和部署。

为 YOLO-VLM 做准备

立即使用 Ultralytics YOLO26 构建感知层,并在发布时将视觉与语言连接起来。