Ultralytics YOLO-VLM
Un frontend YOLO ligero que alimenta una capa LLM más profunda para lograr tuberías eficientes de visión-lenguaje, anunciado en la hoja de ruta de Ultralytics. Construye sobre YOLO26 hoy y prepárate para conectar la visión con el lenguaje en el lanzamiento.
La confianza de las organizaciones líderes del mundo
El impacto de nuestros modelos
Optimiza los procesos en todas las industrias con nuestros modelos de IA de visión de vanguardia. Velocidad, precisión y facilidad de uso impulsadas por Ultralytics.
La evolución de los modelos Ultralytics YOLO
Descubre cómo evolucionó Ultralytics YOLO desde el flujo de trabajo práctico de YOLOv5 hasta la inferencia lista para el edge de YOLO26.
Entrena en las mejores GPUs por menos
26 GPUs NVIDIA desde 0,24 $/h, desde Ampere hasta Blackwell. Sin recargos, sin mínimos, sin compromisos.
Implementa en cualquier lugar
Exporta a 20 formatos e implementa en el perímetro, la nube y dispositivos móviles.
Explora soluciones industriales
Descubre cómo los equipos aplican la visión artificial de Ultralytics en entornos de producción.

Agricultura

Automoción

Salud

Logística

Fabricación

Comercio minorista

Robótica

Agricultura

Automoción

Salud

Logística

Fabricación

Comercio minorista

Robótica

Agricultura

Automoción

Salud

Logística

Fabricación

Comercio minorista

Robótica
Preguntas frecuentes
YOLO-VLM es un próximo modelo de Ultralytics anunciado en la hoja de ruta oficial de Ultralytics como un extremo frontal de YOLO ligero que alimenta una capa de LLM más profunda para canalizaciones eficientes de visión y lenguaje: percepción visual rápida conectada a un modelo de lenguaje.
La mayoría de los modelos de visión y lenguaje son grandes y caros de ejecutar continuamente en vídeo. En general, dividir el trabajo —un extremo frontal de visión rápido que alimenta una capa de lenguaje más profunda— mantiene la percepción en tiempo real mientras reserva el cálculo de lenguaje para donde aporta valor. Esa es la forma de canalización que la hoja de ruta de Ultralytics describe para YOLO-VLM.
En general, las tuberías de visión-lenguaje permiten descripciones de escenas en lenguaje natural, preguntas y respuestas visuales, búsqueda de vocabulario abierto en vídeo y alertas que explican lo que sucedió en lugar de limitarse a señalarlo. El papel anunciado de YOLO-VLM es el frontend eficiente para tuberías como estas.
Ultralytics anuncia los plazos de lanzamiento en la hoja de ruta oficial, que es la fuente autorizada sobre qué se lanza y cuándo. Sigue la hoja de ruta y Ultralytics en GitHub para ver los anuncios de lanzamiento.
Comienza con Ultralytics YOLO26 para la capa de percepción en tiempo real: detección, segmentación, postura y seguimiento. Las canalizaciones construidas sobre el flujo de trabajo de Ultralytics hoy en día están posicionadas para añadir la capa de lenguaje cuando YOLO-VLM se lance. Entrena y despliega ahora en la Plataforma Ultralytics.
Prepárate para YOLO-VLM
Construye la capa de percepción con Ultralytics YOLO26 hoy y conecta la visión con el lenguaje en el lanzamiento.