Ultralytics YOLO-VLM
Ein leichtgewichtiges YOLO-Front-End speist eine tiefere LLM-Schicht für effiziente Vision-Language-Pipelines, angekündigt auf der Ultralytics-Roadmap. Baue noch heute auf YOLO26 auf und sei bereit, Vision bei der Veröffentlichung mit Sprache zu verknüpfen.
Von weltweit führenden Unternehmen vertraut
Die Wirkung unserer Modelle
Optimiere Prozesse branchenübergreifend mit unseren hochmodernen Vision-KI-Modellen. Geschwindigkeit, Genauigkeit und Benutzerfreundlichkeit, angetrieben von Ultralytics.
Die Evolution der Ultralytics-YOLO-Modelle
Erfahre, wie sich Ultralytics YOLO vom praktischen YOLOv5-Workflow zur Edge-Ready-YOLO26-Inferenz entwickelt hat.
Trainiere auf den besten GPUs zu geringeren Kosten
26 NVIDIA GPUs ab 0,24 $/Std. – von Ampere bis Blackwell. Kein Aufschlag, kein Mindestbetrag, keine Verpflichtung.
Branchenlösungen erkunden
Sieh dir an, wie Teams die Computer Vision von Ultralytics in Produktionsumgebungen einsetzen.

Landwirtschaft

Automobilindustrie

Gesundheitswesen

Logistik

Fertigung

Einzelhandel

Robotik

Landwirtschaft

Automobilindustrie

Gesundheitswesen

Logistik

Fertigung

Einzelhandel

Robotik

Landwirtschaft

Automobilindustrie

Gesundheitswesen

Logistik

Fertigung

Einzelhandel

Robotik
Häufig gestellte Fragen
YOLO-VLM ist ein kommendes Ultralytics-Modell, das auf der offiziellen Ultralytics roadmap als leichtgewichtiger YOLO-Front-End angekündigt wurde, der eine tiefere LLM-Schicht für effiziente Vision-Language-Pipelines speist – schnelle visuelle Wahrnehmung verbunden mit einem Sprachmodell.
Die meisten Vision-Language-Modelle sind groß und teuer im kontinuierlichen Betrieb auf Video. Im Allgemeinen hält die Aufteilung der Arbeit – ein schnelles Vision-Front-End, das eine tiefere Sprachschicht speist – die Wahrnehmung in Echtzeit, während Sprachrechenleistung für Bereiche reserviert wird, in denen sie einen Mehrwert bietet. Das ist die Pipeline-Form, die die Ultralytics roadmap für YOLO-VLM beschreibt.
Im Allgemeinen ermöglichen Vision-Language-Pipelines natürlichsprachliche Szenenbeschreibungen, visuelle Fragenbeantwortung, Vokabular-offene Suche über Videos hinweg und Warnungen, die erklären, was passiert ist, anstatt es nur zu kennzeichnen. Die angekündigte Rolle von YOLO-VLM ist das effiziente Front-End für solche Pipelines.
Ultralytics gibt den Veröffentlichungszeitpunkt auf der offiziellen Roadmap bekannt, die die maßgebliche Quelle dafür ist, was wann erscheint. Folge der Roadmap und Ultralytics auf GitHub für Veröffentlichungsankündigungen.
Beginne mit Ultralytics YOLO26 für die Echtzeit-Wahrnehmungsschicht: Detektion, Segmentierung, Pose und Tracking. Pipelines, die heute auf dem Ultralytics-Workflow basieren, sind darauf ausgerichtet, die Sprachschicht hinzuzufügen, wenn YOLO-VLM erscheint. Trainiere und deploye jetzt auf der Ultralytics Platform.
Sei bereit für YOLO-VLM
Baue die Wahrnehmungsschicht heute mit Ultralytics YOLO26 auf und verbinde Vision bei der Veröffentlichung mit Sprache.