Ultralytics YOLO-VLM
軽量なYOLOのフロントエンドに、より深いLLMレイヤーを組み合わせて効率的なビジョン・言語パイプラインを実現し、Ultralyticsのロードマップで発表されました。今すぐYOLO26をベースに構築し、リリース時にビジョンと言語を接続できるように準備してください。
世界をリードする組織に信頼されています
私たちのモデルがもたらす影響
最先端のビジョン AI モデルで、業界をまたいだプロセスを効率化します。Ultralytics が提供する、スピード、精度、そして使いやすさをご体験ください。
Ultralytics YOLOモデルの進化
Ultralytics YOLOが実践的なYOLOv5ワークフローからエッジ対応のYOLO26推論へとどのように進化したかをご覧ください。
最適な GPU で低コストのトレーニングを実現
Ampere から Blackwell まで、26種類の NVIDIA GPU を 1 時間あたり $0.24 から提供します。マージンなし、最低利用料金なし、コミットメント不要です。
業界別ソリューションを見る
チームが本番環境で Ultralytics のコンピュータビジョンをどのように活用しているかご覧ください。

農業

自動車

ヘルスケア

物流

製造

小売

ロボティクス

農業

自動車

ヘルスケア

物流

製造

小売

ロボティクス

農業

自動車

ヘルスケア

物流

製造

小売

ロボティクス
よくある質問
YOLO-VLMは、効率的なビジョン言語パイプラインのために、より深いLLMレイヤーにデータを供給する軽量なYOLOフロントエンドとして、公式のUltralytics roadmapで発表された近日公開予定のUltralyticsモデルであり、言語モデルに接続された高速な視覚知覚を実現します。
ほとんどのビジョン言語モデルは大規模であり、ビデオ上で継続的に実行するにはコストがかかります。一般的に、作業を分割すること(高速なビジョンフロントエンドがより深い言語レイヤーにデータを供給すること)により、知覚をリアルタイムに維持しつつ、価値を付加する部分のために言語の計算量を温存することができます。それが、Ultralytics roadmapがYOLO-VLMについて説明しているパイプラインの形状です。
一般的に、ビジョン・言語パイプラインにより、自然言語によるシーンの説明、視覚的な質問応答、ビデオに対するオープンボキャブラリー検索、および単にフラグを立てるだけでなく何が起きたのかを説明するアラートが可能になります。YOLO-VLMの発表された役割は、このようなパイプラインのための効率的なフロントエンドです。
Ultralyticsは、公式のroadmapでリリース時期を発表しています。これは、どの機能がいつリリースされるかに関する信頼できる情報源です。ロードマップとUltralytics on GitHubをフォローして、リリースの発表を確認してください。
リアルタイムの知覚レイヤー(検出、セグメンテーション、姿勢推定、トラッキング)にはUltralytics YOLO26から始めてください。現在のUltralyticsワークフローに基づいて構築されたパイプラインは、YOLO-VLMのリリース時に言語レイヤーを追加できるように位置づけられています。Ultralytics Platformで今すぐトレーニングとデプロイを行ってください。
YOLO-VLMの準備をしましょう
今すぐUltralytics YOLO26で認識レイヤーを構築し、リリースの際にビジョンと言語を接続しましょう。