Technologie

Statut éditorial : En attente de relecture

vLLM

Moteur d’inférence et de serving à haut débit pour modèles de langage, avec batching continu et API compatible OpenAI.

Classification de la technologie

Type

  • Intelligence artificielle

Technologie

  • vLLM

Autres noms : vLLM engine

vLLM est conçu pour servir des modèles génératifs avec une utilisation efficace de la mémoire du cache KV. Il fournit une API compatible OpenAI, des images de conteneur et des métriques pour l’exploitation.

Licence
Apache-2.0
Langage principal
Python
État des informations
Vérifiées récemment
Dernière vérification
12 août 2026

Sources utilisées