Technologie
Statut éditorial : En attente de relecturevLLM
Moteur d’inférence et de serving à haut débit pour modèles de langage, avec batching continu et API compatible OpenAI.
Classification de la technologie
Type
Technologie
Autres noms : vLLM engine
vLLM est conçu pour servir des modèles génératifs avec une utilisation efficace de la mémoire du cache KV. Il fournit une API compatible OpenAI, des images de conteneur et des métriques pour l’exploitation.
- Licence
- Apache-2.0
- Langage principal
- Python
- État des informations
- Vérifiées récemment
- Dernière vérification
- 12 août 2026
Sources utilisées
- vLLM — Quickstart (s’ouvre dans un nouvel onglet) — vLLM Project
- vLLM — OpenAI-compatible server (s’ouvre dans un nouvel onglet) — vLLM Project
- vLLM — GPU installation (s’ouvre dans un nouvel onglet) — vLLM Project