Technologie

Statut éditorial : En attente de relecture

LiteLLM

Une bibliothèque et une passerelle compatibles avec l’API OpenAI pour accéder à plusieurs fournisseurs de modèles depuis une interface commune.

Classification de la technologie

Type

  • Intelligence artificielle

Technologie

  • LiteLLM

En bref

LiteLLM fournit une interface commune pour appeler de nombreux fournisseurs de modèles. Il peut être utilisé comme bibliothèque Python dans une application ou comme passerelle HTTP centrale compatible avec les formats d’API OpenAI.

Son objectif est de réduire la quantité de code spécifique à chaque fournisseur et de centraliser des fonctions comme le routage, les reprises, le suivi des coûts, les clés virtuelles et les limites d’usage. Il ne supprime toutefois pas les différences de capacités entre modèles.

Deux modes d’utilisation

La bibliothèque Python

Le SDK s’intègre directement au programme. Le nom du modèle indique généralement le fournisseur, puis LiteLLM traduit la requête et normalise la réponse.

from litellm import completion

response = completion(
    model="openai/gpt-5",
    messages=[
        {"role": "user", "content": "Résume ce ticket en trois points."}
    ],
)

print(response.choices[0].message.content)

Ce mode est simple pour une application Python unique. La configuration, les secrets et l’observabilité restent alors gérés dans chaque déploiement de l’application.

La passerelle LiteLLM Proxy

Le proxy devient un service partagé entre plusieurs applications. Les clients utilisent une URL et une clé internes tandis que la passerelle détient les secrets des fournisseurs et choisit le déploiement cible.

Ce modèle est utile pour une équipe plateforme : il offre un point commun pour les quotas, les budgets, la journalisation, le routage et les politiques. En contrepartie, la passerelle devient une dépendance critique qui doit être sécurisée, supervisée et dimensionnée.

Routage et résilience

Le routeur peut répartir les appels entre plusieurs déploiements et appliquer des reprises ou des fallbacks. Cette fonction améliore la disponibilité uniquement si les scénarios d’échec sont pensés explicitement.

Un fallback vers un autre modèle peut modifier la qualité, la longueur de sortie, le comportement des outils ou la politique de données. Il faut donc définir des groupes de modèles compatibles, limiter le nombre de tentatives et enregistrer le modèle réellement utilisé.

Pour une opération susceptible d’avoir un effet externe, une reprise automatique doit s’appuyer sur une clé d’idempotence. Sans cela, une réponse réseau perdue peut conduire à répéter l’action.

Ce que l’interface commune ne normalise pas

LiteLLM harmonise une partie des requêtes, réponses et exceptions. Il ne peut pas rendre identiques :

Le code portable doit se limiter à un sous-ensemble testé. Les capacités avancées peuvent nécessiter des branches spécifiques.

Sécurité et gouvernance

Dans une passerelle partagée, utilisez des clés distinctes par application ou équipe. Appliquez des quotas, séparez les environnements et limitez les modèles autorisés. Ne transmettez jamais les clés des fournisseurs au navigateur.

Les journaux peuvent contenir les prompts, les pièces jointes et les réponses. Décidez quels champs sont nécessaires avant d’activer une journalisation détaillée, puis appliquez masquage, durée de conservation et contrôle d’accès.

Quand choisir LiteLLM ?

LiteLLM est pertinent si plusieurs applications ou fournisseurs doivent être gérés avec des règles communes, si vous avez besoin de tester des modèles derrière une interface stable ou si une équipe plateforme souhaite centraliser budgets et accès.

Il apporte moins de valeur pour un prototype utilisant un seul fournisseur, ou lorsque l’application dépend fortement de fonctions propriétaires difficiles à représenter dans une interface commune.

Checklist de mise en production

  1. Épinglez les versions de LiteLLM et de sa configuration.
  2. Nommez explicitement les modèles autorisés et leurs fallbacks.
  3. Séparez les clés et budgets par consommateur.
  4. Définissez délais, reprises et idempotence.
  5. Testez les erreurs de débit, d’authentification et d’indisponibilité.
  6. Mesurez latence, coût, taux d’erreur et fournisseur réellement appelé.
  7. Filtrez les données sensibles dans les journaux.

À retenir

LiteLLM simplifie l’accès multi-fournisseurs et peut devenir une véritable passerelle de gouvernance. Sa réussite dépend moins du nombre de modèles annoncés que de la discipline appliquée au routage, aux secrets, aux tests de compatibilité et à l’observabilité.

État des informations
Non vérifié
Dernière vérification
Pas encore vérifiée

Sources utilisées