Comparer un prix par million de tokens au tarif horaire d’un GPU produit une décision trompeuse. Le coût du chatbot inclut entrée, sortie, cache, embeddings, retrieval, outils, modération, observabilité, disponibilité et temps humain. La qualité modifie aussi le nombre de reprises et d’escalades.
Calcul d’une solution API
Mesurez tokens d’entrée et sortie par parcours, y compris instructions, historique et contexte RAG. Ajoutez embeddings, reranking, appels d’outils, stockage de traces et évaluations. Appliquez le taux de cache réel et les éventuels tarifs batch. Estimez pics, limites de débit et coût des retries.
Calcul d’un modèle hébergé
Incluez GPU ou CPU, stockage, réseau, instances de secours, capacité inutilisée, déploiement, supervision et astreinte. Mesurez le débit sur votre contexte et votre concurrence, pas une fiche théorique. Une disponibilité élevée peut nécessiter plusieurs accélérateurs même lorsque le trafic moyen est faible.
La qualité dans l’équation
Comparez les solutions sur le même dataset : réussite, fidélité, refus, latence et besoin d’intervention humaine. Un modèle local moins cher par token peut nécessiter plus de contexte, d’étapes ou de corrections. Calculez le coût par conversation réussie ou tâche terminée.
Scénarios et seuil de rentabilité
Construisez trois scénarios de volume et un profil horaire. L’API est souvent avantageuse pour un démarrage incertain ; l’auto-hébergement devient intéressant avec une charge stable, des contraintes de contrôle et une équipe capable de l’exploiter. Une stratégie hybride peut réserver le local aux tâches simples ou sensibles.
FAQ
Peut-on utiliser les prix d’un comparatif en ligne ?
Seulement comme entrée datée ; vérifiez toujours les pages officielles et votre consommation.
L’auto-hébergement élimine-t-il les coûts par token ?
Non. Ils deviennent surtout coûts d’infrastructure et d’exploitation.
Quelle métrique financière suivre ?
Le coût par résultat métier acceptable, complété par coût mensuel, pics et marge de capacité.