Guide

Statut éditorial : En attente de relecture

Whisper API ou auto-hébergé : calculer le vrai seuil de rentabilité

Comparer l’API Whisper et un déploiement local selon volume audio, débit GPU, précision, confidentialité et coût d’exploitation.

Classification du contenu

Types

  • Speech et voix

Technologies

Niveau
Avancé
Publié le
24 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
24 octobre 2026

Pourquoi ce sujet est important

Le modèle Whisper peut être utilisé via API ou exécuté sur une infrastructure contrôlée. L’API facture l’usage et évite l’exploitation. Le local transforme le coût variable en capacité GPU, mais cette capacité n’est rentable que si elle est suffisamment utilisée.

Définir l’unité de comparaison

Comparez le coût par heure audio correctement transcrite, pas le prix par heure de GPU. Incluez détection des fichiers invalides, conversion, transcription, correction, diarisation éventuelle, stockage et nouvelles tentatives. Fixez aussi délai acceptable : batch nocturne et transcription quasi temps réel n’ont pas la même capacité.

Calculer le coût API

Multipliez les minutes traitées par le tarif actuel, puis ajoutez stockage, transfert, orchestration et appels échoués. Vérifiez limites de taille, formats et politique de données. L’API réduit le coût fixe et absorbe les pointes, ce qui est favorable au lancement et aux volumes irréguliers.

Calculer le coût local

Coût local par heure audio = coût complet de l’infrastructure par heure ÷ heures audio traitées par heure utile. Ajoutez taux d’inactivité, CPU, disque, téléchargement des poids, files, supervision, mises à jour, redondance et temps humain. Mesurez le débit avec le modèle et la précision réellement retenus.

Benchmarker correctement

Utilisez des fichiers représentatifs : durées variées, français, accents, téléphone, bruit et silences. Mesurez real-time factor, mémoire, débit par batch, taux d’échec et précision. Une quantification ou une implémentation optimisée peut changer débit et qualité.

Intégrer la qualité

Un petit modèle moins cher peut générer davantage de corrections humaines. Mesurez WER sur un corpus annoté et surtout erreurs métier : montants, noms propres, références. Le coût de correction doit être ajouté aux deux options.

Construire une architecture hybride

Gardez l’API pour les pointes ou comme fallback et traitez le volume stable localement. Une file décide selon sensibilité, délai, taille et capacité disponible. Cette approche réduit le surdimensionnement, mais exige des tests garantissant une qualité comparable.

Tableau de décision

SituationOption probablePourquoi
PrototypeAPIAucun coût fixe
Volume irrégulierAPI ou hybrideAbsorption des pointes
Volume stable élevéLocal à benchmarkerGPU mieux amorti
Données très sensiblesLocal contrôléMaîtrise des flux
SLA fortDédié + fallbackCapacité et continuité

Exemple concret

Une équipe reçoit 5 000 heures par mois, avec une pointe le lundi. Le benchmark local traite six heures audio par heure GPU, mais l’utilisation moyenne n’est que de 45 %. Après ajout d’un nœud de secours et de la correction humaine, le local n’est rentable que si la file lisse la charge. L’équipe conserve l’API comme débordement.

Les erreurs fréquentes

Checklist de mise en production

FAQ

Whisper local est-il gratuit ?

Les poids évitent un tarif API, mais calcul, stockage et exploitation ont un coût.

Quel modèle choisir ?

Le plus petit qui atteint votre qualité cible. Mesurez les erreurs métier, pas seulement la vitesse.

Peut-on utiliser un CPU ?

Oui pour certains volumes et modèles, mais le délai peut être trop élevé. Benchmarkez.

Quand choisir l’hybride ?

Lorsque le volume stable justifie du local mais que les pointes ou la continuité exigent une API.

Sources utilisées