Pourquoi ce sujet est important
Le modèle Whisper peut être utilisé via API ou exécuté sur une infrastructure contrôlée. L’API facture l’usage et évite l’exploitation. Le local transforme le coût variable en capacité GPU, mais cette capacité n’est rentable que si elle est suffisamment utilisée.
Définir l’unité de comparaison
Comparez le coût par heure audio correctement transcrite, pas le prix par heure de GPU. Incluez détection des fichiers invalides, conversion, transcription, correction, diarisation éventuelle, stockage et nouvelles tentatives. Fixez aussi délai acceptable : batch nocturne et transcription quasi temps réel n’ont pas la même capacité.
Calculer le coût API
Multipliez les minutes traitées par le tarif actuel, puis ajoutez stockage, transfert, orchestration et appels échoués. Vérifiez limites de taille, formats et politique de données. L’API réduit le coût fixe et absorbe les pointes, ce qui est favorable au lancement et aux volumes irréguliers.
Calculer le coût local
Coût local par heure audio = coût complet de l’infrastructure par heure ÷ heures audio traitées par heure utile. Ajoutez taux d’inactivité, CPU, disque, téléchargement des poids, files, supervision, mises à jour, redondance et temps humain. Mesurez le débit avec le modèle et la précision réellement retenus.
Benchmarker correctement
Utilisez des fichiers représentatifs : durées variées, français, accents, téléphone, bruit et silences. Mesurez real-time factor, mémoire, débit par batch, taux d’échec et précision. Une quantification ou une implémentation optimisée peut changer débit et qualité.
Intégrer la qualité
Un petit modèle moins cher peut générer davantage de corrections humaines. Mesurez WER sur un corpus annoté et surtout erreurs métier : montants, noms propres, références. Le coût de correction doit être ajouté aux deux options.
Construire une architecture hybride
Gardez l’API pour les pointes ou comme fallback et traitez le volume stable localement. Une file décide selon sensibilité, délai, taille et capacité disponible. Cette approche réduit le surdimensionnement, mais exige des tests garantissant une qualité comparable.
Tableau de décision
| Situation | Option probable | Pourquoi |
|---|---|---|
| Prototype | API | Aucun coût fixe |
| Volume irrégulier | API ou hybride | Absorption des pointes |
| Volume stable élevé | Local à benchmarker | GPU mieux amorti |
| Données très sensibles | Local contrôlé | Maîtrise des flux |
| SLA fort | Dédié + fallback | Capacité et continuité |
Exemple concret
Une équipe reçoit 5 000 heures par mois, avec une pointe le lundi. Le benchmark local traite six heures audio par heure GPU, mais l’utilisation moyenne n’est que de 45 %. Après ajout d’un nœud de secours et de la correction humaine, le local n’est rentable que si la file lisse la charge. L’équipe conserve l’API comme débordement.
Les erreurs fréquentes
- utiliser un débit publié sans benchmark
- supposer un GPU utilisé en permanence
- ignorer conversion audio et silences
- comparer des modèles de tailles différentes sans qualité
- oublier correction humaine et redondance
- ne pas tester la restauration après panne
Checklist de mise en production
- [ ] Corpus audio représentatif
- [ ] WER et erreurs métier mesurés
- [ ] Débit local benchmarké
- [ ] Taux d’utilisation réaliste
- [ ] Coûts humains inclus
- [ ] Politique de données examinée
- [ ] Fallback et files testés
- [ ] Seuil recalculé à chaque changement de modèle
FAQ
Whisper local est-il gratuit ?
Les poids évitent un tarif API, mais calcul, stockage et exploitation ont un coût.
Quel modèle choisir ?
Le plus petit qui atteint votre qualité cible. Mesurez les erreurs métier, pas seulement la vitesse.
Peut-on utiliser un CPU ?
Oui pour certains volumes et modèles, mais le délai peut être trop élevé. Benchmarkez.
Quand choisir l’hybride ?
Lorsque le volume stable justifie du local mais que les pointes ou la continuité exigent une API.