Pourquoi ce sujet est important
Une transcription “correcte” sur un podcast propre peut échouer sur un appel téléphonique, des noms de produits ou plusieurs intervenants. Le meilleur service en français est celui qui réussit sur votre audio, avec votre contrainte de délai et votre vocabulaire.
Construire un corpus français
Rassemblez plusieurs heures couvrant accents, régions, téléphone, réunion, bruit, chevauchements, chiffres, sigles et noms propres. Faites annoter une vérité terrain avec règles communes. Séparez un jeu de réglage et un jeu final pour ne pas optimiser sur les mêmes fichiers.
Deepgram
Deepgram propose des modèles STT et un streaming conçu pour le temps réel. Il mérite un test pour voice agents, centres d’appels et sous-titrage en direct. Évaluez résultats intérimaires, finalisation, endpointing, vocabulaire et comportement lors des reconnexions.
AssemblyAI
AssemblyAI associe transcription et fonctions d’intelligence audio comme diarisation, résumé ou détection de sujets selon les services disponibles. Il convient aux workflows asynchrones qui veulent enrichir l’audio. Comparez séparément transcription brute et traitements supplémentaires.
Whisper
Whisper fournit code et poids téléchargeables et existe aussi via API OpenAI. Le local apporte contrôle et choix matériel, mais pas un streaming natif équivalent à toutes les API spécialisées. Des implémentations segmentent l’audio ; testez la latence et les coupures.
Google Speech-to-Text
Google Cloud propose streaming, modèles et intégration à son cloud. C’est un candidat pour les organisations déjà présentes sur Google Cloud ou ayant besoin d’options spécifiques. Vérifiez modèle, région, adaptation et tarification actuels.
Mesurer qualité et exploitation
Calculez WER, mais créez aussi des métriques pondérées pour entités métier. Mesurez premier résultat, finalisation, débit batch, erreurs et stabilité. Évaluez diarisation avec une métrique dédiée. Ajoutez coût des fonctions optionnelles et correction humaine.
Tableau de décision
| Besoin | Candidats initiaux | Test critique |
|---|---|---|
| Voice agent | Deepgram, Google | Latence et endpointing |
| Analyse audio enrichie | AssemblyAI | Diarisation et résumé |
| Contrôle local | Whisper | GPU, qualité et files |
| Stack Google Cloud | Google STT | Région et intégration |
Exemple concret
Pour un support français, 500 extraits sont annotés avec références de dossier et noms de produits. Deepgram gagne sur le premier résultat, Whisper local sur le contrôle des données, AssemblyAI sur l’enrichissement, et Google sur l’intégration existante. La décision utilise une pondération : erreurs de montants coûtent dix fois une erreur d’article.
Les erreurs fréquentes
- tester uniquement de l’audio studio
- se fier au WER global pour les noms critiques
- confondre transcription et diarisation
- ignorer résultats intérimaires en temps réel
- comparer API et local sans coût d’exploitation
- utiliser une liste de langues comme preuve de qualité
Checklist de mise en production
- [ ] Corpus représentatif annoté
- [ ] Entités métier pondérées
- [ ] Latence intérimaire et finale mesurée
- [ ] Diarisation évaluée séparément
- [ ] Région et rétention vérifiées
- [ ] Coût complet calculé
- [ ] Erreurs et fallback testés
FAQ
Quel moteur est le meilleur en français ?
Aucun universellement. Évaluez-les sur votre acoustique, votre vocabulaire et votre délai.
WER suffit-il ?
Non. Mesurez les erreurs qui ont un impact métier et la qualité des timestamps ou intervenants.
Whisper convient-il au temps réel ?
Il peut être adapté au quasi temps réel, mais demande segmentation et orchestration ; comparez avec une API streaming native.
Comment améliorer les noms propres ?
Utilisez les fonctions de vocabulaire disponibles, un post-traitement contrôlé et un corpus de test riche en entités.