Guide

Statut éditorial : En attente de relecture

STT en français : comparer Deepgram, AssemblyAI, Whisper et Google

Choisir un moteur de transcription française selon précision, temps réel, diarisation, données, intégration et coût.

Classification du contenu

Types

  • Speech et voix
Niveau
Intermédiaire
Publié le
24 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
24 octobre 2026

Pourquoi ce sujet est important

Une transcription “correcte” sur un podcast propre peut échouer sur un appel téléphonique, des noms de produits ou plusieurs intervenants. Le meilleur service en français est celui qui réussit sur votre audio, avec votre contrainte de délai et votre vocabulaire.

Construire un corpus français

Rassemblez plusieurs heures couvrant accents, régions, téléphone, réunion, bruit, chevauchements, chiffres, sigles et noms propres. Faites annoter une vérité terrain avec règles communes. Séparez un jeu de réglage et un jeu final pour ne pas optimiser sur les mêmes fichiers.

Deepgram

Deepgram propose des modèles STT et un streaming conçu pour le temps réel. Il mérite un test pour voice agents, centres d’appels et sous-titrage en direct. Évaluez résultats intérimaires, finalisation, endpointing, vocabulaire et comportement lors des reconnexions.

AssemblyAI

AssemblyAI associe transcription et fonctions d’intelligence audio comme diarisation, résumé ou détection de sujets selon les services disponibles. Il convient aux workflows asynchrones qui veulent enrichir l’audio. Comparez séparément transcription brute et traitements supplémentaires.

Whisper

Whisper fournit code et poids téléchargeables et existe aussi via API OpenAI. Le local apporte contrôle et choix matériel, mais pas un streaming natif équivalent à toutes les API spécialisées. Des implémentations segmentent l’audio ; testez la latence et les coupures.

Google Speech-to-Text

Google Cloud propose streaming, modèles et intégration à son cloud. C’est un candidat pour les organisations déjà présentes sur Google Cloud ou ayant besoin d’options spécifiques. Vérifiez modèle, région, adaptation et tarification actuels.

Mesurer qualité et exploitation

Calculez WER, mais créez aussi des métriques pondérées pour entités métier. Mesurez premier résultat, finalisation, débit batch, erreurs et stabilité. Évaluez diarisation avec une métrique dédiée. Ajoutez coût des fonctions optionnelles et correction humaine.

Tableau de décision

BesoinCandidats initiauxTest critique
Voice agentDeepgram, GoogleLatence et endpointing
Analyse audio enrichieAssemblyAIDiarisation et résumé
Contrôle localWhisperGPU, qualité et files
Stack Google CloudGoogle STTRégion et intégration

Exemple concret

Pour un support français, 500 extraits sont annotés avec références de dossier et noms de produits. Deepgram gagne sur le premier résultat, Whisper local sur le contrôle des données, AssemblyAI sur l’enrichissement, et Google sur l’intégration existante. La décision utilise une pondération : erreurs de montants coûtent dix fois une erreur d’article.

Les erreurs fréquentes

Checklist de mise en production

FAQ

Quel moteur est le meilleur en français ?

Aucun universellement. Évaluez-les sur votre acoustique, votre vocabulaire et votre délai.

WER suffit-il ?

Non. Mesurez les erreurs qui ont un impact métier et la qualité des timestamps ou intervenants.

Whisper convient-il au temps réel ?

Il peut être adapté au quasi temps réel, mais demande segmentation et orchestration ; comparez avec une API streaming native.

Comment améliorer les noms propres ?

Utilisez les fonctions de vocabulaire disponibles, un post-traitement contrôlé et un corpus de test riche en entités.

Sources utilisées