Pourquoi chercher une alternative aux modèles américains ?
OpenAI, Anthropic et Google proposent des modèles très performants et des API faciles à intégrer. Chercher une alternative ne signifie donc pas qu’il faut les abandonner. La vraie question est plutôt : votre application dépend-elle trop d’un seul fournisseur, d’une seule région ou d’un seul modèle ?
Une équipe peut vouloir examiner des modèles européens ou chinois pour plusieurs raisons :
- disposer d’un modèle téléchargeable et auto-hébergeable ;
- traiter les données dans une infrastructure choisie ;
- mieux couvrir certaines langues ou certains usages ;
- réduire le coût d’une tâche très répétitive ;
- éviter qu’une panne, une hausse tarifaire ou le retrait d’un modèle bloque le produit ;
- comparer les performances au lieu de choisir uniquement selon la notoriété du fournisseur.
Il ne s’agit pas de remplacer automatiquement un modèle américain par un modèle européen ou chinois. Il s’agit de construire une décision technique fondée sur vos données, vos contraintes et des tests reproductibles.
De quoi parle-t-on exactement ?
Le mot « modèle » recouvre plusieurs éléments qu’il faut distinguer.
Une famille de modèles regroupe plusieurs tailles et versions, par exemple Mistral, Qwen ou DeepSeek. Un modèle précis est une version identifiable de cette famille. Un fournisseur d’inférence fait tourner ce modèle et expose une API. Enfin, une application ajoute ses propres prompts, outils, documents et règles de sécurité.
Cette distinction est essentielle. Un modèle européen peut être exécuté par un cloud situé hors d’Europe. À l’inverse, un modèle chinois dont les poids sont disponibles peut être déployé sur un serveur contrôlé en France. L’origine du modèle ne suffit donc pas à déterminer le lieu de traitement ni le niveau de contrôle.
Les principales familles européennes
Mistral AI
Mistral propose à la fois des modèles accessibles par API et des modèles dont les poids peuvent être téléchargés. Son catalogue couvre des besoins généralistes, le raisonnement, le code, la vision, l’audio et le traitement documentaire.
Mistral est souvent le premier candidat européen à tester lorsqu’on recherche une API généraliste ou un modèle auto-hébergeable. Il faut néanmoins vérifier la licence et le statut de chaque version : tous les modèles de la famille n’offrent pas les mêmes droits ni le même mode de distribution.
Apertus
Apertus est développé en Suisse par la Swiss AI Initiative. Le projet met l’accent sur l’ouverture : poids, code, documentation technique et informations sur l’entraînement sont publiés. Il vise également une couverture linguistique très large.
Apertus est intéressant lorsque la transparence, la recherche, l’auditabilité ou l’auto-hébergement sont prioritaires. Attention au vocabulaire : la Suisse est en Europe, mais elle n’est pas membre de l’Union européenne. « Modèle européen » ne signifie donc pas automatiquement « modèle de l’UE ».
EuroLLM
EuroLLM est conçu autour du multilinguisme européen. Le projet couvre les 24 langues officielles de l’Union européenne ainsi que plusieurs autres langues importantes.
Cette famille mérite un test pour les produits qui doivent offrir une qualité homogène dans plusieurs langues européennes. Son intérêt ne doit cependant pas être déduit de sa seule couverture annoncée : il faut mesurer la qualité sur les tâches réelles de l’application, notamment en français.
Pharia AI
Pharia est développé par l’entreprise allemande Aleph Alpha et cible principalement les organisations et secteurs régulés. Son positionnement met l’accent sur le contrôle, l’explicabilité et les déploiements d’entreprise.
Pharia se compare moins comme un simple modèle téléchargeable que comme une offre d’IA d’entreprise. Il faut donc examiner le produit complet : modèles disponibles, intégration, hébergement, contrat, traçabilité et coûts.
Les principales familles chinoises
Qwen
Qwen, développé par Alibaba, constitue un vaste écosystème : modèles généralistes, code, vision, audio et différentes tailles de déploiement. Plusieurs versions disposent de poids téléchargeables, tandis que d’autres sont proposées par API.
Qwen est pertinent pour explorer un portefeuille large, depuis un petit modèle local jusqu’à des modèles plus importants. Comme le catalogue évolue rapidement, utilisez toujours l’identifiant exact testé dans vos rapports.
DeepSeek
DeepSeek est particulièrement visible sur le raisonnement et le code. Certaines versions sont distribuées avec leurs poids, et une API officielle est également proposée.
La famille est intéressante pour les tâches techniques, l’extraction complexe et les expérimentations de raisonnement. Le raisonnement plus long peut toutefois augmenter latence et consommation de tokens. Il faut mesurer le coût par réponse réellement acceptée, pas seulement le prix affiché par million de tokens.
GLM
Les modèles GLM sont développés par Z.ai. Le catalogue couvre notamment le texte, le raisonnement, le code, les agents et la compréhension multimodale.
GLM mérite un pilote pour des workflows d’agent ou de développement logiciel. Les affirmations de performance publiées par un fournisseur doivent toujours être complétées par vos propres tests, avec vos outils et votre dépôt.
Kimi
Kimi est la famille de Moonshot AI. Elle est notamment positionnée sur les contextes longs, les documents, le raisonnement et les agents de code.
Une grande fenêtre de contexte peut faciliter l’analyse de dossiers ou de dépôts volumineux. Elle ne dispense toutefois pas de sélectionner les informations utiles : envoyer davantage de texte augmente le coût, la latence et le risque de noyer le signal important.
MiniMax
MiniMax propose des modèles de texte orientés raisonnement et agents, mais aussi des services de voix, d’image, de vidéo et de musique.
Cette plateforme devient intéressante lorsqu’une application doit combiner plusieurs modalités chez un même fournisseur. Pour une application uniquement textuelle, comparez séparément la qualité du modèle de texte : la largeur du catalogue ne garantit pas qu’il soit le meilleur sur votre tâche.
Tableau de lecture rapide
| Besoin prioritaire | Familles à tester en premier | Pourquoi |
|---|---|---|
| API européenne généraliste | Mistral | Catalogue API étendu et intégration relativement directe |
| Modèle entièrement ouvert et auditable | Apertus | Accent sur les poids, le code, les données et la documentation |
| Produit couvrant plusieurs langues de l’UE | EuroLLM, Mistral | Positionnement multilingue européen à valider sur votre corpus |
| Environnement d’entreprise régulé | Pharia, Mistral | Offres professionnelles et options de contrôle à examiner contractuellement |
| Code et raisonnement | DeepSeek, Qwen, GLM, Kimi | Familles proposant des modèles spécialisés ou agentiques |
| Petit ou moyen modèle auto-hébergé | Qwen, Mistral, Apertus | Plusieurs tailles ou variantes téléchargeables selon les licences |
| Application multimodale | Qwen, MiniMax, Mistral, GLM | Catalogues couvrant plusieurs types de médias |
Ce tableau sert à sélectionner les candidats d’un test. Il ne constitue pas un classement permanent : les catalogues, prix et modèles changent rapidement.
Les sept critères qui comptent vraiment
1. La qualité sur votre tâche
Préparez entre 50 et 200 exemples représentatifs : questions fréquentes, documents difficiles, code réel, cas limites et réponses refusées. Définissez ce qu’est une bonne réponse avant de lancer les modèles.
2. La qualité en français
Un score global ou anglais ne suffit pas. Testez les accords, les accents, la terminologie métier, les formats de date, les montants, le vouvoiement et la capacité à citer correctement des sources françaises.
3. Le coût complet
Additionnez tokens d’entrée et de sortie, cache, appels d’outils, nouvelles tentatives, hébergement, supervision et temps de correction humaine. Le bon indicateur est souvent le coût par résultat validé.
4. La latence et le débit
Mesurez le temps avant le premier token, la durée totale et le comportement sous charge. Un modèle excellent mais trop lent peut convenir à un traitement nocturne, pas à un assistant interactif.
5. Les données
Vérifiez où les requêtes sont traitées et stockées, leur durée de conservation, l’usage éventuel pour l’amélioration du service, les sous-traitants et les mécanismes de suppression. Ces réponses dépendent du canal utilisé, pas uniquement du modèle.
6. La licence
Pour un modèle téléchargeable, contrôlez les droits d’usage commercial, de modification, de redistribution et les éventuelles restrictions. « Open-weight » signifie que les poids sont accessibles ; cela ne garantit pas que le code, les données et tous les usages soient ouverts.
7. La réversibilité
Une API compatible avec le format OpenAI peut simplifier le changement de fournisseur, mais elle ne rend pas tous les modèles identiques. Le tool calling, les sorties structurées, les messages système et les erreurs peuvent différer. Conservez un adaptateur interne et des tests de non-régression.
Trois exemples de décision
Assistant documentaire pour une PME française
Commencez par une API simple, par exemple Mistral, puis comparez-la à un modèle Qwen ou Apertus servi dans une infrastructure approuvée. Évaluez surtout le français, les citations, la confidentialité et le coût des documents longs.
Agent de code
Comparez un modèle américain de référence avec DeepSeek, Qwen, GLM et Kimi sur les mêmes tickets. L’agent doit disposer des mêmes outils, du même budget et des mêmes tests. Mesurez le taux de tickets résolus sans correction, pas seulement la qualité d’un extrait de code.
Traitement de données sensibles
Sélectionnez d’abord l’architecture autorisée : cloud dédié, fournisseur régional ou auto-hébergement. Ensuite seulement, comparez les modèles compatibles avec cette architecture. Un modèle très performant mais impossible à déployer dans le périmètre approuvé ne constitue pas un candidat réel.
Une méthode de sélection en cinq étapes
- Décrivez la tâche, le niveau de risque et les contraintes non négociables.
- Sélectionnez trois modèles maximum, avec leur version et leur canal d’inférence exacts.
- Rejouez le même jeu d’évaluation et mesurez qualité, latence et coût.
- Vérifiez licence, sécurité, traitement des données et conditions contractuelles.
- Lancez un pilote limité, puis conservez un mécanisme de retour arrière.
Cette méthode évite un comparatif interminable. Elle produit une décision documentée qui peut être rejouée lorsqu’un nouveau modèle apparaît.
Les erreurs à éviter
- choisir selon un benchmark fourni par le vendeur sans test interne ;
- considérer tous les modèles d’un pays comme équivalents ;
- confondre origine du modèle et résidence des données ;
- écrire « open source » sans vérifier la licence et les éléments réellement publiés ;
- utiliser l’alias « latest » sans enregistrer la version appelée ;
- multiplier les fournisseurs avant d’avoir une raison opérationnelle ;
- envoyer des données sensibles pendant un simple essai gratuit.
FAQ
Les modèles européens ou chinois sont-ils moins performants ?
Il n’existe pas de réponse générale. Certaines familles sont très compétitives sur le code, le raisonnement, le multilingue ou les petits modèles. La performance doit être mesurée tâche par tâche.
Un modèle européen est-il automatiquement conforme au RGPD ?
Non. La conformité dépend de la finalité, des données, de l’hébergement, du contrat, de la conservation, des accès et de l’ensemble de l’application.
Peut-on utiliser un modèle chinois sans envoyer les données en Chine ?
Oui dans certains cas, par exemple lorsqu’une version téléchargeable est auto-hébergée ou servie par un fournisseur choisi. Il faut vérifier la licence et toute la chaîne technique.
Faut-il remplacer tous les modèles américains ?
Non. Une stratégie raisonnable consiste souvent à garder un modèle principal, tester une alternative et prévoir un fallback. La diversification doit résoudre un risque réel.
Combien de modèles faut-il évaluer ?
Trois candidats bien testés donnent généralement une décision plus utile qu’une liste de quinze modèles évalués superficiellement.
À quelle fréquence refaire le comparatif ?
Rejouez-le lors d’une nouvelle version majeure, d’un changement tarifaire ou contractuel, ou tous les deux à trois mois pour une application fortement dépendante des LLM.