Guide

Statut éditorial : En attente de relecture

LLM européens et chinois : comment choisir une alternative aux modèles américains ?

Comprendre les alternatives européennes et chinoises aux modèles américains, puis choisir selon qualité, français, coût, données, licences et déploiement.

Classification du contenu

Types

  • Modèles et API
Niveau
Intermédiaire
Publié le
24 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
24 octobre 2026

Pourquoi chercher une alternative aux modèles américains ?

OpenAI, Anthropic et Google proposent des modèles très performants et des API faciles à intégrer. Chercher une alternative ne signifie donc pas qu’il faut les abandonner. La vraie question est plutôt : votre application dépend-elle trop d’un seul fournisseur, d’une seule région ou d’un seul modèle ?

Une équipe peut vouloir examiner des modèles européens ou chinois pour plusieurs raisons :

Il ne s’agit pas de remplacer automatiquement un modèle américain par un modèle européen ou chinois. Il s’agit de construire une décision technique fondée sur vos données, vos contraintes et des tests reproductibles.

De quoi parle-t-on exactement ?

Le mot « modèle » recouvre plusieurs éléments qu’il faut distinguer.

Une famille de modèles regroupe plusieurs tailles et versions, par exemple Mistral, Qwen ou DeepSeek. Un modèle précis est une version identifiable de cette famille. Un fournisseur d’inférence fait tourner ce modèle et expose une API. Enfin, une application ajoute ses propres prompts, outils, documents et règles de sécurité.

Cette distinction est essentielle. Un modèle européen peut être exécuté par un cloud situé hors d’Europe. À l’inverse, un modèle chinois dont les poids sont disponibles peut être déployé sur un serveur contrôlé en France. L’origine du modèle ne suffit donc pas à déterminer le lieu de traitement ni le niveau de contrôle.

Les principales familles européennes

Mistral AI

Mistral propose à la fois des modèles accessibles par API et des modèles dont les poids peuvent être téléchargés. Son catalogue couvre des besoins généralistes, le raisonnement, le code, la vision, l’audio et le traitement documentaire.

Mistral est souvent le premier candidat européen à tester lorsqu’on recherche une API généraliste ou un modèle auto-hébergeable. Il faut néanmoins vérifier la licence et le statut de chaque version : tous les modèles de la famille n’offrent pas les mêmes droits ni le même mode de distribution.

Apertus

Apertus est développé en Suisse par la Swiss AI Initiative. Le projet met l’accent sur l’ouverture : poids, code, documentation technique et informations sur l’entraînement sont publiés. Il vise également une couverture linguistique très large.

Apertus est intéressant lorsque la transparence, la recherche, l’auditabilité ou l’auto-hébergement sont prioritaires. Attention au vocabulaire : la Suisse est en Europe, mais elle n’est pas membre de l’Union européenne. « Modèle européen » ne signifie donc pas automatiquement « modèle de l’UE ».

EuroLLM

EuroLLM est conçu autour du multilinguisme européen. Le projet couvre les 24 langues officielles de l’Union européenne ainsi que plusieurs autres langues importantes.

Cette famille mérite un test pour les produits qui doivent offrir une qualité homogène dans plusieurs langues européennes. Son intérêt ne doit cependant pas être déduit de sa seule couverture annoncée : il faut mesurer la qualité sur les tâches réelles de l’application, notamment en français.

Pharia AI

Pharia est développé par l’entreprise allemande Aleph Alpha et cible principalement les organisations et secteurs régulés. Son positionnement met l’accent sur le contrôle, l’explicabilité et les déploiements d’entreprise.

Pharia se compare moins comme un simple modèle téléchargeable que comme une offre d’IA d’entreprise. Il faut donc examiner le produit complet : modèles disponibles, intégration, hébergement, contrat, traçabilité et coûts.

Les principales familles chinoises

Qwen

Qwen, développé par Alibaba, constitue un vaste écosystème : modèles généralistes, code, vision, audio et différentes tailles de déploiement. Plusieurs versions disposent de poids téléchargeables, tandis que d’autres sont proposées par API.

Qwen est pertinent pour explorer un portefeuille large, depuis un petit modèle local jusqu’à des modèles plus importants. Comme le catalogue évolue rapidement, utilisez toujours l’identifiant exact testé dans vos rapports.

DeepSeek

DeepSeek est particulièrement visible sur le raisonnement et le code. Certaines versions sont distribuées avec leurs poids, et une API officielle est également proposée.

La famille est intéressante pour les tâches techniques, l’extraction complexe et les expérimentations de raisonnement. Le raisonnement plus long peut toutefois augmenter latence et consommation de tokens. Il faut mesurer le coût par réponse réellement acceptée, pas seulement le prix affiché par million de tokens.

GLM

Les modèles GLM sont développés par Z.ai. Le catalogue couvre notamment le texte, le raisonnement, le code, les agents et la compréhension multimodale.

GLM mérite un pilote pour des workflows d’agent ou de développement logiciel. Les affirmations de performance publiées par un fournisseur doivent toujours être complétées par vos propres tests, avec vos outils et votre dépôt.

Kimi

Kimi est la famille de Moonshot AI. Elle est notamment positionnée sur les contextes longs, les documents, le raisonnement et les agents de code.

Une grande fenêtre de contexte peut faciliter l’analyse de dossiers ou de dépôts volumineux. Elle ne dispense toutefois pas de sélectionner les informations utiles : envoyer davantage de texte augmente le coût, la latence et le risque de noyer le signal important.

MiniMax

MiniMax propose des modèles de texte orientés raisonnement et agents, mais aussi des services de voix, d’image, de vidéo et de musique.

Cette plateforme devient intéressante lorsqu’une application doit combiner plusieurs modalités chez un même fournisseur. Pour une application uniquement textuelle, comparez séparément la qualité du modèle de texte : la largeur du catalogue ne garantit pas qu’il soit le meilleur sur votre tâche.

Tableau de lecture rapide

Besoin prioritaireFamilles à tester en premierPourquoi
API européenne généralisteMistralCatalogue API étendu et intégration relativement directe
Modèle entièrement ouvert et auditableApertusAccent sur les poids, le code, les données et la documentation
Produit couvrant plusieurs langues de l’UEEuroLLM, MistralPositionnement multilingue européen à valider sur votre corpus
Environnement d’entreprise réguléPharia, MistralOffres professionnelles et options de contrôle à examiner contractuellement
Code et raisonnementDeepSeek, Qwen, GLM, KimiFamilles proposant des modèles spécialisés ou agentiques
Petit ou moyen modèle auto-hébergéQwen, Mistral, ApertusPlusieurs tailles ou variantes téléchargeables selon les licences
Application multimodaleQwen, MiniMax, Mistral, GLMCatalogues couvrant plusieurs types de médias

Ce tableau sert à sélectionner les candidats d’un test. Il ne constitue pas un classement permanent : les catalogues, prix et modèles changent rapidement.

Les sept critères qui comptent vraiment

1. La qualité sur votre tâche

Préparez entre 50 et 200 exemples représentatifs : questions fréquentes, documents difficiles, code réel, cas limites et réponses refusées. Définissez ce qu’est une bonne réponse avant de lancer les modèles.

2. La qualité en français

Un score global ou anglais ne suffit pas. Testez les accords, les accents, la terminologie métier, les formats de date, les montants, le vouvoiement et la capacité à citer correctement des sources françaises.

3. Le coût complet

Additionnez tokens d’entrée et de sortie, cache, appels d’outils, nouvelles tentatives, hébergement, supervision et temps de correction humaine. Le bon indicateur est souvent le coût par résultat validé.

4. La latence et le débit

Mesurez le temps avant le premier token, la durée totale et le comportement sous charge. Un modèle excellent mais trop lent peut convenir à un traitement nocturne, pas à un assistant interactif.

5. Les données

Vérifiez où les requêtes sont traitées et stockées, leur durée de conservation, l’usage éventuel pour l’amélioration du service, les sous-traitants et les mécanismes de suppression. Ces réponses dépendent du canal utilisé, pas uniquement du modèle.

6. La licence

Pour un modèle téléchargeable, contrôlez les droits d’usage commercial, de modification, de redistribution et les éventuelles restrictions. « Open-weight » signifie que les poids sont accessibles ; cela ne garantit pas que le code, les données et tous les usages soient ouverts.

7. La réversibilité

Une API compatible avec le format OpenAI peut simplifier le changement de fournisseur, mais elle ne rend pas tous les modèles identiques. Le tool calling, les sorties structurées, les messages système et les erreurs peuvent différer. Conservez un adaptateur interne et des tests de non-régression.

Trois exemples de décision

Assistant documentaire pour une PME française

Commencez par une API simple, par exemple Mistral, puis comparez-la à un modèle Qwen ou Apertus servi dans une infrastructure approuvée. Évaluez surtout le français, les citations, la confidentialité et le coût des documents longs.

Agent de code

Comparez un modèle américain de référence avec DeepSeek, Qwen, GLM et Kimi sur les mêmes tickets. L’agent doit disposer des mêmes outils, du même budget et des mêmes tests. Mesurez le taux de tickets résolus sans correction, pas seulement la qualité d’un extrait de code.

Traitement de données sensibles

Sélectionnez d’abord l’architecture autorisée : cloud dédié, fournisseur régional ou auto-hébergement. Ensuite seulement, comparez les modèles compatibles avec cette architecture. Un modèle très performant mais impossible à déployer dans le périmètre approuvé ne constitue pas un candidat réel.

Une méthode de sélection en cinq étapes

  1. Décrivez la tâche, le niveau de risque et les contraintes non négociables.
  2. Sélectionnez trois modèles maximum, avec leur version et leur canal d’inférence exacts.
  3. Rejouez le même jeu d’évaluation et mesurez qualité, latence et coût.
  4. Vérifiez licence, sécurité, traitement des données et conditions contractuelles.
  5. Lancez un pilote limité, puis conservez un mécanisme de retour arrière.

Cette méthode évite un comparatif interminable. Elle produit une décision documentée qui peut être rejouée lorsqu’un nouveau modèle apparaît.

Les erreurs à éviter

FAQ

Les modèles européens ou chinois sont-ils moins performants ?

Il n’existe pas de réponse générale. Certaines familles sont très compétitives sur le code, le raisonnement, le multilingue ou les petits modèles. La performance doit être mesurée tâche par tâche.

Un modèle européen est-il automatiquement conforme au RGPD ?

Non. La conformité dépend de la finalité, des données, de l’hébergement, du contrat, de la conservation, des accès et de l’ensemble de l’application.

Peut-on utiliser un modèle chinois sans envoyer les données en Chine ?

Oui dans certains cas, par exemple lorsqu’une version téléchargeable est auto-hébergée ou servie par un fournisseur choisi. Il faut vérifier la licence et toute la chaîne technique.

Faut-il remplacer tous les modèles américains ?

Non. Une stratégie raisonnable consiste souvent à garder un modèle principal, tester une alternative et prévoir un fallback. La diversification doit résoudre un risque réel.

Combien de modèles faut-il évaluer ?

Trois candidats bien testés donnent généralement une décision plus utile qu’une liste de quinze modèles évalués superficiellement.

À quelle fréquence refaire le comparatif ?

Rejouez-le lors d’une nouvelle version majeure, d’un changement tarifaire ou contractuel, ou tous les deux à trois mois pour une application fortement dépendante des LLM.

Sources utilisées