Guide

Statut éditorial : En attente de relecture

Choisir un modèle local : taille, quantification et usage

Sélectionner un modèle local selon la tâche, la mémoire disponible, la qualité, le contexte et le débit attendu.

Classification du contenu

Types

  • Modèles et API
  • Pratiques

Technologies

Niveau
Intermédiaire
Publié le
10 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
10 novembre 2026

Le plus grand modèle compatible avec une machine n’est pas toujours le meilleur produit. Il peut démarrer mais saturer la mémoire dès que le contexte et plusieurs utilisateurs ajoutent leur cache KV. La sélection doit combiner qualité sur votre tâche, mémoire réelle, latence, débit et licence.

Partir du cas d’usage

Séparez extraction, rédaction, code, classification, conversation et appel d’outils. Créez des exemples avec langues, longueurs et formats réels. Un petit modèle spécialisé peut battre un modèle plus grand sur une sortie structurée simple, tandis qu’une tâche de raisonnement complexe exige davantage de capacité.

Comprendre taille et mémoire

Le nombre de paramètres donne un ordre de grandeur des poids, mais la précision numérique change leur empreinte. Ajoutez le moteur, les buffers et surtout le cache KV, qui augmente avec contexte, couches, concurrence et longueur de sortie. Gardez une marge : un système constamment au bord de la mémoire devient instable.

Quantification : un compromis mesurable

Réduire la précision diminue mémoire et peut accélérer l’inférence, au prix d’une perte variable de qualité. GGUF, GPTQ ou AWQ ciblent des moteurs et scénarios différents. Ne comparez pas seulement la taille du fichier : testez perplexité ou, mieux, réussite sur vos tâches, latence et débit sur le matériel cible.

Décision en quatre étapes

  1. Éliminer les licences incompatibles.
  2. Tester quelques tailles sur un dataset métier.
  3. Mesurer mémoire avec contexte et concurrence réalistes.
  4. Choisir la plus petite configuration qui respecte le seuil de qualité.

Conservez modèle, révision, tokenizer, quantification et paramètres dans un manifeste reproductible.

FAQ

Plus de paramètres signifie-t-il toujours meilleure qualité ?

Non. Données d’entraînement, architecture et adaptation à la tâche comptent aussi.

Peut-on utiliser toute la RAM ou VRAM annoncée ?

Non. Le système, le moteur et le cache ont besoin d’une marge.

Quelle longueur de contexte choisir ?

La longueur nécessaire au produit, validée en qualité et mémoire, pas le maximum marketing.

Sources utilisées