Guide

Statut éditorial : En attente de relecture

Quantification GGUF, GPTQ ou AWQ : qualité, vitesse et compatibilité

Choisir un format de quantification selon moteur, matériel, mémoire et charge plutôt que par la seule taille du fichier.

Classification du contenu

Types

  • Modèles et API
Niveau
Avancé
Publié le
24 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
24 novembre 2026

La quantification représente les poids avec moins de précision pour réduire mémoire et parfois accélérer l’inférence. GGUF, GPTQ et AWQ ne sont pas trois niveaux directement ordonnés : ils correspondent à des formats, méthodes et écosystèmes différents. Le moteur cible doit être choisi avant le fichier.

GGUF : écosystème llama.cpp

GGUF est couramment utilisé avec llama.cpp, Ollama et des moteurs compatibles, sur CPU, GPU ou exécution hybride. De nombreux niveaux de quantification offrent un compromis fin. Il est pratique pour le local et la distribution d’un fichier autonome, mais les performances dépendent fortement du backend et du matériel.

GPTQ : quantification post-entraînement orientée GPU

GPTQ utilise un jeu de calibration pour approximer les poids avec une faible précision. Il existe plusieurs backends et variantes ; vérifiez format exact, architecture et kernels pris en charge. Les réglages de bits, groupe et ordre d’activation influencent qualité et vitesse.

AWQ : préserver les poids sensibles aux activations

AWQ conserve davantage de précision pour une petite partie des poids jugés importants selon les activations, souvent avec une représentation 4 bits. Il vise une faible dégradation et une inférence GPU efficace, sous réserve de kernels et architectures compatibles. Certaines bibliothèques ont des contraintes de versions qu’il faut épingler.

Benchmark utile

Comparez le même modèle et la même tâche sur le matériel final. Mesurez mémoire, premier token, tokens par seconde, concurrence et qualité métier. Incluez longs contextes et sorties structurées. La plus petite quantification peut devenir plus lente si le moteur doit convertir ou si les kernels ne sont pas optimisés.

FAQ

Quel format choisir pour Ollama ?

GGUF est généralement le choix naturel de son écosystème.

GPTQ est-il toujours plus rapide qu’AWQ ?

Non. Backend, GPU, modèle et paramètres déterminent le résultat.

Peut-on convertir sans perte supplémentaire ?

Requantifier un modèle déjà quantifié peut cumuler les erreurs ; repartez idéalement des poids de meilleure précision.

Sources utilisées