La quantification représente les poids avec moins de précision pour réduire mémoire et parfois accélérer l’inférence. GGUF, GPTQ et AWQ ne sont pas trois niveaux directement ordonnés : ils correspondent à des formats, méthodes et écosystèmes différents. Le moteur cible doit être choisi avant le fichier.
GGUF : écosystème llama.cpp
GGUF est couramment utilisé avec llama.cpp, Ollama et des moteurs compatibles, sur CPU, GPU ou exécution hybride. De nombreux niveaux de quantification offrent un compromis fin. Il est pratique pour le local et la distribution d’un fichier autonome, mais les performances dépendent fortement du backend et du matériel.
GPTQ : quantification post-entraînement orientée GPU
GPTQ utilise un jeu de calibration pour approximer les poids avec une faible précision. Il existe plusieurs backends et variantes ; vérifiez format exact, architecture et kernels pris en charge. Les réglages de bits, groupe et ordre d’activation influencent qualité et vitesse.
AWQ : préserver les poids sensibles aux activations
AWQ conserve davantage de précision pour une petite partie des poids jugés importants selon les activations, souvent avec une représentation 4 bits. Il vise une faible dégradation et une inférence GPU efficace, sous réserve de kernels et architectures compatibles. Certaines bibliothèques ont des contraintes de versions qu’il faut épingler.
Benchmark utile
Comparez le même modèle et la même tâche sur le matériel final. Mesurez mémoire, premier token, tokens par seconde, concurrence et qualité métier. Incluez longs contextes et sorties structurées. La plus petite quantification peut devenir plus lente si le moteur doit convertir ou si les kernels ne sont pas optimisés.
FAQ
Quel format choisir pour Ollama ?
GGUF est généralement le choix naturel de son écosystème.
GPTQ est-il toujours plus rapide qu’AWQ ?
Non. Backend, GPU, modèle et paramètres déterminent le résultat.
Peut-on convertir sans perte supplémentaire ?
Requantifier un modèle déjà quantifié peut cumuler les erreurs ; repartez idéalement des poids de meilleure précision.