Le meilleur modèle local n’est pas forcément le plus grand. Le bon choix respecte vos contraintes de mémoire et de latence tout en atteignant un niveau de qualité mesuré sur votre tâche.
Partir du cas d’usage
Définissez d’abord ce que le modèle doit produire : conversation générale, extraction structurée, résumé, code, RAG ou appels d’outils. Préparez dix à cinquante exemples représentatifs avec des critères simples : exactitude, format, temps de réponse et taux d’échec.
Estimer la mémoire
La taille des poids dépend du nombre de paramètres et de la quantification. Une quantification 4 bits réduit fortement la mémoire par rapport au format 16 bits, au prix d’une perte de précision variable. Ajoutez la mémoire du cache de contexte et les autres allocations du moteur : la taille du fichier n’est donc pas toute la mémoire requise.
Gardez une marge. Un modèle qui tient tout juste en mémoire peut provoquer des échanges disque, un partage CPU/GPU défavorable ou des erreurs lors d’un contexte long.
Comprendre la quantification
Les variantes de modèles utilisent souvent des tags indiquant une quantification. Les formats plus compacts sont utiles sur les machines limitées ; les formats moins compressés privilégient la fidélité. L’effet dépend du modèle et de la tâche : comparez au moins deux variantes sur votre jeu d’évaluation.
Dimensionner le contexte
Une grande fenêtre de contexte consomme davantage de mémoire et ralentit souvent le traitement initial. N’utilisez pas 64 000 tokens si vos requêtes en nécessitent 4 000. Pour le RAG, améliorer la sélection des passages est généralement préférable à envoyer tous les documents.
Vérifier les capacités
Contrôlez explicitement la prise en charge de la vision, des outils, des sorties structurées et de la langue française. Un score général ne garantit pas qu’un petit modèle respecte votre schéma JSON ou vos consignes métier.
Procédure de décision
- Fixez un budget maximal de RAM ou VRAM.
- Sélectionnez deux familles de modèles adaptées à la tâche.
- Testez une quantification compacte et une variante plus précise.
- Mesurez qualité, temps jusqu’au premier token et débit.
- Répétez avec votre longueur de contexte réelle.
- Conservez le plus petit modèle qui atteint vos seuils.
Documentez le nom complet et le tag du modèle. Un nom sans tag rend les tests difficiles à reproduire lorsque la variante par défaut évolue.
Le choix final est un compromis mesuré, pas un classement universel. Réévaluez-le lorsque le jeu de données, le matériel ou le catalogue de modèles change.