Guide

Statut éditorial : En attente de relecture

Benchmarks LLM : MMLU, HumanEval et GPQA — ce qu’ils mesurent vraiment

Lire les scores de benchmarks sans confondre performance académique, contamination et réussite produit.

Classification du contenu

Types

  • Modèles et API
Niveau
Intermédiaire
Publié le
24 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
24 octobre 2026

Un benchmark réduit une capacité à un protocole reproductible. Il facilite la comparaison, mais son score dépend de la version du dataset, du prompt, du nombre d’essais, des outils et des règles de notation. Il ne remplace pas un test sur votre produit.

MMLU

MMLU regroupe des questions à choix multiple dans de nombreuses disciplines. Il mesure surtout connaissances et résolution de questions dans ce format. Une moyenne masque les domaines faibles ; examinez les sous-catégories et le protocole few-shot ou zero-shot. Les variantes modernes ne doivent pas être confondues avec le dataset initial.

HumanEval

HumanEval évalue la génération de petites fonctions Python via des tests. La métrique pass@k indique la probabilité qu’au moins une proposition parmi k réussisse. Un pass@10 n’est pas comparable à un pass@1 et ne mesure ni maintenance d’un dépôt, ni sécurité, ni architecture.

GPQA

GPQA contient des questions scientifiques difficiles conçues pour demander une expertise approfondie. Il teste raisonnement et connaissances dans un contexte académique, souvent sous forme de questions fermées. Il ne mesure pas directement l’aptitude à citer des sources ou résoudre un processus métier.

Limites communes

Les résultats peuvent être contaminés par présence dans les données d’entraînement, optimisés pour le classement ou sensibles au prompt. Vérifiez source primaire, date, modèle exact, outils autorisés et coût de calcul. Méfiez-vous d’une différence inférieure à la variabilité du protocole.

Construire votre benchmark

Assemblez tâches réelles, cas limites et critères métier. Mesurez réussite, coût, latence, sécurité et taux d’abstention. Gardez un test final privé et actualisez-le avec les incidents. Utilisez les benchmarks publics pour présélectionner, puis votre évaluation pour décider.

FAQ

Le score le plus élevé indique-t-il le meilleur modèle ?

Seulement pour ce protocole précis.

Peut-on comparer deux tableaux différents ?

Pas sans vérifier version, prompt, outils et métrique.

Un benchmark privé évite-t-il toute contamination ?

Il la réduit, à condition que les cas ne soient pas réutilisés pendant l’optimisation.

Sources utilisées