Un benchmark réduit une capacité à un protocole reproductible. Il facilite la comparaison, mais son score dépend de la version du dataset, du prompt, du nombre d’essais, des outils et des règles de notation. Il ne remplace pas un test sur votre produit.
MMLU
MMLU regroupe des questions à choix multiple dans de nombreuses disciplines. Il mesure surtout connaissances et résolution de questions dans ce format. Une moyenne masque les domaines faibles ; examinez les sous-catégories et le protocole few-shot ou zero-shot. Les variantes modernes ne doivent pas être confondues avec le dataset initial.
HumanEval
HumanEval évalue la génération de petites fonctions Python via des tests. La métrique pass@k indique la probabilité qu’au moins une proposition parmi k réussisse. Un pass@10 n’est pas comparable à un pass@1 et ne mesure ni maintenance d’un dépôt, ni sécurité, ni architecture.
GPQA
GPQA contient des questions scientifiques difficiles conçues pour demander une expertise approfondie. Il teste raisonnement et connaissances dans un contexte académique, souvent sous forme de questions fermées. Il ne mesure pas directement l’aptitude à citer des sources ou résoudre un processus métier.
Limites communes
Les résultats peuvent être contaminés par présence dans les données d’entraînement, optimisés pour le classement ou sensibles au prompt. Vérifiez source primaire, date, modèle exact, outils autorisés et coût de calcul. Méfiez-vous d’une différence inférieure à la variabilité du protocole.
Construire votre benchmark
Assemblez tâches réelles, cas limites et critères métier. Mesurez réussite, coût, latence, sécurité et taux d’abstention. Gardez un test final privé et actualisez-le avec les incidents. Utilisez les benchmarks publics pour présélectionner, puis votre évaluation pour décider.
FAQ
Le score le plus élevé indique-t-il le meilleur modèle ?
Seulement pour ce protocole précis.
Peut-on comparer deux tableaux différents ?
Pas sans vérifier version, prompt, outils et métrique.
Un benchmark privé évite-t-il toute contamination ?
Il la réduit, à condition que les cas ne soient pas réutilisés pendant l’optimisation.