Guide

Statut éditorial : En attente de relecture

Évaluer la qualité d’un prompt : métriques et méthodes

Construire une évaluation reproductible des prompts qui combine règles, exemples métier, revue humaine et coûts.

Classification du contenu

Types

  • Observabilité et évaluation
Niveau
Avancé
Publié le
23 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
23 novembre 2026

Un prompt n’est pas « meilleur » parce que trois exemples semblent convaincants. Il doit améliorer une métrique définie sur des cas représentatifs, sans dégrader sécurité, coût ou latence. L’évaluation transforme les ajustements intuitifs en expérience reproductible.

Définir le succès

Pour une extraction, mesurez validité du schéma et exactitude des champs. Pour un RAG, mesurez fidélité et citations. Pour une rédaction, établissez une grille de ton, exhaustivité et contraintes. Ajoutez taux de refus correct, longueur, tokens et temps. Une seule note globale masque souvent le compromis important.

Construire le dataset

Collectez cas fréquents, limites, ambigus, hostiles et sans réponse. Conservez un test final non utilisé pendant les ajustements. Segmentez par langue, longueur et catégorie métier afin de voir où le gain se produit. Nettoyez les données de production avant de les réutiliser.

Mélanger évaluateurs

Utilisez règles déterministes pour formats, nombres et mots interdits. Ajoutez revue humaine en aveugle pour le subjectif. Un juge LLM permet l’échelle, mais calibrez-le contre des annotations humaines, versionnez son prompt et contrôlez biais de position ou préférence de style.

Comparer proprement

Gardez modèle, paramètres et données identiques, puis changez seulement le prompt. Répétez si le modèle est variable et rapportez distribution ou taux de victoire. Examinez les cas qui régressent, pas seulement la moyenne. Déployez progressivement et alimentez le dataset avec les incidents.

FAQ

Combien d’exemples faut-il ?

Quelques dizaines bien réparties permettent de commencer ; la couverture des risques compte plus que le volume brut.

Peut-on optimiser uniquement avec un juge LLM ?

Non sans calibration humaine, surtout pour les enjeux métier ou de sécurité.

Quelle est la meilleure métrique ?

Une combinaison liée au résultat métier, complétée par coût, latence et garde-fous.

Sources utilisées