Un prompt n’est pas « meilleur » parce que trois exemples semblent convaincants. Il doit améliorer une métrique définie sur des cas représentatifs, sans dégrader sécurité, coût ou latence. L’évaluation transforme les ajustements intuitifs en expérience reproductible.
Définir le succès
Pour une extraction, mesurez validité du schéma et exactitude des champs. Pour un RAG, mesurez fidélité et citations. Pour une rédaction, établissez une grille de ton, exhaustivité et contraintes. Ajoutez taux de refus correct, longueur, tokens et temps. Une seule note globale masque souvent le compromis important.
Construire le dataset
Collectez cas fréquents, limites, ambigus, hostiles et sans réponse. Conservez un test final non utilisé pendant les ajustements. Segmentez par langue, longueur et catégorie métier afin de voir où le gain se produit. Nettoyez les données de production avant de les réutiliser.
Mélanger évaluateurs
Utilisez règles déterministes pour formats, nombres et mots interdits. Ajoutez revue humaine en aveugle pour le subjectif. Un juge LLM permet l’échelle, mais calibrez-le contre des annotations humaines, versionnez son prompt et contrôlez biais de position ou préférence de style.
Comparer proprement
Gardez modèle, paramètres et données identiques, puis changez seulement le prompt. Répétez si le modèle est variable et rapportez distribution ou taux de victoire. Examinez les cas qui régressent, pas seulement la moyenne. Déployez progressivement et alimentez le dataset avec les incidents.
FAQ
Combien d’exemples faut-il ?
Quelques dizaines bien réparties permettent de commencer ; la couverture des risques compte plus que le volume brut.
Peut-on optimiser uniquement avec un juge LLM ?
Non sans calibration humaine, surtout pour les enjeux métier ou de sécurité.
Quelle est la meilleure métrique ?
Une combinaison liée au résultat métier, complétée par coût, latence et garde-fous.