Une application LLM peut répondre avec succès au niveau HTTP tout en citant une mauvaise source, répétant un outil ou dépassant son budget. L’observabilité doit donc relier infrastructure, exécution agentique et qualité produit. Une trace explique ce qui s’est passé ; une évaluation juge si le résultat était acceptable.
Structurer les traces
Créez une trace par interaction et des spans pour modèle, retriever, reranker, outil et étape de workflow. Ajoutez modèle, version de prompt, environnement, durée, tokens, cache et raison d’arrêt. Utilisez un identifiant de corrélation commun avec les logs applicatifs. N’enregistrez pas par défaut le prompt complet ni les documents récupérés.
Mesurer ce qui aide à décider
Suivez temps jusqu’au premier token, latence totale, taux d’erreur, débit, tokens et coût par fonctionnalité. Pour les agents, ajoutez nombre d’étapes, outils répétés, refus et validations humaines. Pour le RAG, observez passages récupérés et citations. Les percentiles révèlent les utilisateurs lents que la moyenne masque.
Ajouter la qualité
Construisez un dataset hors ligne avant chaque version importante. En production, échantillonnez des interactions pour des règles, une revue humaine ou un juge LLM calibré. Reliez les échecs aux traces, puis ajoutez-les au dataset. Séparez baisse de retrieval, génération non fidèle et erreur d’outil pour corriger la bonne couche.
Confidentialité et coût
Masquez secrets et données personnelles avant export. Définissez rétention, accès, régions et échantillonnage. Les traces volumineuses et évaluations en ligne ont leur propre coût. Utiliser OpenTelemetry facilite l’intégration à une plateforme existante, mais exige des conventions stables pour les noms et attributs.
FAQ
Suffit-il de suivre tokens et latence ?
Non. Ils n’indiquent ni vérité, ni pertinence, ni succès métier.
Faut-il tout tracer ?
Non. Tracez les étapes nécessaires, échantillonnez le volume et minimisez les contenus sensibles.
Quelle première alerte ?
Commencez par erreurs, latence haute, explosion du nombre d’étapes et coût par requête.