Guide

Statut éditorial : En attente de relecture

Observabilité LLM : traces, coûts et qualité en production

Définir une observabilité utile pour suivre parcours, outils, tokens, latence et qualité sans exposer les données sensibles.

Classification du contenu

Types

  • Observabilité et évaluation
Niveau
Intermédiaire
Publié le
24 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
24 novembre 2026

Une application LLM peut répondre avec succès au niveau HTTP tout en citant une mauvaise source, répétant un outil ou dépassant son budget. L’observabilité doit donc relier infrastructure, exécution agentique et qualité produit. Une trace explique ce qui s’est passé ; une évaluation juge si le résultat était acceptable.

Structurer les traces

Créez une trace par interaction et des spans pour modèle, retriever, reranker, outil et étape de workflow. Ajoutez modèle, version de prompt, environnement, durée, tokens, cache et raison d’arrêt. Utilisez un identifiant de corrélation commun avec les logs applicatifs. N’enregistrez pas par défaut le prompt complet ni les documents récupérés.

Mesurer ce qui aide à décider

Suivez temps jusqu’au premier token, latence totale, taux d’erreur, débit, tokens et coût par fonctionnalité. Pour les agents, ajoutez nombre d’étapes, outils répétés, refus et validations humaines. Pour le RAG, observez passages récupérés et citations. Les percentiles révèlent les utilisateurs lents que la moyenne masque.

Ajouter la qualité

Construisez un dataset hors ligne avant chaque version importante. En production, échantillonnez des interactions pour des règles, une revue humaine ou un juge LLM calibré. Reliez les échecs aux traces, puis ajoutez-les au dataset. Séparez baisse de retrieval, génération non fidèle et erreur d’outil pour corriger la bonne couche.

Confidentialité et coût

Masquez secrets et données personnelles avant export. Définissez rétention, accès, régions et échantillonnage. Les traces volumineuses et évaluations en ligne ont leur propre coût. Utiliser OpenTelemetry facilite l’intégration à une plateforme existante, mais exige des conventions stables pour les noms et attributs.

FAQ

Suffit-il de suivre tokens et latence ?

Non. Ils n’indiquent ni vérité, ni pertinence, ni succès métier.

Faut-il tout tracer ?

Non. Tracez les étapes nécessaires, échantillonnez le volume et minimisez les contenus sensibles.

Quelle première alerte ?

Commencez par erreurs, latence haute, explosion du nombre d’étapes et coût par requête.

Sources utilisées