Le prix horaire le plus bas ne produit pas forcément le coût final le plus faible. Une instance spot interrompue peut perdre une heure d’entraînement, tandis qu’une réservation sous-utilisée immobilise un budget. Le choix dépend de la tolérance aux interruptions, de la prévisibilité et du taux d’utilisation.
Spot : économique mais interruptible
Le spot convient aux tâches reprenables : entraînement avec checkpoints fréquents, génération batch, évaluation ou traitement de files. L’application doit détecter la préemption, sauvegarder l’état et relancer ailleurs. Incluez temps perdu, stockage des checkpoints et indisponibilité possible du type de GPU.
À la demande : flexibilité
Le paiement à l’usage est adapté aux prototypes, pics, tests et charges imprévisibles. Il évite l’engagement, mais le tarif est plus élevé et la capacité n’est pas toujours garantie. Automatisez extinction et budgets : un notebook oublié peut annuler l’économie réalisée ailleurs.
Réservé ou engagé : stabilité
Un engagement devient pertinent pour une inférence continue ou un entraînement planifié avec forte utilisation. Vérifiez durée, flexibilité de région ou de famille GPU et conditions de capacité. Calculez le seuil d’utilisation auquel la réservation bat réellement l’on-demand.
Stratégie hybride
Réservez une base pour le trafic stable, utilisez l’on-demand pour les pics et le spot pour les lots tolérants. Séparez stockage et calcul afin de reprendre rapidement. Mesurez coût par million de tokens, exemple entraîné ou tâche terminée, plutôt que le seul coût horaire.
FAQ
Le spot convient-il à l’inférence temps réel ?
Rarement seul. Il peut compléter une capacité stable si le routage absorbe les interruptions.
Une réservation garantit-elle toujours le GPU ?
Les produits diffèrent ; distinguez remise d’engagement et réservation effective de capacité.
Quel checkpointing choisir ?
Une fréquence dont le coût d’écriture reste inférieur au travail moyen perdu lors d’une interruption.