Pourquoi ce sujet est important
Le prix affiché par image ou par seconde GPU ne suffit pas. Une image générée peut être rejetée, relancée, agrandie et stockée. Un GPU local peut rester inutilisé. Le bon indicateur est le coût d’une image validée et livrée.
Décomposer le coût API
Additionnez génération, éditions, variations, modération, stockage, transfert et appels échoués. Les prix peuvent dépendre de la résolution, de la qualité et du modèle. Mesurez le nombre moyen d’essais avant acceptation.
Décomposer le coût local
Incluez GPU, CPU, mémoire, disque, téléchargement des poids, démarrage, file, orchestration, supervision et ingénierie. Ajoutez capacité de secours et temps d’inactivité. Un GPU à faible taux d’utilisation est souvent plus cher qu’une API.
Mesurer le débit utile
Benchmarkez la configuration exacte : modèle, quantification, résolution, étapes, batch et matériel. Le débit brut ne suffit pas ; ajoutez taux de succès technique et taux d’acceptation humaine. Une configuration rapide mais de faible qualité peut coûter davantage.
Comparer trois architectures
L’API serverless convient au trafic irrégulier. Un endpoint dédié évite le cold start et offre un débit prévisible. L’auto-hébergement apporte contrôle et personnalisation, mais exige une équipe capable de maintenir le service.
Intégrer les licences
Flux Schnell, Flux Dev et les variantes Stable Diffusion peuvent avoir des licences différentes. Le modèle techniquement le moins cher peut être inutilisable commercialement. Vérifiez aussi les modèles dérivés, LoRA et composants téléchargés.
Trouver le seuil de rentabilité
Coût local par image = coût mensuel complet ÷ images acceptées. Comparez-le au coût API moyen. Faites varier volume et utilisation dans trois scénarios : prudent, probable et haut. Ajoutez le coût d’une panne ou d’un délai.
Tableau de décision
| Profil | Option de départ | Raison |
|---|---|---|
| Faible volume irrégulier | API serverless | Aucun coût fixe |
| Volume moyen prévisible | Endpoint dédié | Latence et capacité stables |
| Fort volume stable | Auto-hébergement à benchmarker | Amortissement possible |
| Modèle personnalisé | Dédié ou local | Contrôle des poids |
Exemple concret
Une équipe génère 100 000 visuels par mois, mais seuls 35 % sont conservés et chaque visuel accepté demande 2,2 générations. Elle compare le coût API réel à un GPU dédié utilisé 65 % du temps. Après ajout de l’astreinte et du stockage, l’endpoint dédié reste moins cher jusqu’à un volume supérieur à l’estimation initiale.
Les erreurs fréquentes
- comparer un prix API à un prix GPU sans coût humain
- ignorer les images rejetées et les relances
- benchmarker une résolution différente de la production
- supposer un GPU utilisé à 100 %
- oublier licence et stockage
- choisir le cloud spot sans stratégie de reprise
Checklist de mise en production
- [ ] Résolution et qualité cibles définies
- [ ] Taux d’acceptation mesuré
- [ ] Débit benchmarké sur matériel cible
- [ ] Coût humain et disponibilité inclus
- [ ] Licences vérifiées
- [ ] Scénarios de volume calculés
- [ ] Stockage et suppression chiffrés
FAQ
Quand le local devient-il moins cher ?
Lorsque volume et utilisation sont assez élevés. Calculez avec vos benchmarks et le taux d’acceptation réel.
Faut-il acheter un GPU ?
Pas au début. Louer un endpoint permet de valider débit et qualité avant un investissement.
Le batch réduit-il le coût ?
Souvent, car il améliore l’utilisation GPU, mais peut augmenter latence et mémoire.
Comment comparer la qualité ?
Utilisez le même brief, une grille de notation et plusieurs évaluateurs, puis calculez le coût par image acceptée.