Aller au contenu principal

Leçon 1 — Ce que vous louez

Quatre niveaux d'abstraction

L'expression « faire de l'IA dans le cloud » recouvre quatre choses très différentes, avec des coûts et des degrés de contrôle qui n'ont rien de comparable. Situer votre besoin sur cette échelle est la première décision, et elle détermine tout le reste.

Niveau 1 — la machine brute. Vous louez une machine virtuelle équipée d'un ou plusieurs GPU, vous installez ce que vous voulez, vous payez à la seconde. Contrôle maximal, et tout est à votre charge : pilotes, environnement, orchestration, surveillance, arrêt de la machine.

Niveau 2 — le service managé. La plateforme prend en charge l'orchestration : vous décrivez un travail d'entraînement, elle provisionne les machines, exécute, enregistre les résultats et éteint tout à la fin. Ce dernier point vaut à lui seul le surcoût, comme nous le verrons en leçon 3.

Niveau 3 — le modèle pré-entraîné. Vous partez d'un modèle fourni par la plateforme et vous l'affinez sur vos données. C'est du transfer learning outillé.

Niveau 4 — l'API de modèle. Vous appelez un modèle hébergé, vous payez à l'usage. Aucune infrastructure, aucun contrôle sur le modèle, et une dépendance directe à ses évolutions.

La règle utile : montez au niveau le plus élevé qui répond à votre besoin. Chaque descente d'un niveau vous donne du contrôle et vous coûte du temps d'ingénierie. Beaucoup d'équipes travaillent au niveau 1 alors que le niveau 2 aurait suffi, et paient ce choix en incidents et en machines oubliées.


Ce qu'un GPU coûte réellement

Les tarifs évoluent, et les ordres de grandeur restent stables et suffisent pour dimensionner un projet. Voici la structure des prix telle qu'elle se présente en 2026, en tarification à la demande.

Type de machineUsage typiqueOrdre de prix à l'heure
Processeur seul, quelques cœursdonnées tabulaires, préparationquelques centimes
GPU d'entrée de gammeapprentissage, petits modèles, inférence0,5 à 1 €
GPU milieu de gammeaffinage sérieux, vision1 à 4 €
GPU haut de gamme récentgrands modèles, entraînement lourd4 à 15 €
Nœud multi-GPUpré-entraînement, très gros modèles20 à 100 €

Ce que ces chiffres impliquent concrètement :

Un affinage par transfer learning occupe typiquement un GPU milieu de gamme pendant une à quatre heures. Coût : quelques euros. C'est le cas d'usage le plus fréquent, et il est presque gratuit.

Un entraînement complet d'un modèle de vision de taille moyenne depuis zéro peut demander plusieurs jours sur plusieurs GPU. Coût : quelques milliers d'euros. C'est déjà une décision budgétaire.

Un pré-entraînement de grand modèle de langage demande des milliers de GPU pendant des semaines. Coût : dizaines de millions. C'est hors de portée, et c'est précisément pourquoi le transfer learning est la seule voie praticable pour presque tout le monde.

La conclusion pratique la plus importante

Le coût de calcul n'est presque jamais le problème d'un projet réel. Ce qui coûte, c'est l'annotation des données — des semaines de travail d'experts métier — et l'intégration dans les systèmes existants. Quand une facture cloud devient un sujet, c'est presque toujours à cause de machines mal gérées, pas à cause du calcul utile.


Entraînement et inférence : deux profils opposés

Cette distinction structure toutes les décisions d'architecture, et elle est souvent confondue.

L'entraînement est intermittent et intensif. Il occupe beaucoup de calcul pendant quelques heures, puis rien pendant des jours. Il tolère l'interruption si l'on sauvegarde régulièrement l'état. Il n'a aucune contrainte de latence.

L'inférence est continue et légère par requête. Chaque prédiction coûte peu, et le volume fait le total. Elle doit répondre vite, et rester disponible.

EntraînementInférence
Profil de chargepics rares et intensescontinu ou par vagues
Tolérance à l'interruptionbonne, avec sauvegardesnulle en service en ligne
Contrainte de latenceaucuneforte
Type de machineGPU puissant, temporairesouvent processeur suffit
Levier d'économie principalinstances spotmise à l'échelle et arrêt automatique

La conséquence la plus utile : l'entraînement se prête parfaitement aux instances spot, ces machines à prix réduit que le fournisseur peut reprendre. Un entraînement qui sauvegarde son état toutes les dix minutes reprend là où il s'était arrêté, et vous économisez 60 à 90 %. C'est le levier le plus rentable du domaine et il est très sous-utilisé.

Et une observation qui surprend : pour beaucoup de modèles, l'inférence n'a pas besoin de GPU. Un modèle de classification tabulaire ou un petit modèle de vision quantifié répond en quelques dizaines de millisecondes sur un processeur central ordinaire. Provisionner un GPU pour de l'inférence à faible volume est l'un des gaspillages les plus courants.


Ce que vous payez en plus du calcul

Trois postes s'ajoutent, et le troisième est celui qui surprend.

Le stockage. Quelques centimes par gigaoctet et par mois, avec des paliers moins chers pour les données rarement lues. C'est généralement négligeable, sauf si vous accumulez des données intermédiaires que personne ne nettoie — ce qui arrive systématiquement.

Les services annexes : base de données managée, orchestrateur, journalisation, surveillance. Chacun est modeste, et leur cumul représente souvent 20 à 30 % de la facture.

Les frais de sortie de données. C'est le poste qui surprend le plus. Faire entrer des données dans le cloud est généralement gratuit ; les faire sortir est facturé au gigaoctet. Sur des volumes importants — jeux d'images, exports réguliers, réplication vers un autre fournisseur —, cela devient significatif.

Ces frais sont aussi un mécanisme économique de rétention, et nous y reviendrons en leçon 5. La réglementation européenne récente sur les données a commencé à les encadrer, et plusieurs fournisseurs les ont réduits ou supprimés pour les transferts de sortie liés à un changement de fournisseur.


Comment choisir votre niveau

Quatre questions, et la réponse tombe.

Est-ce que vous apprenez ou explorez ? Utilisez Colab ou Kaggle. C'est gratuit, immédiat, et suffisant pour tout ce parcours.

Avez-vous besoin d'un entraînement reproductible et tracé ? Passez au niveau 2, service managé. Vous y gagnez l'extinction automatique des machines, le suivi des exécutions et le registre de modèles. Le surcoût par heure est largement compensé par ce que vous n'oublierez plus d'éteindre.

Avez-vous une contrainte très spécifique ? Une bibliothèque exotique, un pilote particulier, une optimisation de bas niveau : niveau 1, machine brute. Assumez alors l'exploitation, et mettez en place l'arrêt automatique dès le premier jour.

Votre besoin est-il générique ? Traduction, transcription, extraction de texte, génération : niveau 4, appelez une API. Entraîner un modèle pour ce qui existe déjà en service est presque toujours une perte de temps, sauf contrainte de confidentialité.


À retenir

  • Quatre niveaux : machine brute, service managé, modèle pré-entraîné, API. Montez au plus élevé qui suffit.
  • Un GPU coûte de 0,5 à 15 € l'heure selon la gamme ; un affinage par transfer learning coûte quelques euros.
  • Le coût de calcul n'est presque jamais le problème : l'annotation et l'intégration dominent.
  • Entraînement intermittent et interruptible, inférence continue et sensible à la latence : deux profils opposés.
  • Les instances spot sont le levier le plus rentable pour l'entraînement, et le plus sous-utilisé.
  • Beaucoup d'inférences n'ont pas besoin de GPU : le provisionner est un gaspillage fréquent.
  • Trois postes s'ajoutent au calcul : stockage, services annexes, et surtout frais de sortie de données.

Leçon suivanteLes plateformes : SageMaker, Vertex AI, Azure ML →