Aller au contenu principal

Apache Spark ML : apprentissage automatique sur de gros volumes de données

Entraîner un modèle sur quelques dizaines de milliers de lignes tient dans scikit-learn et dans la mémoire d'un portable. Passer à cent millions de lignes, distribuées sur un stockage colonne, change de métier : c'est ce cours. On ne remplace pas la statistique par la magie, on apprend à faire tenir les mêmes idées sur une grappe de machines sans se ruiner en temps de calcul.

Durée du cours : 7 h

Ce que vous allez apprendre

  • Décrire l'architecture d'un cluster Spark : pilote, exécuteurs, tâches et partitions, et savoir quand Spark est disproportionné
  • Manipuler l'API DataFrame et Spark SQL, lire l'évaluation paresseuse et le plan d'exécution
  • Lire efficacement du Parquet partitionné plutôt que du CSV massif, avec un schéma explicite
  • Construire une chaîne de traitement Pipeline avec transformateurs et estimateurs, puis la valider par CrossValidator distribué
  • Choisir l'algorithme MLlib adapté et connaître ceux qui manquent
  • Régler les partitions, la mémoire et le brassage pour éviter les échecs d'exécuteurs
  • Sauvegarder un pipeline entraîné, le recharger pour du scoring en aval, et intégrer les résultats dans un flux Parquet ou une table

Prérequis

  • Python (cours 02) : list, dict, fonctions, gestion des imports
  • Apprentissage supervisé (cours 04) : régression, classification, métriques
  • Ingénierie des variables (cours 06) : codage, mise à l'échelle, séparations d'entraînement et de test

Fil rouge

Un jeu public de trafic aérien, plusieurs dizaines de millions de vols en Parquet, la cible est le retard à l'arrivée (retard supérieur à quinze minutes). Chaque module ajoute une brique à la même chaîne : lecture, transformateurs, pipeline, validation croisée, écriture des scores. Le projet final réalise cette chaîne de bout en bout en PySpark local, puis compare le résultat à un échantillon traité en pandas pour mesurer ce que le volume a réellement apporté. Les commandes Databricks et grappe YARN apparaissent en encadré, pour transposer sans surprise.

Modules du cours

  1. Architecture Spark : pilote, exécuteurs, partitions
  2. RDD, DataFrame et Dataset
  3. Transformations, actions et évaluation paresseuse
  4. Lecture de données et formats colonnes
  5. Spark ML : transformateurs et estimateurs
  6. Chaînes de traitement et validation croisée distribuée
  7. Algorithmes disponibles et leurs contraintes
  8. Réglage : partitions, mémoire, brassage des données
  9. Écriture des résultats et intégration en aval
  10. Projet : modèle entraîné sur un gros jeu de données

Évaluation et attestation

Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.

Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.