📄️ Apache Spark ML
Entraîner des modèles sur des dizaines de millions de lignes avec Spark et MLlib : architecture distribuée, DataFrame, pipelines et réglage. Durée : 7 h, examen de 40 questions et attestation vérifiable.
📄️ 1. Architecture Spark
Module 1 du cours premium Apache Spark ML : les rôles du pilote et des exécuteurs, la découpe des données en partitions, et savoir quand Spark est en fait disproportionné pour la tâche.
📄️ 2. RDD, DataFrame, Dataset
Module 2 du cours premium Apache Spark ML : les trois API historiques, l'optimiseur Catalyst, et pourquoi le DataFrame et Spark SQL sont aujourd'hui le point d'entrée par défaut.
📄️ 3. Transformations et actions
Module 3 du cours premium Apache Spark ML : transformations étroites et larges, actions qui déclenchent l'exécution, brassage de données, cache et persist, lecture du plan d'exécution.
📄️ 4. Lecture et formats colonnes
Module 4 du cours premium Apache Spark ML : CSV contre Parquet, schéma explicite, partitionnement par colonne, élagage de partitions, lecture du jeu de vols retardés.
📄️ 5. Transformateurs et estimateurs
Module 5 du cours premium Apache Spark ML : Transformer, Estimator, VectorAssembler, StringIndexer, OneHotEncoder, StandardScaler et la colonne de vecteurs qui alimente les algorithmes.
📄️ 6. Pipelines et validation croisée
Module 6 du cours premium Apache Spark ML : Pipeline, CrossValidator, ParamGridBuilder, coût d'une grille et fuite de données quand le prétraitement sort du pipeline.
📄️ 7. Algorithmes disponibles
Module 7 du cours premium Apache Spark ML : régression, arbres et forêts, gradient boosting, k-moyennes, ALS ; ce qui manque et les alternatives XGBoost distribué ou entraînement local.
📄️ 8. Réglage et brassage
Module 8 du cours premium Apache Spark ML : choisir le nombre de partitions, arbitrer entre repartition et coalesce, gérer l'asymétrie des clés, régler la mémoire des exécuteurs et lire l'interface Spark.
📄️ 9. Écriture et intégration
Module 9 du cours premium Apache Spark ML : écriture Parquet partitionnée, modes d'écriture, sauvegarde du pipeline entraîné, rechargement pour le scoring et planification de production.
📄️ 10. Projet complet
Module 10 du cours premium Apache Spark ML : la chaîne complète sur les vols retardés, comparaison avec un échantillon en pandas, temps et coût, et ce que le volume a réellement apporté.
📄️ Récapitulation et examen
Synthèse complète du cours premium Apache Spark ML : architecture, DataFrame, transformations, lecture, pipelines, algorithmes, réglage, écriture et projet, puis l'examen de 40 questions.