Apache Spark ML : apprentissage automatique sur de gros volumes de données
Entraîner un modèle sur quelques dizaines de milliers de lignes tient dans
scikit-learn et dans la mémoire d'un portable. Passer à cent millions de
lignes, distribuées sur un stockage colonne, change de métier : c'est ce
cours. On ne remplace pas la statistique par la magie, on apprend à faire
tenir les mêmes idées sur une grappe de machines sans se ruiner en temps
de calcul.
Durée du cours : 7 h
Ce que vous allez apprendre
- Décrire l'architecture d'un cluster Spark : pilote, exécuteurs, tâches et partitions, et savoir quand Spark est disproportionné
- Manipuler l'API DataFrame et Spark SQL, lire l'évaluation paresseuse et le plan d'exécution
- Lire efficacement du Parquet partitionné plutôt que du CSV massif, avec un schéma explicite
- Construire une chaîne de traitement
Pipelineavec transformateurs et estimateurs, puis la valider parCrossValidatordistribué - Choisir l'algorithme MLlib adapté et connaître ceux qui manquent
- Régler les partitions, la mémoire et le brassage pour éviter les échecs d'exécuteurs
- Sauvegarder un pipeline entraîné, le recharger pour du scoring en aval, et intégrer les résultats dans un flux Parquet ou une table
Prérequis
- Python (cours 02) :
list,dict, fonctions, gestion des imports - Apprentissage supervisé (cours 04) : régression, classification, métriques
- Ingénierie des variables (cours 06) : codage, mise à l'échelle, séparations d'entraînement et de test
Fil rouge
Un jeu public de trafic aérien, plusieurs dizaines de millions de vols en
Parquet, la cible est le retard à l'arrivée (retard supérieur à quinze
minutes). Chaque module ajoute une brique à la même chaîne : lecture,
transformateurs, pipeline, validation croisée, écriture des scores. Le
projet final réalise cette chaîne de bout en bout en PySpark local, puis
compare le résultat à un échantillon traité en pandas pour mesurer ce
que le volume a réellement apporté. Les commandes Databricks et grappe
YARN apparaissent en encadré, pour transposer sans surprise.
Modules du cours
- Architecture Spark : pilote, exécuteurs, partitions
- RDD, DataFrame et Dataset
- Transformations, actions et évaluation paresseuse
- Lecture de données et formats colonnes
- Spark ML : transformateurs et estimateurs
- Chaînes de traitement et validation croisée distribuée
- Algorithmes disponibles et leurs contraintes
- Réglage : partitions, mémoire, brassage des données
- Écriture des résultats et intégration en aval
- Projet : modèle entraîné sur un gros jeu de données
Évaluation et attestation
Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.
Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.