Aller au contenu principal

Apache Spark ML

Apprentissage automatique distribué avec Spark, pour les volumes qui ne tiennent pas sur une machine.

Durée du cours : 7h

Ce que vous allez apprendre

  • Reconnaître à partir de quel volume la distribution devient utile
  • Manipuler des DataFrames Spark et comprendre l'évaluation paresseuse
  • Construire une chaîne de traitement Spark ML
  • Entraîner un modèle sur des données partitionnées
  • Repérer les déséquilibres de partitions qui ruinent la performance

Prérequis

  • Python et SQL
  • Notions d'apprentissage supervisé

Modules du cours

  1. Architecture Spark : pilote, exécuteurs, partitions
  2. RDD, DataFrame et Dataset
  3. Transformations, actions et évaluation paresseuse
  4. Lecture de données et formats colonnes
  5. Spark ML : transformateurs et estimateurs
  6. Chaînes de traitement et validation croisée distribuée
  7. Algorithmes disponibles et leurs contraintes
  8. Réglage : partitions, mémoire, brassage des données
  9. Écriture des résultats et intégration en aval
  10. Projet : modèle entraîné sur un gros jeu de données

Évaluation et attestation

Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.

Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.