Travaux pratiques · niveau débutant
Apache Spark
avec Python
Apprenez à traiter des données avec PySpark, une petite étape à la fois.
Vous jouez le rôle d'un·e analyste dans une boutique en ligne : du premier print
jusqu'au bilan de l'année, en 58 étapes.
- Prérequis : les bases de Python (variables, listes, fonctions)
- Outil : Google Colab, ou Jupyter avec Java 17+
Comment ça marche
Recopiez le code, exécutez-le, comparez avec le résultat attendu.
Complétez les .... Un indice et la solution sont cachés en dessous.
Pour aller plus loin. Vous pouvez les passer sans gêner la suite.
Un peu de cours, sans code à écrire.
Votre progression est enregistrée dans ce navigateur : vous pouvez fermer la page et reprendre plus tard.
Envie de repartir de zéro sur le serveur de la classe ? Réinitialiser mon notebook (une confirmation vous sera demandée, et votre notebook actuel sera sauvegardé).
Le parcours
Mise en place
Installer PySpark, récupérer les données et démarrer Spark.
1Les RDD
La brique de base de Spark : map, filter, reduce et le célèbre word count.
2Les DataFrames
Charger un fichier CSV, l'explorer, filtrer et créer des colonnes.
3Nettoyer, regrouper, joindre
Traiter les valeurs manquantes et les doublons, calculer des totaux, croiser deux tables.
4Spark SQL
Interroger ses données avec des requêtes SQL.
5Mini-projet
Le bilan de l'année pour la direction, puis la sauvegarde des résultats.