Apache Spark est un moteur de calcul distribué. Spark permet de traiter de grandes quantités de données sur plusieurs machines. Avec Spark, les données sont découpées en partitions. Chaque partition est traitée en parallèle par un executor. Le driver coordonne le travail et distribue les tâches aux executors. Les données restent en mémoire, ce qui rend Spark rapide. Un RDD est une collection distribuée et immuable de données. Un DataFrame est une table distribuée avec des colonnes nommées. Les transformations décrivent un calcul, les actions déclenchent le calcul. Spark est paresseux : rien ne se passe avant une action. On peut interroger les données avec Python ou avec SQL. Le langage Python est très utilisé pour analyser des données. PySpark est la bibliothèque Python pour utiliser Spark. Les données de ventes permettent de mesurer le chiffre d'affaires. Les données des clients permettent de mieux comprendre les ventes. Analyser les données aide une entreprise à prendre de meilleures décisions. Une petite boutique a peu de données, une grande plateforme en a énormément. Quand les données ne tiennent plus sur une machine, Spark devient utile. Spark fonctionne aussi très bien sur un simple ordinateur portable. Bravo : vous savez maintenant compter les mots avec Spark !