Big Data - Les fondamentaux
Comprenez les concepts clés du Big Data, les architectures de traitement et les outils de l'écosystème Hadoop/Spark.
Programme mis à jour le 8 août 2026
L'essentiel
- Durée :
- 21h (3 jours)
- Format :
- Présentiel ou distanciel · cours du soir à distance, de 19h à 20h30
- Tarif :
- 2 100 € net par participant · parcours du soir 890 € net
- Prochaine date :
- session du 3 novembre 2026
- Pour qui :
- data analysts, chefs de projet it
- Prérequis :
- Connaissances de base en informatique
Prochaines sessions
12 places maximum par session en journée, pour garantir la qualité des travaux pratiques. Session confirmée dès 6 inscrits.
Aussi disponible en cours du soir
Le même programme, réparti en soirées d'1h30 de 19h à 20h30, à tarif réduit pour les particuliers et les indépendants. 30 places par parcours, ouvert dès 5 inscrits (remboursement intégral s'il n'ouvre pas).
Prix nets de taxes : LessonSharing est exonéré de TVA au titre de la formation professionnelle (art. 261-4-4° a du CGI). Tarif anticipé : valable jusqu'à 8 semaines avant le début de la session. Inscriptions groupées : dès 4 participants d'une même entreprise, la 4ᵉ place est offerte au tarif en vigueur (cumulable avec le tarif anticipé). Votre session ailleurs ou à d'autres dates : .
Programme
- Introduction au Big Data et ses enjeux
- Architectures distribuées (Hadoop, HDFS)
- Traitement avec Apache Spark
- Data Lakes et entrepôts de données
Objectifs
- Comprendre les concepts fondamentaux du Big Data
- Identifier les architectures adaptées à vos besoins
- Manipuler les outils Hadoop et Spark
Prérequis
- Connaissances de base en informatique
- Notions de bases de données
Public cible
- Data analysts
- Chefs de projet IT
- Architectes données
Programme détaillé
Jour 1 : Comprendre le Big Data et ses architectures
- Enjeux du Big Data : volumétrie, vélocité, variété (les 5V)
- Panorama de l'écosystème : Hadoop, Spark, bases NoSQL
- Principes des architectures distribuées
- TP : prise en main de l'environnement Hadoop
Jour 2 : Stockage et traitement distribués
- Fonctionnement de HDFS : blocs, réplication, tolérance aux pannes
- Concepts MapReduce et limites du modèle
- Apache Spark : RDD, DataFrames et traitements en mémoire
- TP : premiers traitements de données avec Spark
Jour 3 : Data Lakes et mise en œuvre
- Data Lake vs entrepôt de données : usages et complémentarité
- Ingestion, organisation et gouvernance des données
- Panorama des offres cloud managées (EMR, Databricks)
- TP de synthèse : construction d'un pipeline de traitement complet
Modalités pratiques
Modalités et délais d'accès
Formation ouverte à tous, salariés, indépendants et particuliers : inscrivez-vous à une session planifiée du calendrier, ou demandez une formation dédiée à votre équipe (intra-entreprise, dates et lieu à convenir). Après votre demande d'inscription, nous vous recontactons sous 48 h ouvrées pour définir ensemble les modalités et planifier la session.
Méthodes pédagogiques
- Alternance d'apports théoriques et de mises en pratique (travaux dirigés, cas concrets)
- Formation animée par un formateur expert en activité sur le terrain
- Support de cours remis aux participants
Évaluation des acquis
- Évaluation continue des acquis au travers des exercices et travaux pratiques
- Questionnaire d'évaluation des acquis en fin de formation
- Attestation de fin de formation remise au stagiaire
Accessibilité handicap
Nos formations sont accessibles aux personnes en situation de handicap. Contactez notre référent handicap à [email protected] pour étudier ensemble les adaptations nécessaires. Consultez notre politique d'accessibilité.
Prêt à vous former ?
Inscrivez-vous dès maintenant ou contactez-nous pour un programme sur mesure.
