Analyse de données & data science

Data engineering : pipelines et ETL

Construire les fondations de la donnée : concevoir des pipelines d'ingestion et de transformation, modéliser un entrepôt de données, orchestrer et planifier les traitements, garantir la qualité et la fiabilité des flux. Trois jours orientés pratique.

Objectifs

  • Comprendre le rôle et le périmètre du data engineering
  • Concevoir une architecture de données (sources, stockage, exposition)
  • Construire des pipelines d'ingestion et de transformation
  • Modéliser un entrepôt de données décisionnel
  • Orchestrer et planifier les traitements
  • Garantir la qualité, la fraîcheur et la traçabilité des données
  • Superviser les flux et traiter les incidents

Programme détaillé

Module 1 — Architecture de données

  • Rôle du data engineer
  • Sources, entrepôt, lac de données
  • Traitement par lots et en flux
  • Choix technologiques et coûts

Module 2 — Ingestion et transformation

  • Extraire des données de sources hétérogènes
  • Nettoyer, normaliser, enrichir
  • Approches ETL et ELT
  • Gestion des schémas et des évolutions

Module 3 — Modéliser l’entrepôt

  • Modèle en étoile et tables de faits
  • Dimensions et historisation
  • Granularité et agrégats
  • Exposer les données aux outils décisionnels

Module 4 — Orchestrer et fiabiliser

  • Orchestration et planification des traitements
  • Dépendances et reprises sur erreur
  • Tests et contrôles qualité des données
  • Supervision, alertes et documentation

Méthodologie pédagogique

Pédagogie active et orientée terrain : apports structurés, exercices appliqués à vos cas réels, études de cas et mises en situation. Chaque participant repart avec un support complet et un plan d'action personnalisé. Les acquis sont évalués en fin de session et une attestation de formation est remise.

Profil de l'intervenant

Consultant data engineer, praticien des architectures de données.