Formation Data Engineer & Big Data

Formation Apache Airflow

Créer, planifier et superviser des pipelines de données avec Apache Airflow.

Prochaines sessions

Dates des prochaines sessions

Sessions en présentiel à Paris ou à distance. Inscriptions ouvertes jusqu'à la veille du démarrage, dans la limite des places disponibles.

26 → 27 mai 2027
à distance et à Paris
S'inscrire à cette session →
13 → 14 octobre 2027
à distance et à Paris
S'inscrire à cette session →
Présentation

Apache Airflow est l’outil open source de référence pour orchestrer des workflows de données.

Cette formation Apache Airflow présente son architecture et son fonctionnement. Les participants apprennent à créer des DAGs en Python, définir des tâches et leurs dépendances, planifier les traitements, superviser les exécutions et gérer les erreurs.

La formation présente également les fonctions utiles pour des usages en production : variables, connexions, secrets, XCom, Data Assets, tests et déploiement.

Objectifs pédagogiques

  • Comprendre l'architecture d'Airflow
  • Créer des DAGs
  • Définir des tâches et dépendances
  • Planifier des traitements
  • Utiliser la TaskFlow API
  • Gérer les paramètres et connexions
  • Superviser les exécutions
  • Diagnostiquer les erreurs
  • Utiliser les Data Assets
  • Appliquer les bonnes pratiques de développement
Programme détaillé

2 jours, 14 heures de pratique

Chaque journée alterne apports théoriques courts et ateliers pratiques. Programme ajustable en intra-entreprise.

1 Architecture d'Airflow et premiers DAGs

• Rôle d’un orchestrateur et présentation d’Airflow
• Architecture : scheduler, workers, base de métadonnées, interface
• Création d’un DAG : tâches, dépendances, operators
• TaskFlow API
• Scheduling et expressions cron, exécution manuelle
• États des tâches, logs et retries
• Cas pratique ETL

2 Fonctions avancées, production et bonnes pratiques

• Paramètres, variables, connexions et secrets
• XCom, branches et Dynamic Task Mapping
• Sensors, Data Assets et scheduling basé sur les données
• Backfills, gestion des erreurs et alertes
• Pools et gestion de la concurrence
• Organisation du code et tests
• Déploiement avec Docker et bonnes pratiques
• Cas pratique final

Public concerné

Profils et prérequis

Profils concernés

  • Data engineer
  • Analytics engineer
  • Développeur Python
  • Data scientist
  • DevOps ou DataOps

Prérequis

  • Connaissance de Python
  • Connaissances générales sur les traitements de données
Déroulement

Modalités pédagogiques

  • En présentiel à Paris ou à distance ou en classe virtuelle, aux mêmes horaires et avec le même formateur.
  • Apports théoriques courts puis ateliers pratiques sur des jeux de données réels, corrigés en direct.
  • Formateur praticien de la data en entreprise, groupe limité à 8 participants.
  • Supports de cours, jeux de données et corrigés remis à chaque participant.
  • Émargement à chaque demi-journée, en salle comme à distance, et certificat de réalisation en fin de formation.
Les outils

Les logiciels et technologies

Les outils que vous manipulerez tout au long de la formation.

Apache Airflow Python TaskFlow API Data Assets Docker SQL Git
Évaluation

Outils d'évaluation des compétences

  • Quiz en fin de module pour valider l'acquisition des connaissances théoriques.
  • Exercices de création de DAGs corrigés par le formateur.
  • Atelier de diagnostic d'erreurs sur des exécutions réelles.
  • Cas pratique final : un pipeline ETL orchestré de bout en bout.
Informations pratiques

Reconnaissance, inscription et accessibilité

Reconnaissance

Formation non certifiante. Une attestation de formation est remise à l'issue de la formation.

Inscription

Inscription en ligne ou au 01.72.25.40.82. Nous vérifions ensemble vos objectifs et les prérequis, puis une convention (entreprise) ou un contrat (particulier) valide l'inscription. La convocation est envoyée avant le démarrage.

Sessions inter : inscription possible jusqu'à la veille, dans la limite des places. Sessions intra : mise en place sous 3 semaines. Prise en charge OPCO : la demande doit être déposée avant le début de la formation.

Accessibilité

Formation accessible aux personnes en situation de handicap, en présentiel comme à distance. Les adaptations sont étudiées avant l'inscription avec notre référent handicap : accessibilité de nos formations.

Financement

Une formation finançable

Selon votre situation, cette formation peut être prise en charge par un financeur. Notre équipe vous accompagne dans le montage du dossier et vous fournit devis, programme et convention.

Salarié : Plan de développement des compétences de votre entreprise, avec prise en charge possible par votre OPCO.

Indépendant, dirigeant, profession libérale : Fonds d'assurance formation de votre activité (AGEFICE, FIF PL, FAFCEA…).

Demandeur d'emploi : Aide individuelle à la formation (AIF) de France Travail, sur accord de votre conseiller.

Financement personnel : Paiement en plusieurs fois possible.

CPF : Nos formations ne sont pas certifiantes : elles ne sont pas éligibles au Compte personnel de formation.

Voir toutes les solutions de financement

Questions fréquentes

FAQ

Quelle est la durée de la formation et sous quels formats est-elle proposée ?

La formation dure 2 jours (14 heures) et se déroule en présentiel à Paris ou à distance, en groupe limité à 8 participants. Elle est aussi disponible en intra-entreprise, avec des DAGs construits sur vos propres traitements.

Quels sont les prérequis pour suivre cette formation ?

Une connaissance de Python et des notions générales sur les traitements de données (fichiers, bases SQL, ETL) suffisent. Aucune expérience préalable d'Airflow n'est nécessaire.

Quelle version d'Airflow est utilisée ?

La formation s'appuie sur la version stable la plus récente d'Airflow (Airflow 3), qui introduit notamment les Data Assets et une nouvelle interface. Les différences avec Airflow 2 sont signalées pour les équipes qui exploitent encore cette version.

Airflow, DBT, Prefect ou Dagster : quel outil pour quel besoin ?

Airflow orchestre des traitements hétérogènes (Python, SQL, appels d'API, notebooks) ; DBT transforme les données dans l'entrepôt et s'orchestre très bien depuis Airflow. La formation situe Airflow par rapport aux autres orchestrateurs et montre comment l'associer à DBT dans un pipeline ELT.

Prêt à monter en compétences ?

Inscrivez-vous à l'une de nos sessions programmées, ou optez pour une formation intra sur mesure adaptée à votre équipe.

Une question ? Appelez-nous au 01.72.25.40.82

Cette formation Apache Airflow vous apprend en 2 jours à orchestrer vos pipelines de données : architecture d’Airflow, création de DAGs en Python avec la TaskFlow API, planification, dépendances, supervision et diagnostic des erreurs, puis les fonctions nécessaires en production : variables, connexions, secrets, XCom, Dynamic Task Mapping, sensors, Data Assets, backfills, tests et déploiement avec Docker. Le cas pratique final orchestre un pipeline ETL de bout en bout. Idéale pour data engineers, analytics engineers et développeurs Python.

Pour aller plus loin

Formations liées

Ressources & documentation