JOUR 1 : Modernisation des Data Lakes et Data Warehouses avec Google CloudModule 1.1 : Introduction à l'ingénierie des données
- Savoirs et concepts clés :
- Explorer le rôle clé et les responsabilités d'un Data Engineer.
- Analyser les défis majeurs de la gestion des méga-données.
- Comprendre l'infrastructure générale de Google Cloud et son écosystème Big Data.
- Coopérer de manière collaborative avec les autres équipes de données (Data Scientists, Analystes).
- Structurer des pipelines de données prêts pour la production.
- Restreindre et gérer les droits d'accès aux données sensibles et assurer la gouvernance globale.
- Étudier le cas concret d'un client de Google Cloud Platform (GCP).
- Démonstration :
- Rechercher des données sensibles et personnelles (PII) à l'aide de l'API DLP (Data Loss Prevention) dans un jeu de données.
- Atelier Pratique :
- Analyser des données avec BigQuery pour en extraire des insights métiers de manière ad hoc.
Module 1.2 : Construire un Data Lake (Data Lake design)
- Savoirs et concepts clés :
- Découvrir l'architecture générale des Data Lakes.
- Choisir les meilleures options de stockage d'objets et d'ETL sur Google Cloud.
- Structurer et sécuriser le stockage de données non structurées ou semi-structurées avec Cloud Storage.
- Maîtriser le stockage de tous types de formats de fichiers (fichiers plats, JSON, formats colonnaires Parquet/ORC).
- Établir Cloud SQL comme une solution de Data Lake relationnel managé.
- Démonstration :
- Optimiser les coûts d'hébergement sur Cloud Storage en utilisant les classes de stockage dynamiques et les Cloud Functions.
- Atelier Pratique :
- Charger des données transactionnelles complexes (base de données de taxis) dans Cloud SQL.
Module 1.3 : Construire un Data Warehouse moderne
- Savoirs et concepts clés :
- Comprendre l'architecture distribuée et serverless d'un Data Warehouse moderne.
- Naviguer dans les concepts fondamentaux de Google BigQuery.
- Définir et optimiser les schémas de tables, y compris la modélisation de champs complexes (champs imbriqués et répétés "Nested & Repeated fields").
- Optimiser les requêtes et réduire les coûts grâce aux mécanismes de partitionnement et de clustering de BigQuery.
- Combiner des charges de travail transactionnelles et décisionnelles.
- Démonstrations :
- Interroger des Téras de données en quelques secondes dans BigQuery.
- Exécuter des requêtes fédérées sur Cloud SQL directement depuis l'interface BigQuery.
- Explorer de grands jeux de données publics BigQuery avec SQL en exploitant la table d'analyse INFORMATION_SCHEMA.
- Ateliers Pratiques :
- Charger des données dans BigQuery en combinant l'interface graphique de la console Web et l'outil de ligne de commande (CLI bq).
- Manipuler des données complexes contenant des tableaux (Arrays) et des structures de données imbriquées dans BigQuery.
- Configurer et tester des tables partitionnées et clusterisées dans BigQuery.
JOUR 2 : Construction de Pipelines de Données en mode BatchModule 2.1 : Introduction à la construction de pipelines de données par lots (Batch)
- Savoirs et concepts clés :
- Différencier et évaluer les approches d'intégration de données EL, ELT et ETL.
- Diagnostiquer les problèmes de qualité des données et mettre en œuvre des méthodes correctives.
- Effectuer des opérations d'ingestion et de transformation massives dans BigQuery.
- Démonstration :
- Utiliser des pipelines ELT pour corriger et améliorer automatiquement la qualité des données dans BigQuery.
Module 2.2 : Exécution de Spark sur Cloud Dataproc
- Savoirs et concepts clés :
- Appréhender l'écosystème Hadoop / Spark classique et son portage sur le cloud.
- Concevoir des architectures Spark en remplaçant le système de stockage HDFS par Cloud Storage (GCS).
- Configurer, dimensionner et optimiser les performances de clusters Cloud Dataproc (clusters éphémères vs permanents, nœuds de calcul préemptibles).
- Atelier Pratique :
- Configurer, déployer et exécuter des jobs Apache Spark directement sur un cluster managé Cloud Dataproc.
Module 2.3 : Traitement de données Serverless avec Cloud Dataflow
- Savoirs et concepts clés :
- Comprendre le modèle unifié d'Apache Beam et l'environnement d'exécution serverless de Cloud Dataflow.
- Construire des pipelines de traitement batch de bout en bout en utilisant Apache Beam en Python/Java.
- Déployer des modèles de pipelines prêts à l'emploi (Dataflow Templates) et écrire des requêtes Dataflow SQL.
- Gérer les transformations de données avancées, y compris les opérations MapReduce.
- Intégrer des données d'enrichissement statiques ou dynamiques à l'aide d'entrées latérales ("Side Inputs").
- Ateliers Pratiques :
- Développer et tester un pipeline de flux de données simple avec Apache Beam (Python ou Java).
- Programmer et exécuter un pipeline de type MapReduce avec Apache Beam.
- Implémenter et exécuter un pipeline Dataflow utilisant des Side Inputs pour de l'enrichissement de données en temps réel.
Module 2.4 : Gestion des pipelines de données avec Cloud Data Fusion et Cloud Composer
- Savoirs et concepts clés :
- Concevoir visuellement et sans code des pipelines ETL par lots avec Cloud Data Fusion.
- Manipuler et préparer visuellement les données à l'aide de l'outil interactif Wrangler.
- Orchestrer des flux complexes et planifier des workflows multi-services sur GCP avec Cloud Composer (Apache Airflow).
- Structurer des graphes de tâches acycliques dirigés (DAGs), choisir les bons opérateurs Airflow et planifier l'exécution des workflows.
- Assurer la surveillance, la journalisation et le débogage centralisé de l'orchestration des flux de données.
- Démonstration :
- Automatiser le chargement de données déclenché par un événement externe à l'aide d'une architecture Cloud Composer, Cloud Functions, Cloud Storage et BigQuery.
- Ateliers Pratiques :
- Construire et exécuter visuellement un graphe de pipeline complet dans l'interface interactive de Cloud Data Fusion.
- Configurer un environnement d'orchestration de tâches et concevoir son premier DAG d'orchestration dans Cloud Composer.
JOUR 3 : Systèmes d'Analyse en Streaming Résilients et Temps RéelModule 3.1 : Introduction au traitement de données en streaming (Temps réel)
- Savoirs et concepts clés :
- Identifier et surmonter les principaux défis architecturaux posés par l'ingestion et le traitement des données en continu.
Module 3.2 : Messagerie Serverless avec Cloud Pub/Sub
- Savoirs et concepts clés :
- Comprendre les principes fondamentaux de l'architecture éditeur/abonné de Cloud Pub/Sub.
- Évaluer les stratégies d'abonnements en mode Push et Pull pour s'adapter à la charge.
- Développer du code de publication de messages scalables.
- Atelier Pratique :
- Programmer et exécuter l'envoi d'un flux de données simulé et continu vers Cloud Pub/Sub.
Module 3.3 : Fonctionnalités streaming de Cloud Dataflow
- Savoirs et concepts clés :
- Relever les défis liés aux flux de données asynchrones (latence de réseau, données tardives, désalignement temporel).
- Maîtriser le concept de fenêtrage (Windows) temporel (fenêtres fixes, glissantes, de session).
- Configurer des mécanismes de rattrapage (Watermarks) et des déclencheurs de calcul (Triggers) pour traiter les données hors-délais.
- Atelier Pratique :
- Concevoir et exécuter un pipeline de streaming de bout en bout avec Dataflow pour ingérer et traiter des flux Pub/Sub en temps réel.
Module 3.4 : Fonctionnalités streaming à haut débit de BigQuery et Cloud Bigtable
- Savoirs et concepts clés :
- Diffuser des données en temps réel directement dans des tables BigQuery (Streaming Ingestion).
- Comprendre le positionnement de Cloud Bigtable pour le stockage à très haut débit et faible latence de séries temporelles massives.
- Structurer et optimiser le schéma des tables et la conception des clés de ligne (Row Keys) dans Bigtable pour éviter les hotspots de lecture/écriture.
- Ateliers Pratiques :
- Connecter un pipeline de streaming à BigQuery et concevoir des tableaux de bord interactifs de visualisation de données en continu.
- Déployer et alimenter un pipeline de données en streaming raccordé à Cloud Bigtable.
Module 3.5 : Fonctionnalités avancées de BigQuery et performance
- Savoirs et concepts clés :
- Développer des requêtes SQL avancées en utilisant les fonctions analytiques de fenêtrage ("Window Functions").
- Structurer et simplifier ses requêtes avec les expressions de table communes (clauses WITH).
- Manipuler des données géographiques complexes grâce aux fonctions du Système d'Information Géographique (SIG / GIS).
- Diagnostiquer les goulots d'étranglement de requêtes SQL et appliquer les meilleures pratiques d'optimisation de BigQuery pour réduire la facture et accélérer le traitement.
- Démonstration :
- Cartographier visuellement les codes postaux enregistrant la croissance la plus rapide à l'aide de BigQuery GeoViz.
- Atelier Pratique :
- Analyser, auditer et optimiser des requêtes SQL BigQuery complexes pour en améliorer drastiquement les performances d'exécution.
JOUR 4 : Smart Analytics, Machine Learning et IA sur Google CloudModule 4.1 : Introduction à l'analytique et à l'intelligence artificielle
- Savoirs et concepts clés :
- Comprendre la transition stratégique de l'analyse décisionnelle classique (ad-hoc) vers la prise de décision automatisée par l'intelligence artificielle.
- Cartographier et évaluer les différentes options de Machine Learning (ML) disponibles sur Google Cloud.
Module 4.2 : API de modèles de ML prédéfinies pour les données non structurées
- Savoirs et concepts clés :
- Comprendre la complexité et la valeur cachée des données non structurées (fichiers texte libres, images, audios).
- Intégrer les API cognitives pré-entraînées de Google (Natural Language API, Vision API, Translation API) pour enrichir et catégoriser à la volée ses flux de données.
- Atelier Pratique :
- Configurer et appeler la Natural Language API pour classifier de manière automatisée un grand ensemble de textes non structurés.
Module 4.3 : Big Data Analytics avec les notebooks Cloud
- Savoirs et concepts clés :
- Comprendre le rôle d'un notebook interactif pour les analyses exploratoires rapides.
- Intégrer des requêtes BigQuery directement dans des notebooks Jupyter via les commandes magiques de BigQuery (BigQuery Magic commands) et exploiter les résultats avec la librairie Pandas.
- Atelier Pratique :
- Lancer un environnement JupyterLab managé au sein de Vertex AI et y analyser interactivement des données stockées dans BigQuery.
Module 4.4 : Pipelines de production de machine learning
- Savoirs et concepts clés :
- Identifier et comparer les différents cycles de développement de modèles ML sur Google Cloud.
- Orchestrer, planifier et automatiser l'enchaînement de tâches de machine learning complexes à l'aide de Vertex AI Pipelines.
- Découvrir le partage de composants d'intelligence artificielle via TensorFlow Hub.
- Atelier Pratique :
- Configurer, orchestrer et exécuter avec succès un pipeline d'entraînement et d'évaluation de modèle sur Vertex AI Pipelines.
Module 4.5 : Création de modèles personnalisés avec SQL dans BigQuery ML
- Savoirs et concepts clés :
- Entraîner et déployer des modèles de Machine Learning personnalisés en écrivant de simples requêtes SQL de BigQuery ML (sans coder en Python).
- Distinguer les types de modèles pris en charge par BigQuery ML (régression linéaire, logistique, classification, K-means, arbres de décision).
- Démonstration :
- Entraîner pas à pas un modèle prédictif SQL dans BigQuery ML pour évaluer de manière dynamique les prix des courses de taxi à New York.
- Atelier Pratique (au choix) :
- Option A : Entraîner un modèle de régression linéaire sous BigQuery ML pour prédire de manière fine la durée d'une session de location de vélos en libre-service.
- Option B : Construire et évaluer un moteur de recommandation de films personnalisé en SQL avec BigQuery ML.
Module 4.6 : Création de modèles personnalisés avec Cloud AutoML
- Savoirs et concepts clés :
- Comprendre les cas d'usages d'AutoML pour automatiser la conception de modèles de haute qualité sans expertise poussée en Data Science.
- Configurer et évaluer des modèles d'AutoML Vision (pour l'analyse d'images), AutoML Natural Language (pour le texte libre) et AutoML Tables (pour les données tabulaires complexes).
Module 4.7 : Synthèse de la formation
- Savoirs et concepts clés :
- Récapituler l'ensemble des connaissances de l'ingénierie des données abordées sur Google Cloud.
- Ouvrir des pistes vers l'examen de certification officielle "Google Cloud Professional Data Engineer".