AWS Data Engineering Training Glue Data Catalog, Crawlers, and Classifiers
AWS Data Engineering Training
0% Completed
Module 1 — AWS Data Engineering Foundations
AWS Global Infrastructure and IAM Fundamentals
Reading
Data Engineering Roles and Modern Data Architecture
Reading
AWS Analytics Services Overview: S3, Glue, Redshift, EMR, Kinesis
Reading
Lakehouse Architecture, Security, Networking, and Cost Management
Reading
Module 2 — SQL and Python for Data Engineering
Advanced SQL for Analytics and ETL
Reading
Python for Data Processing: pandas, boto3, psycopg2
Reading
Working with JSON, Parquet, CSV, and Avro
Reading
Coding Patterns, Unit Testing, and Modular Code Design
Reading
Module 3 — Amazon S3 and Data Lake
S3 Buckets, Objects, Versioning, and Lifecycle Policies
Reading
S3 Security: Bucket Policies, ACLs, and Encryption
Reading
Data Lake Design: Raw, Curated, Consumption Zones
Reading
Partitioning, File Formats, Athena, and Glue Data Catalog
Reading
Module 4 — AWS Glue and ETL Development
Glue Data Catalog, Crawlers, and Classifiers
Reading
Glue ETL Jobs with PySpark and Spark
Reading
Glue Studio Visual ETL
Reading
Dynamic Frames, Bookmarks, Workflows, and Triggers
Reading
Module 5 — Amazon Redshift Data Warehouse
Redshift Architecture, Distribution Styles, and Sort Keys
Reading
Loading Data from S3, Glue, and DMS
Reading
Query Optimization, WLM, and Concurrency Scaling
Reading
Spectrum, Redshift Serverless, and RA3 Nodes
Reading
Module 6 — Streaming Data with Kinesis and MSK
Kinesis Data Streams, Firehose, and Analytics
Reading
Apache Kafka on AWS with MSK
Reading
Stream Processing with Lambda and Kinesis Analytics
Reading
Windowing, Checkpointing, and Real-Time Analytics Architectures
Reading
Module 7 — AWS Lambda and Event-Driven Processing
Lambda Functions for Data Processing
Reading
Event Sources: S3, SQS, SNS, EventBridge, Kinesis
Reading
Step Functions for Orchestration
Reading
Error Handling, Dead-Letter Queues, and Lambda Optimization
Reading
Module 8 — Data Orchestration with MWAA and Step Functions
Amazon MWAA Managed Apache Airflow
Reading
Directed Acyclic Graphs (DAGs) Design
Reading
Step Functions State Machines for Data Pipelines
Reading
EventBridge Scheduling, Monitoring, and Alerting
Reading
Module 9 — Data Governance, Quality, and Security
AWS Lake Formation and Fine-Grained Access Control
Reading
Data Quality with Deequ and Great Expectations
Reading
Encryption at Rest and in Transit
Reading
VPC Endpoints, PrivateLink, and Compliance Frameworks
Reading
Module 10 — Big Data with EMR and Spark
EMR Architecture, Clusters, and Notebooks
Reading
Spark on EMR: DataFrames, SQL, Streaming
Reading
Hadoop Ecosystem on EMR
Reading
EMR Serverless, Managed Scaling, and S3/Glue/Redshift Integration
Reading
Module 11 — DevOps, CI/CD and Monitoring
Infrastructure as Code with CloudFormation and Terraform
Reading
CI/CD for Data Pipelines with CodePipeline
Reading
CloudWatch Monitoring, Logs, and Alarms
Reading
Cost Optimization, Disaster Recovery, and Backup Strategies
Reading
Module 12 — Real-World Projects and Interview Prep
E-Commerce Data Lake and Analytics Pipeline
Reading
Real-Time Clickstream Analytics with Kinesis
Reading
Data Warehouse Migration to Redshift
Reading
Portfolio, Project Explanation, and Interview Preparation
Reading
Announcements Course Info
PreviousNext