Data Engineer (ETL, Python, SQL)
Core
Design, build, test, tune, and support production data pipelines and ETL processes for large-scale data movement and transformation.
Role type
Mid-Level Data Engineer (ETL, Cloud Data Platforms)
Builds
Production data pipelines, ETL jobs, data ingestion/transformation logic, and data quality checks
Domain
Cloud Data Engineering, Healthcare Data (PHI/PII), AWS Data Services
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
PySpark, Python, advanced SQL, ETL development, data modeling, data pipeline implementation, AWS data services, flat-file ingestion, CDC, incremental loads, idempotent processing, data quality checks, CI/CD, automated testing, release management, problem-solving, production support, debugging
Preferred skills
AI-assisted mapping automation, LLMs for data cleaning/transformation, RAG patterns, embeddings, vector databases, semantic search, healthcare data standards (HL7, FHIR, CCD), infrastructure as code (Terraform, CloudFormation), Databricks, Snowflake, streaming, observability, DevOps practices
Technologies
PySpark, Python, SQL, AWS (S3, Glue, Lambda, Step Functions, ECS, DynamoDB, Redshift, PostgreSQL, SQL Server, Athena), GitHub, Terraform, CloudFormation, Databricks, Snowflake
Responsibilities
Develop, test, tune, and maintain ETL and data pipelines; Support ingestion and transformation of flat files, relational databases, APIs, data warehouses, and enterprise data sources; Collaborate with business analysts, data architects, QA, DevOps, and senior engineers to implement source-to-target mappings; Implement CDC, incremental load design, idempotent pipeline processing, and data reconciliation patterns; Maintain technical documentation, mapping specifications, data catalog updates, runbooks, automated tests, and release support materials
Seniority
Mid-Level, hands-on IC