Data Engineer (Python)
Core
Build and scale health data pipelines enabling data discoverability, linkage, privacy, machine learning, and analytics across the healthcare ecosystem.
Role type
Data Engineer (Python, Spark, Snowflake)
Builds
Scalable data pipelines and processing frameworks for regulatory-grade health decisions
Domain
Healthcare data infrastructure and analytics
Deliverable
production ML models | infrastructure
Required skills
Python, Apache Spark, Airflow, Snowflake, agentic code generation tools (Claude Code/Codex), data pipeline design, distributed data processing
Preferred skills
Dimensional/analytics data modeling, AWS data environments, data governance and quality frameworks, on-premises deployment architecture, application security best practices, compliance frameworks (HIPAA, GDPR, HITRUST)
Technologies
Python, Spark, Airflow, Snowflake, AWS, Claude Code, Codex
Responsibilities
Design and maintain scalable data pipelines; ensure pipeline reliability, data quality, and observability; partner with Science and Product to define data requirements; implement automated testing and optimize processing performance/cost; design and maintain data validation frameworks aligned with regulatory requirements
Seniority
Mid-level to Senior (2+ years for junior, 5+ years for senior)