Data Engineer
Core
Build and optimize data infrastructure, design and implement robust data pipelines to extract, transform, and load data into AWS-based data lakes and warehouses.
Role type
Data Engineer
Builds
Data pipelines, data warehouses, and data lakes on AWS and Databricks
Domain
Biotechnology / Cloud Data Engineering
Deliverable
production ML models | infrastructure
Required skills
SQL, Python, PySpark, Apache Airflow, AWS, Databricks, data modeling, performance tuning
Preferred skills
NoSQL databases, vector databases for LLMs, Apache Spark, CI/CD pipelines, DevOps practices, GCP or Azure
Technologies
AWS, Databricks, PySpark, Airflow, SQL, Python, Git, Jenkins, Maven
Responsibilities
Build and optimize data pipelines, data warehouses, and data lakes; Manage and maintain AWS and Databricks environments; Ensure data integrity, accuracy, and consistency; Maintain system uptime and optimal performance; Explore and implement new tools to enhance ETL platform performance.
Seniority
Mid-Senior (5-9 years experience)