Data Engineer - Materials Discovery Research Institute
Core
Building, maintaining, and supporting reliable data pipelines, data models, and data platforms to enable analytics and machine learning for materials discovery research.
Role type
Senior Data Engineer with applied data science responsibilities
Builds
Data platforms, ETL/ELT pipelines, feature-ready datasets, and unified high-quality datasets for materials research
Domain
Materials Science / Sustainability / Renewable Energy / Carbon Capture
Deliverable
production ML models | product features | dashboards & analysis
Required skills
SQL, Python, pandas, NumPy, scikit-learn, PyTorch, TensorFlow, Azure/AWS/GCP, Terraform, Docker, Kubernetes, Apache Spark, Azure Databricks, Azure Data Factory, machine learning fundamentals, feature engineering, data governance
Preferred skills
Cloud-native services, orchestration frameworks, infrastructure-as-code, containerization, distributed processing frameworks
Technologies
Azure, AWS, Google Cloud, Terraform, Docker, Kubernetes, Apache Spark, Azure Databricks, Azure Data Factory, pandas, NumPy, scikit-learn, PyTorch, TensorFlow
Responsibilities
Execute architecture and technical implementation of data platforms; define and enforce standards for data modeling and pipeline design; design and evolve ETL/ELT pipelines from diverse sources; evaluate and introduce modern data technologies; lead integration of disparate data sources; maintain documentation and metadata repositories; collaborate on data and modeling approaches; assess and develop machine learning models; document assumptions and hand off validated models; act as technical advisor on data architecture.
Seniority
Senior, hands-on IC with strategic trade-off decisions