Data Engineer
Core
Building a high-performance, scalable Data Lakehouse with sub-minute latency using unified batch and streaming compute.
Role type
Senior IC Data Engineer
Builds
Real-time CDC flows, optimized table formats, ETL/ELT frameworks, and automated data infrastructure on AWS.
Domain
Cloud-native data engineering and distributed systems
Deliverable
production ML models | product features | infrastructure
Required skills
Python, PySpark, SQL, AWS (S3, EKS, MSK), Infrastructure-as-Code, Airflow, Temporal, Trino, Clickhouse, Debezium, PeerDB, Iceberg, Delta, Hudi, Domain Modelling (OLAP)
Preferred skills
Go, Java, Scala, AI tools (Claude, Codex, Copilot)
Technologies
Debezium, PeerDB, Olake, Delta, Iceberg, Hudi, PySpark, Flink, EMR, EKS, MSK, Trino, Clickhouse, Airflow, Temporal, Gitlab, Github Actions, Terraform, Metabase, Superset, Tableau, PowerBI
Responsibilities
Designing and optimizing table formats for performance and storage efficiency; Developing robust ETL/ELT frameworks for batch and streaming workloads; Managing data workloads on AWS and automating via CI/CD; Tuning query engines to power real-time dashboards; Driving key tech initiatives by preparing TRDs and leading design reviews; Designing Domain models for OLAP including Fact, Dimension, SCDs, and OBT patterns.
Seniority
Mid-level (3-5 years), hands-on IC with technical leadership responsibilities