Senior Data Reliability Engineer AWS
Core
Own the reliability, stability, and operational excellence of AWS-based data platforms and production data pipelines.
Role type
Senior hands-on Data Reliability Engineer
Builds
Resilient, performant data pipelines and analytics platforms meeting business-critical SLAs
Domain
Financial services, Cloud Data Engineering (AWS)
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
AWS data services (EMR, Redshift, S3, DynamoDB), Python, SQL, distributed data processing (Spark, streaming), incident response, root cause analysis, observability design, automation development, disaster recovery planning
Preferred skills
Backfills and reprocessing, handling late-arriving/incomplete data, improving data system observability, guiding pipeline reliability practices, streaming/event-driven systems (Kafka, Kinesis, CDC), disaster recovery testing
Technologies
AWS EMR, Redshift, S3, DynamoDB, Spark, Kafka, Kinesis
Responsibilities
Diagnose and resolve production data pipeline failures and data quality issues; Lead incident response, triage, and mitigation; Perform root cause analysis and implement durable fixes; Define and improve data SLAs (freshness, latency, completeness); Design and enhance monitoring, alerting, and observability; Develop automation and tooling to reduce operational toil; Contribute to disaster recovery and resiliency planning; Create and maintain runbooks and operational documentation
Seniority
Senior, hands-on IC