Senior Reliability Engineer
Core
Build reliability at scale for mission-critical cloud systems, ensuring high availability, scalability, and resilience of distributed infrastructure.
Role type
Senior IC Cloud Reliability Engineer (SRE)
Builds
Highly available, scalable, and fault-tolerant AWS-based cloud infrastructure and database systems.
Domain
Cloud Infrastructure & Database Reliability
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
AWS services (EC2, S3, RDS/Aurora, Lambda, VPC), observability (Datadog, CloudWatch), database operations (replication, tuning, backup), disaster recovery planning, root cause analysis, automation mindset
Preferred skills
Python/Shell scripting, ITIL frameworks, SOX compliance experience
Technologies
AWS, Datadog, CloudWatch, Prometheus, Grafana, Commvault, Aurora, RDS, DynamoDB, EBS, EFS, Route 53
Responsibilities
Manage AWS infrastructure lifecycle and resource optimization; proactively detect and resolve issues using observability tools; ensure high availability and performance of database clusters; own backup integrity and validate restore operations; manage security access and support compliance audits; drive automation and process improvements for operational excellence
Seniority
Senior, hands-on IC