SRE Architect (68019)
Core
Lead the Site Reliability Engineering practice to transform operations from reactive to proactive, engineering-led reliability, focusing on non-functional requirements, self-healing automation, and database operations.
Role type
Senior SRE Architect / Practice Lead
Builds
Resilient, performant, and cost-optimized cloud infrastructure and database systems
Domain
Cloud & Data Engineering
Deliverable
production ML models | infrastructure
Required skills
Observability, Resiliency engineering, Service Management, Reliability engineering, Performance engineering, Scalability, Release management, Cloud cost management, FMEA-based failure analysis, Chaos engineering, Database automation, ML-driven anomaly detection, AIOps, CI/CD pipeline design, Mentoring
Preferred skills
Service mesh (Istio), Distributed tracing at scale, Financial services SRE practices
Technologies
Prometheus, Grafana, ELK/OpenSearch, Jaeger/Zipkin, Datadog, Dynatrace, PagerDuty, Moogsoft, BigPanda, Gremlin, LitmusChaos, Chaos Monkey, Python, Go, Bash, Kubernetes, AWS/Azure/GCP, Jenkins, GitLab CI, Spinnaker, ArgoCD, Liquibase, Flyway
Responsibilities
Define and enforce non-functional requirements (NFRs) for performance, scalability, availability, fault tolerance, and cost efficiency; Design and implement self-healing automation for known failure patterns; Build comprehensive observability stacks with ML-driven anomaly detection and AIOps capabilities; Lead automated incident management including detection, triage, escalation, and remediation; Drive DB automation for provisioning, release management, backup/restore, and operational workflows; Define and track SLIs, SLOs, and error budgets; Conduct chaos engineering exercises and game days; Mentor SRE Engineers and establish engineering standards
Seniority
Senior, hands-on IC with leadership responsibilities