Senior Site Reliability Engineer - India
Core
Architect, scale, and maintain the reliability, availability, and performance of multi-region microservices, APIs, and authentication infrastructure for an AI-powered unified IT management platform.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Multi-region microservices, APIs, authentication infrastructure, Kubernetes clusters, and FinOps dashboards (via careerplan.io/jobs/c30df081-4282-4b54-92f7-92f8a9225728-senior-site-reliability-engineer-india-at-jumpcloud)
Domain
Cloud Infrastructure (AWS/GCP), Distributed Systems, Identity & Access Management
Required skills
Python, Go, Kubernetes (EKS/GKE), Terraform, AWS/GCP, GitOps (Argo CD), FinOps, Disaster Recovery, Observability (Datadog), Service Meshes (Istio/Linkerd), Incident Management
Preferred skills
Chaos Engineering, Secrets Management (Vault), DevSecOps, IAM/Identity Services
Technologies
AWS, GCP, Kubernetes, EKS, Terraform, Datadog, Argo CD, Kargo, Python, Go, Istio, Linkerd, HAProxy, NGINX, Vault, PagerDuty, Cursor, Claude Code, GitHub Copilot
Responsibilities
Architect and scale multi-region microservices and authentication infrastructure; Design and maintain Disaster Recovery processes and multi-region failover automation; Lead SLI/SLO/Error Budget frameworks; Drive end-to-end observability strategy using Datadog; Lead on-call escalation and major incident management; Facilitate blameless post-incident reviews; Architect and manage production Kubernetes clusters with GitOps workflows; Design and maintain Infrastructure-as-Code using Terraform; Build FinOps and cost-optimization dashboards; Write production-grade Python/Go tooling for automation; Champion AI-assisted development workflows; Mentor mid-level/junior engineers
Seniority
Senior, hands-on IC