Site Reliability Engineer
Core
First-line technical owner for applications running across multiple regional locations, performing deep service-level diagnostics and incident response.
Role type
Site Reliability Engineer
Builds
Maintains reliability of applications and services on Azure-based Kubernetes platforms
Domain
Industrial Technology / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | research | client delivery | infrastructure | physical/clinical work
Required skills
Kubernetes administration, Azure cloud platforms, database management, messaging bus technologies, observability tooling, incident response, root cause analysis, GitOps frameworks, Infrastructure as Code
Preferred skills
None stated
Technologies
Kubernetes, Azure, MongoDB, MSSQL, PostgreSQL, Kafka, Helm, Kustomize, Git, Azure DevOps, ArgoCD, Terraform, Grafana, Loki, Mimir
Responsibilities
Perform deep service-level diagnostics using observability tooling, support incident response and service restoration, operate and support workloads on Azure-based Kubernetes platforms, collaborate with platform and application teams, report new bugs/issues to product teams
Seniority
Mid-Senior, hands-on IC
