Senior Site Reliability Engineer
Core
Designing, implementing, and maturing reliability engineering capabilities for GCP and Azure platforms, focusing on complex technical problem solving, automation strategy, and operational excellence.
Role type
Senior GCP Site Reliability Engineer (IC)
Builds
Production-ready cloud infrastructure, automation frameworks, observability dashboards, and resilient platform services for enterprise clients.
Domain
Cloud Infrastructure / Site Reliability Engineering / GCP & Azure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
GCP cloud architecture, Terraform/IaC, CI/CD pipelines, incident response, root cause analysis, policy-as-code, networking (VPCs, IAM), observability tools, automation scripting
Preferred skills
Azure landing zones, GenAI platform health checks, capacity planning, error budget management, cross-functional collaboration
Technologies
Google Cloud Platform (GCP), Terraform, Log Analytics, Dynatrace, Resource Graph, Azure, CI/CD tools
Responsibilities
Design and implement advanced reliability patterns for Azure landing zones and GCP services; Develop reusable Terraform modules and automation frameworks; Lead deep technical investigations for major incidents; Define and mature SLIs, SLOs, and alerting standards; Mentor SRE engineers on automation and troubleshooting; Partner with security teams to integrate IAM and policy-as-code into operations.
Seniority
Senior, hands-on IC