Software Engineer
Core
Design, implement, and govern end-to-end observability, cloud cost optimization (FinOps), and production reliability for large-scale distributed systems across AWS and GCP.
Role type
Staff/Principal SRE (Cloud Platform & Observability)
Builds
Unified observability architecture, cost visibility systems, incident management frameworks, and optimized multi-cloud Kubernetes clusters.
Domain
Cloud Infrastructure, Observability, FinOps, Distributed Systems
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
AWS, GCP, Kubernetes internals, Terraform/Pulumi/CDK, Prometheus/Grafana/Loki/Elastic/Kibana, Java/Python/Go, SLO/SLI/SLA design, RCA, CI/CD integration
Preferred skills
Google SRE background, Chaos Engineering, FinOps success cases, eBPF, performance profiling, multi-cloud disaster recovery design
Technologies
AWS, GCP, Kubernetes (EKS/GKE), Terraform, Pulumi, CDK, Prometheus, Grafana, Loki, Elastic, Kibana, Java, Python, Go
Responsibilities
Design and implement end-to-end observability systems; lead systematic cloud cost optimization; establish production reliability governance and incident response frameworks; optimize Kubernetes cluster architecture and stability.
Seniority
Staff/Principal, hands-on IC with mentorship