CareerPlanSign in

Site Reliability Engineer (SRE)

San Francisco💼 Full-time🗓 2025-03-27 → 2026-09-26

Core

Ensure reliability, availability, and scalability of AI-powered Personal & Entrepreneurial Resource Planner systems.

Role type

Site Reliability Engineer (SRE)

Builds

Cloud-native infrastructure, observability tools, CI/CD pipelines, and disaster recovery strategies for a global SaaS platform.

Domain

SaaS / AI-driven resource planning / Cloud Infrastructure

Deliverable

production ML models | infrastructure

Required skills

Cloud platform expertise (AWS/Azure/GCP), Infrastructure as Code (Terraform/CloudFormation), Container orchestration (Kubernetes/Docker), Linux system administration, Observability tooling (Prometheus/Grafana/ELK/Datadog), Scripting (Python/Go/Bash), Incident management and root cause analysis, Distributed systems knowledge.

Preferred skills

Load balancing and failover strategy design, Cloud cost optimization, Security best practices implementation.

Technologies

AWS, Azure, GCP, Terraform, CloudFormation, Pulumi, Docker, Kubernetes, Helm, Prometheus, Grafana, ELK, Datadog, New Relic, Bash, Python, Go.

Responsibilities

Design and implement scalable, fault-tolerant systems across cloud environments; Develop and maintain observability tools including monitoring, logging, and alerting; Automate infrastructure provisioning, deployment, and incident response using IaC tools; Optimize system performance, scalability, and incident response workflows; Conduct root cause analysis and implement preventative measures; Ensure high availability by designing and maintaining load balancing, failover, and disaster recovery strategies; Improve CI/CD pipelines to enhance deployment speed while maintaining stability; Optimize cloud cost and resource utilization; Participate in on-call rotations to address system failures.

Seniority

Mid-Senior, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.