Site Reliability Engineer II
Core
Manage cloud infrastructure, debug system issues, and build automation tools to ensure reliability and performance across AWS and GCP environments.
Role type
Senior Site Reliability Engineer (Cloud Infrastructure)
Builds
Production-quality automation tooling, deployment pipelines, fault-injection harnesses, and observability pipelines.
Domain
Cloud Infrastructure (AWS, GCP), DevOps, Site Reliability Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux/UNIX systems administration, Google Cloud Platform (GCP) expertise, Infrastructure-as-Code (Terraform), Configuration Management (Ansible/Puppet/Chef/Salt), Full-stack troubleshooting, Distributed systems fundamentals, Scripting/automation (Python/Go/Bash)
Preferred skills
AWS Control Tower, AI coding assistants, Agent-based workflow automation, Model Context Protocol (MCP), Docker, Kubernetes, CI/CD platforms (Jenkins/Artifactory)
Technologies
AWS, GCP, Terraform, Ansible, Puppet, Chef, Salt, Python, Go, Bash, Docker, Kubernetes, Jenkins, Artifactory
Responsibilities
Manage multiple cloud accounts using AWS Control Tower and Terraform; Debug system issues and improve system health metrics; Design and maintain production-quality software for reliability engineering; Participate in a follow-the-sun on-call rotation.
Seniority
Mid-Senior, hands-on IC