Platform Site Reliability Engineer (SRE)
Core
Ensure stability, scalability, and reliability of products and services by implementing SRE best practices, building automation, and managing incidents.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Standard platforms, automation tools, and reliability solutions for product engineering teams
Domain
Enterprise Software / Cloud Infrastructure
Deliverable
production ML models | product features | infrastructure
Required skills
SRE best practices (SLOs, error budgeting), capacity planning, root cause analysis, incident management, system design, automation scripting (Python, Java, Shell), infrastructure as code (Terraform, Ansible, Chef, Puppet), containerization (Docker, Kubernetes), middleware support (databases, MQ, Kafka), observability (Datadog, Splunk), AWS
Preferred skills
None explicitly stated
Technologies
Datadog, Splunk, Python, Java, Shell, Terraform, Chef, Puppet, SQL, Ansible, AWS, Docker, Kubernetes, Kafka, MQ
Responsibilities
Implement SRE best practices including error budgeting and SLOs; build automation tools for platform efficiency; perform capacity planning and system design; troubleshoot complex issues and provide root cause analysis; participate in incident response calls; collaborate with developers on reliability requirements; conduct post-mortem analyses; manage vulnerabilities and End-of-life processes; oversee team initiatives and technical decisions; mentor team members; advocate for SRE practices across the Enterprise Platform team.
Seniority
Senior, hands-on IC with team leadership responsibilities